LightOn AI сжимает индексы ColBERT в 5 раз с сохранением 99,4% точности
Сжатие поисковых индексов в пять раз без потери точности обесценивает текущие модели затрат на хранение векторных баз. Бизнес получает возможность радикально снизить расходы на инфраструктуру, сохраняя качество выдачи на уровне 99,4%.
Команда LightOn AI представила метод, позволяющий сжимать индексы поисковых моделей ColBERT в 5 раз с сохранением 99,4% точности поиска. Технология базируется на комбинации иерархического объединения токенов и специальной регуляризации, которая «учит» модель заранее группировать схожие данные. Это решает главную проблему моделей позднего взаимодействия: они хранят вектор для каждого слова, что делает хранение миллионов документов дорогим. Теперь бизнес может радикально сократить затраты на инфраструктуру, не жертвуя качеством выдачи.
Важный нюанс: Метод работает за счет того, что модель учится концентрировать смысл документа в меньшем числе измерений, делая избыточность данных полезной для сжатия, а не помехой.
Механика работы иерархического объединения
Модели типа ColBERT хранят по одному вектору на каждый токен документа. Для текста из 300 слов это 300 векторов. Иерархическое объединение (hierarchical pooling) решает задачу слияния похожих векторов в один. Алгоритм строит дерево кластеров внутри документа и последовательно объединяет самые близкие группы токенов до достижения целевого бюджета.
Ранее этот метод позволял сократить объем данных вдвое без потерь. При более агрессивном сжатии (до 32 токенов на документ) качество падало до 77% от исходного уровня. Новая работа показывает, как преодолеть этот барьер.
Стоит учесть: Простое сжатие без предварительной подготовки модели приводит к потере смысла, так как алгоритм не понимает, какие токены действительно можно объединить без ущерба для поиска.
Регуляризация для сжатия
Ключевое открытие заключается в применении регуляризации на основе прямого сквозного оценщика (STE). Этот прием, ранее использовавшийся для других задач, был адаптирован под сжатие. Суть метода:
- Во время обучения модель получает сигнал о том, как сжатие влияет на качество поиска.
- Градиент проходит через операцию кластеризации, заставляя модель формировать такие векторы, которые легко сжимаются.
- Модель учится «говорить» то же самое, используя меньше независимых направлений в пространстве векторов.
Даже без специальной дообучки под сжатие, применение базовой регуляризации (MUVERA) повысило качество сжатия с 77,1% до 88,3%. Добавление целевой регуляризации под иерархическое объединение довело этот показатель до 97,9% при сжатии до 32 токенов.
Сравнение стратегий обучения
Исследователи протестировали два подхода к обучению: универсальный и целевой.
| Стратегия обучения | Описание | Результат (Retention @ 32 токена) |
|---|---|---|
| Мультибюджетная | Модель учится сжимать до разных размеров (от 4 до 300 токенов) | 95,8% |
| Целевая | Модель учится только под конкретный размер (32 токена) | 97,4% |
Целевое обучение дает лучший результат на заданном уровне сжатия, но лишает гибкости. Мультибюджетный подход позволяет использовать одну модель для разных сценариев, что удобно, если требования к сжатию могут меняться.
На фоне этого: Если бизнес точно знает свои требования к хранению, целевое обучение даст максимальную эффективность. Если нужна универсальность — лучше выбрать мультибюджетный вариант.
Адаптивное распределение бюджета
Не все документы одинаково сложны для сжатия. Тексты с повторами легко сжимаются, а документы с разнородной информацией — нет. Фиксированное сжатие до 32 токенов для всех документов неэффективно: оно «пересжимает» сложные тексты и «недожимает» простые.
Адаптивный метод решает эту проблему, перераспределяя бюджет токенов:
- Простые документы сжимаются сильнее, освобождая место.
- Сложные документы получают больше токенов для сохранения смысла.
- Общий объем хранилища остается прежним.
Сочетание целевого обучения и адаптивного бюджета позволило достичь 99,4% сохранения качества при 5-кратном сжатии. Это практически полная сохранность информации.
Практические выводы для внедрения
Операционные последствия и условия реализации
- Снижение затрат на хранение: Компании могут сократить объем данных в индексе в 5 раз без потери качества поиска. Это напрямую уменьшает расходы на дисковое пространство и ускоряет работу с памятью.
- Гибкость развертывания: Использование мультибюджетной модели позволяет менять степень сжатия на лету, подстраиваясь под текущую нагрузку или доступные ресурсы, без переобучения.
- Зависимость от типа контента: Адаптивное сжатие критически важно для разнородных коллекций документов. В однородных базах данных фиксированное сжатие может быть достаточным, но в смешанных сценариях адаптивный подход дает прирост до 2% точности.
- Условия успеха: Метод требует этапа дообучения (fine-tuning) с использованием специальной функции потерь. Простое применение алгоритма сжатия к уже обученной модели без регуляризации не даст заявленных результатов.
Важный нюанс: Технология не требует изменения архитектуры поиска, она работает на уровне подготовки индекса, что упрощает интеграцию в существующие системы.
Контекст и последствия
Исследование подтверждает, что пространство векторов в моделях ColBERT имеет меньшую эффективную размерность, чем кажется. Это свойство можно использовать для различных методов сжатия. Авторы отмечают, что идея регуляризации под сжатие была независимо исследована Стефаном Йозефом (Stefan Josef), а представленная работа масштабирует этот подход на большие данные.
Результаты демонстрируют, что современные методы сжатия могут быть практически безпотерьными. Это меняет экономику внедрения векторных баз данных: высокая точность поиска больше не требует огромных затрат на инфраструктуру. Для рынка это сигнал о том, что барьер входа для использования продвинутых поисковых моделей снижается.
Источник: huggingface.co