Hugging Face представила метод Trimming: модели ИИ сжались на 80% без потери качества
Команда Hugging Face создала метод trimming, позволяющий сократить размер моделей ИИ на 80% за 9 минут на обычном процессоре без потери качества. Это дает бизнесу возможность запускать тяжелые нейросети на дешевом «железе» и создавать специализированные версии под конкретные языки, экономя миллионы на вычислительных мощностях.
Команда исследователей из Hugging Face представила детальное руководство по методу trimming (обрезка словаря) для искусственного интеллекта. Эта техника позволяет уменьшить размер моделей ИИ, удаляя ненужные элементы словаря, и работает даже на обычном процессоре без необходимости дообучения. В рамках исследования было создано 5 526 новых моделей, демонстрирующих, что сокращение словаря до кратных чисел (например, 16 384 или 32 768 токенов) может снизить количество параметров на 20–80%, сохраняя при этом производительность.
Важный нюанс: Метод работает только для моделей, где слой эмбеддингов является последним в архитектуре. Если над ним есть дополнительные слои, как в некоторых моделях embeddinggemma, эффективность резко падает.
Как работает упрощение архитектуры
Суть метода заключается в удалении из модели токенов, которые не используются в целевом языке или не нужны для оптимизации вычислений. В отличие от классического прунинга (прореживания), который удаляет веса внутри нейросети, trimming работает исключительно со словарем. Это меняет размер входного и выходного слоев, но оставляет «мозг» модели (трансформерные блоки) нетронутым.
Подход решает две основные задачи:
- Создание моноязычных версий: Из многоязычной модели можно оставить только нужные языки, удалив остальные.
- Оптимизация под «железо»: Размер словаря часто делают кратным 8 или 64 для ускорения работы на видеокартах. Старые модели часто имеют «неудобные» размеры словаря, что замедляет их работу.
На примере модели GPT2-small сокращение словаря с 50 257 до 32 768 токенов уменьшило общее количество параметров на 10,79%. Для более крупных моделей с огромными словарями этот эффект может быть значительно сильнее.
Результаты для моделей встраивания (Embedding)
Исследователи протестировали метод на пяти популярных семействах моделей встраивания текста: granite-embedding, multilingual-e5, embeddinggemma, bge-m3 и Qwen3-Embedding. Тесты проводились на английском и нидерландском языках.
В большинстве случаев сокращенные модели показали результаты, сопоставимые с оригинальными, а в 5 из 8 случаев версия с 32 768 токенами даже превзошла исходник. Это объясняется тем, что удаление «шумных» токенов может улучшить фокус модели.
| Модель | Параметры (оригинал) | Параметры (после trimming) | Снижение параметров |
|---|---|---|---|
| granite-embedding-107m | 107.0M | 17.3M | 83.84% |
| multilingual-e5-small | 117.7M | 27.9M | 76.26% |
| multilingual-e5-large | 559.9M | 320.7M | 42.7% |
| bge-m3 | 567.8M | 328.5M | 42.14% |
| Qwen3-Embedding-0.6B | 595.8M | 457.2M | 23.25% |
Для нидерландского языка было замечено, что если после обрезки провести дообучение (fine-tuning) на небольшом наборе данных (950 000 примеров), качество может вырасти на 2.5–3.1 балла по сравнению с оригиналом.
Стоит учесть: Если модель показывает небольшое падение качества после обрезки, достаточно провести быстрое дообучение. Поскольку модель стала меньше, обучение займет меньше времени, и при том же бюджете вычислений можно «показать» ей больше данных, чем оригинальной версии.
Сравнение с обучением с нуля и дистилляцией
Исследование сравнило обрезанные модели с двумя альтернативами: моделями, обученными с нуля для конкретного языка, и моделями, полученными методом дистилляции (сжатия знаний).
- Обучение с нуля: Моноязычная модель, обученная с нуля (например, ModernCamemBERT для французского), всегда превосходит обрезанную многоязычную версию. Однако создание такой модели требует огромных ресурсов и времени.
- Дистилляция: Метод дистилляции (как в случае с DistilBERT) требует дней работы на мощных видеокартах. В то же время, trimming позволяет получить модель с аналогичным количеством параметров за 8–9 минут на обычном процессоре.
Для модели mmBERT-small обрезка до 54.8M параметров дала результаты лучше, чем у DistilBERT (67M параметров), при этом новая модель поддерживает контекст в 8 192 токенов против 512 у дистиллированной версии.
Практика для моделей-генераторов и переводчиков
Метод применим и к более сложным архитектурам: кодировщикам-декодировщикам (encoder-decoder) и декодерам (LLM).
- Перевод и генерация вопросов: Для моделей mT5 и mBART обрезка словаря позволила создать специализированные версии для пар языков (например, арабский-немецкий). При равном времени обучения обрезанная модель показала прирост качества перевода на 1.76 балла BLEU.
- Большие языковые модели (LLM): Тесты на Granite 4.0, Qwen 3, Gemma 3 и SmolLM3 показали, что для большинства моделей качество генерации остается в пределах доверительного интервала оригинала. Исключением стали модели Qwen3, где наблюдается систематическое падение качества, вероятно, из-за специфики задачи MMLU.
Сокращение словаря для Gemma-3-270m позволило уменьшить количество параметров с 268.1M до 60.8M (снижение на 58.67%), сохранив работоспособность.
Важный нюанс: Порядок действий критичен. Модель нужно сначала обрезать, а затем дообучать. Если дообучить оригинал, а потом обрезать, производительность может рухнуть.
Операционные последствия и практические аспекты
- Требования к инфраструктуре: Процесс обрезки не требует видеокарт. Весь цикл (поиск токенов, изменение архитектуры, сохранение) выполняется на обычном процессоре (например, Intel Core Ultra 7) за 9–22 минуты в зависимости от размера исходной модели.
- Данные для поиска токенов: Для качественного подбора словаря достаточно 20 000–200 000 текстов на целевом языке. Источником данных может служить как общий корпус (Leipzig Corpora), так и специализированные наборы (Fineweb 2). Количество текстов влияет на время обработки, но не на итоговое качество модели.
- Риски применения: Метод не универсален. Он не сработает для моделей, где над слоем эмбеддингов находятся дополнительные плотные слои (dense layers). В таких случаях (например, некоторые версии embeddinggemma) наблюдается деградация качества.
- Альтернатива дообучению: Если моноязычной модели для нужного языка не существует, trimming предлагает быстрый способ создать её из многоязычного аналога, экономя время и вычислительные ресурсы по сравнению с обучением с нуля.
Исследователи уже разместили коллекции готовых моделей на платформе Hugging Face, включая версии для 124 языков для модели mmBERT и 119 языков для multilingual-e5. Это позволяет разработчикам сразу использовать оптимизированные решения без проведения собственных экспериментов.
Источник: huggingface.co