Июль 2026   |   В фокусе

Hugging Face представила метод Trimming: модели ИИ сжались на 80% без потери качества

Команда Hugging Face создала метод trimming, позволяющий сократить размер моделей ИИ на 80% за 9 минут на обычном процессоре без потери качества. Это дает бизнесу возможность запускать тяжелые нейросети на дешевом «железе» и создавать специализированные версии под конкретные языки, экономя миллионы на вычислительных мощностях.

Команда исследователей из Hugging Face представила детальное руководство по методу trimming (обрезка словаря) для искусственного интеллекта. Эта техника позволяет уменьшить размер моделей ИИ, удаляя ненужные элементы словаря, и работает даже на обычном процессоре без необходимости дообучения. В рамках исследования было создано 5 526 новых моделей, демонстрирующих, что сокращение словаря до кратных чисел (например, 16 384 или 32 768 токенов) может снизить количество параметров на 20–80%, сохраняя при этом производительность.

Важный нюанс: Метод работает только для моделей, где слой эмбеддингов является последним в архитектуре. Если над ним есть дополнительные слои, как в некоторых моделях embeddinggemma, эффективность резко падает.

Как работает упрощение архитектуры

Суть метода заключается в удалении из модели токенов, которые не используются в целевом языке или не нужны для оптимизации вычислений. В отличие от классического прунинга (прореживания), который удаляет веса внутри нейросети, trimming работает исключительно со словарем. Это меняет размер входного и выходного слоев, но оставляет «мозг» модели (трансформерные блоки) нетронутым.

Подход решает две основные задачи:

  • Создание моноязычных версий: Из многоязычной модели можно оставить только нужные языки, удалив остальные.
  • Оптимизация под «железо»: Размер словаря часто делают кратным 8 или 64 для ускорения работы на видеокартах. Старые модели часто имеют «неудобные» размеры словаря, что замедляет их работу.

На примере модели GPT2-small сокращение словаря с 50 257 до 32 768 токенов уменьшило общее количество параметров на 10,79%. Для более крупных моделей с огромными словарями этот эффект может быть значительно сильнее.

Результаты для моделей встраивания (Embedding)

Исследователи протестировали метод на пяти популярных семействах моделей встраивания текста: granite-embedding, multilingual-e5, embeddinggemma, bge-m3 и Qwen3-Embedding. Тесты проводились на английском и нидерландском языках.

В большинстве случаев сокращенные модели показали результаты, сопоставимые с оригинальными, а в 5 из 8 случаев версия с 32 768 токенами даже превзошла исходник. Это объясняется тем, что удаление «шумных» токенов может улучшить фокус модели.

МодельПараметры (оригинал)Параметры (после trimming)Снижение параметров
granite-embedding-107m107.0M17.3M83.84%
multilingual-e5-small117.7M27.9M76.26%
multilingual-e5-large559.9M320.7M42.7%
bge-m3567.8M328.5M42.14%
Qwen3-Embedding-0.6B595.8M457.2M23.25%

Для нидерландского языка было замечено, что если после обрезки провести дообучение (fine-tuning) на небольшом наборе данных (950 000 примеров), качество может вырасти на 2.5–3.1 балла по сравнению с оригиналом.

Стоит учесть: Если модель показывает небольшое падение качества после обрезки, достаточно провести быстрое дообучение. Поскольку модель стала меньше, обучение займет меньше времени, и при том же бюджете вычислений можно «показать» ей больше данных, чем оригинальной версии.

Сравнение с обучением с нуля и дистилляцией

Исследование сравнило обрезанные модели с двумя альтернативами: моделями, обученными с нуля для конкретного языка, и моделями, полученными методом дистилляции (сжатия знаний).

  • Обучение с нуля: Моноязычная модель, обученная с нуля (например, ModernCamemBERT для французского), всегда превосходит обрезанную многоязычную версию. Однако создание такой модели требует огромных ресурсов и времени.
  • Дистилляция: Метод дистилляции (как в случае с DistilBERT) требует дней работы на мощных видеокартах. В то же время, trimming позволяет получить модель с аналогичным количеством параметров за 8–9 минут на обычном процессоре.

Для модели mmBERT-small обрезка до 54.8M параметров дала результаты лучше, чем у DistilBERT (67M параметров), при этом новая модель поддерживает контекст в 8 192 токенов против 512 у дистиллированной версии.

Практика для моделей-генераторов и переводчиков

Метод применим и к более сложным архитектурам: кодировщикам-декодировщикам (encoder-decoder) и декодерам (LLM).

  • Перевод и генерация вопросов: Для моделей mT5 и mBART обрезка словаря позволила создать специализированные версии для пар языков (например, арабский-немецкий). При равном времени обучения обрезанная модель показала прирост качества перевода на 1.76 балла BLEU.
  • Большие языковые модели (LLM): Тесты на Granite 4.0, Qwen 3, Gemma 3 и SmolLM3 показали, что для большинства моделей качество генерации остается в пределах доверительного интервала оригинала. Исключением стали модели Qwen3, где наблюдается систематическое падение качества, вероятно, из-за специфики задачи MMLU.

Сокращение словаря для Gemma-3-270m позволило уменьшить количество параметров с 268.1M до 60.8M (снижение на 58.67%), сохранив работоспособность.

Важный нюанс: Порядок действий критичен. Модель нужно сначала обрезать, а затем дообучать. Если дообучить оригинал, а потом обрезать, производительность может рухнуть.

Операционные последствия и практические аспекты

  • Требования к инфраструктуре: Процесс обрезки не требует видеокарт. Весь цикл (поиск токенов, изменение архитектуры, сохранение) выполняется на обычном процессоре (например, Intel Core Ultra 7) за 9–22 минуты в зависимости от размера исходной модели.
  • Данные для поиска токенов: Для качественного подбора словаря достаточно 20 000–200 000 текстов на целевом языке. Источником данных может служить как общий корпус (Leipzig Corpora), так и специализированные наборы (Fineweb 2). Количество текстов влияет на время обработки, но не на итоговое качество модели.
  • Риски применения: Метод не универсален. Он не сработает для моделей, где над слоем эмбеддингов находятся дополнительные плотные слои (dense layers). В таких случаях (например, некоторые версии embeddinggemma) наблюдается деградация качества.
  • Альтернатива дообучению: Если моноязычной модели для нужного языка не существует, trimming предлагает быстрый способ создать её из многоязычного аналога, экономя время и вычислительные ресурсы по сравнению с обучением с нуля.

Исследователи уже разместили коллекции готовых моделей на платформе Hugging Face, включая версии для 124 языков для модели mmBERT и 119 языков для multilingual-e5. Это позволяет разработчикам сразу использовать оптимизированные решения без проведения собственных экспериментов.

Коротко о главном

Почему метод trimming не работает для всех архитектур моделей?

Техника эффективна только если слой эмбеддингов является последним в архитектуре, так как удаление токенов меняет размеры входных и выходных слоев. Если над этим слоем присутствуют дополнительные плотные слои, как в некоторых версиях embeddinggemma, эффективность метода резко падает, что приводит к деградации качества.

Как быстро можно получить оптимизированную модель по сравнению с дистилляцией?

Обрезка словаря позволяет создать модель с аналогичным количеством параметров за 8–9 минут на обычном процессоре, тогда как метод дистилляции требует дней работы на мощных видеокартах. Например, обрезка модели mmBERT-small до 54.8M параметров дала результаты лучше, чем у DistilBERT, и сохранила поддержку контекста в 8 192 токена.

Какой прирост качества возможен при дообучении обрезанных моделей для нидерландского языка?

После обрезки словаря проведение дообучения на наборе из 950 000 примеров позволяет увеличить качество модели на 2.5–3.1 балла по сравнению с оригиналом. Это происходит потому, что удаление «шумных» токенов улучшает фокус модели, а уменьшенный размер ускоряет процесс обучения.

Какие результаты показала обрезка словаря для моделей-переводчиков mT5 и mBART?

Создание специализированных версий для конкретных пар языков (например, арабский-немецкий) позволило увеличить качество перевода на 1.76 балла BLEU при равном времени обучения. Это стало возможным благодаря удалению ненужных для целевой задачи языков из многоязычной модели.

Сколько данных требуется для подбора оптимального словаря и как это влияет на процесс?

Для качественного поиска токенов достаточно от 20 000 до 200 000 текстов на целевом языке, при этом количество данных влияет лишь на время обработки, но не на итоговое качество модели. Весь цикл обрезки выполняется на обычном процессоре за 9–22 минуты, что делает метод доступным без специализированного «железа».

Почему порядок действий при оптимизации критически важен для сохранения производительности?

Модель необходимо сначала обрезать, а затем дообучать, так как обратная последовательность (сначала дообучение оригинала, потом обрезка) может привести к резкому падению производительности. Соблюдение этого алгоритма гарантирует, что упрощенная архитектура корректно адаптируется к новым данным.

Какие готовые решения уже доступны разработчикам на платформе Hugging Face?

Исследователи разместили коллекции оптимизированных моделей для 124 языков на базе mmBERT и для 119 языков на базе multilingual-e5. Это позволяет специалистам сразу использовать готовые моноязычные версии, экономя время и ресурсы, которые потребовались бы для обучения с нуля.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); ПО и разработка; Передовые технологии

Материалы по теме