Сжатие LLM через физическую модель: точность выше даже при удалении половины блоков
Физики применили модель магнетизма для сжатия нейросетей, сохранив качество ответов Llama-3.3-70B на уровне 76.9 при удалении половины блоков, тогда как стандартные методы показали лишь 54.0. Это позволяет бизнесу резко снизить затраты на вычисления и память GPU без потери точности моделей.
Команда Multiverse Computing предложила новый метод ускорения работы больших языковых моделей (LLM). Вместо подбора блоков для удаления вручную, инженеры использовали математический аппарат из физики конденсированного состояния — оптимизацию системы Изинга. Это позволило найти комбинации «ненужных» слоев нейросети, которые при их удалении минимально влияют на качество ответов модели.
Подход особенно эффективен при глубоком сжатии. На тесте Llama-3.3-70B-Instruct после удаления половины блоков (40 из 80) метод показал результат 76.9 в бенчмарке MMLU, тогда как лучший альтернативный алгоритм упал до 54.0. Разница составила почти 23 процентных пункта.
Почему стандартные методы не работают
Большинство существующих техник сжатия оценивают каждый слой нейросети по отдельности. Если слой кажется «слабым», его удаляют. Но в реальности слои связаны между собой: удаление одного может компенсироваться или усиливаться удалением другого. Это похоже на магнит, где состояние каждого атома зависит от соседей.
Стандартные подходы игнорируют эти связи (в физике это называется «среднепольное приближение»). Из-за этого при агрессивном сжатии качество модели резко падает. Метод Multiverse учитывает все взаимовлияния, превращая задачу выбора блоков в поиск состояния с минимальной «энергией».
Как устроен алгоритм
Процесс сводится к нескольким шагам:
- Дискретизация: Каждому блоку присваивается бинарная переменная (0 — оставить, 1 — удалить).
- Расчет связей: С помощью вычислений на небольшом наборе данных строится матрица, описывающая, как удаление одного блока влияет на другие.
- Оптимизация: Задача решается как поиск конфигурации с минимальной энергией системы. Для этого используются классические и квантово-вдохновленные алгоритмы (например, табу-поиск или отжиг).
Главное преимущество — скорость. После первичного расчета связей проверка любой новой комбинации блоков занимает секунды, без необходимости прогонять всю модель через тесты.
Энергетический минимум системы не всегда соответствует идеальному результату. Часто лучшее решение находится среди «возбужденных состояний» (вторых и третьих по энергии вариантов), что позволяет обойти типичные ошибки эвристических методов, которые ищут только один глобальный оптимум.
Результаты на разных моделях
Метод протестировали на нескольких архитектурах, включая гибридные модели с разными типами слоев (внимание, Mamba2, MoE).
| Модель | Удалено блоков | Результат CBO (MMLU) | Результат базового метода (MMLU) |
|---|---|---|---|
| Llama-3.3-70B-Instruct | 32 из 80 | 76.6 | 59.3 |
| Llama-3.3-70B-Instruct | 40 из 80 | 76.9 | 54.0 |
| Qwen3-14B | 12 из 40 | Преимущество ~10 пунктов | - |
При легком сжатии (удаление небольшого числа блоков) разрыв между методами невелик. Однако при удалении более 40% глубины модели преимущество физического подхода становится решающим.
Практическое значение для бизнеса
- Снижение затрат на инференс: Удаление блоков уменьшает объем данных, которые нужно обрабатывать на каждом запросе, и экономит оперативную память GPU. Это напрямую снижает стоимость обслуживания API.
- Совместимость с другими техниками: Метод не конкурирует с квантованием (снижением точности чисел) или дистилляцией, а дополняет их. Их можно применять последовательно для максимального ускорения.
- Универсальность: Алгоритм работает не только с классическими трансформерами, но и с гибридными архитектурами, где слои разного типа чередуются. Это важно для новых моделей, использующих механизмы вроде Mixture-of-Experts (MoE).
Код метода открыт на GitHub, что позволяет разработчикам интегрировать его в собственные пайплайны оптимизации ИИ-моделей без необходимости повторного обучения с нуля.
Подтверждение: huggingface.co