Multiverse Computing представила QAH — сжатие ИИ-моделей до 4 бит без потери точности
Multiverse Computing представила метод QAH, который делает сжатые 4-битные ИИ-модели точнее своих полноразмерных аналогов. Это меняет правила игры: теперь квантование превращается в инструмент для создания более дешевых и производительных решений, а не в причину потери качества.
Команда Multiverse Computing представила методику Quantization-Aware Healing (QAH), которая позволяет создавать компактные модели искусственного интеллекта, превосходящие по точности свои полноразмерные аналоги. Обычно уменьшение размера нейросети ведет к потере качества: сжатие архитектуры и квантование весов до 4 бит снижают способности модели к логическому рассуждению, решению математических задач и генерации кода. Чтобы компенсировать эти потери, в индустрии применяют этап восстановления, или «лечения» (healing), перед запуском модели в продакшн.
Новый подход меняет привычную логику: вместо того чтобы восстанавливать модель до исходного состояния, QAH использует квантование как дополнительный инструмент обучения. В результате 4-битная версия становится меньше, дешевле в эксплуатации и точнее, чем оригинальный чекпоинт с 16-битным разрешением. Это переворачивает стандартное представление о зависимости между размером модели и ее производительностью.
Механизм работы QAH
Традиционные методы лечения, такие как квантование-осознанная дистилляция (QAD), часто дают сбой после структурного сжатия. Проблема в том, что для восстановления нужен «учитель» — полноразмерная версия модели. Но если архитектура уже урезана (удалены слои или нейроны), независимой полной версии этой конкретной структуры не существует. Единственный доступный источник данных — восстановленный 16-битный чекпоинт, который сам по себе является приблизительной копией оригинала. Дистилляция из него ограничивает точность ученика уровнем этого посредника.
QAH решает эту проблему, дистиллируя знания непосредственно из исходной модели до сжатия. Учитель и ученик не обязаны иметь одинаковую архитектуру: учитель работает в полном размере и разрешении, а ученик вдвое меньше и функционирует в формате MXFP4. Передача знаний происходит через распределение выходов (логитов) с использованием дивергенции Кульбака-Лейблера. Такой подход позволяет 4-битной модели получать информацию, которую более ранний этап восстановления не успел или не смог передать.
Дополнительным преимуществом является стабильность обучения. Поскольку модель привязана к фиксированному распределению учителя, она не «дрейфует» после достижения пика производительности. В отличие от стандартных методов, которые могут деградировать при длительном обучении, QAH сохраняет достигнутый уровень качества.
Результаты тестирования и практическая ценность
Испытания проводились на модели GPT-OSS 120B, сжатой до 60 млрд параметров и квантованной до MXFP4. Сравнение показало, что новая методика превзошла исходный 16-битный чекпоинт в 7 из 9 тестовых задач. Наибольший прирост наблюдался в задачах с длинным контекстом (+7.4 балла) и математике (+5.6 балла), которые традиционно сильнее всего страдают от компрессии.
| Бенчмарк | 120B учитель (MXFP4) | 60B BF16 (восстановленный) | 60B MXFP4 (QAH) | Преимущество QAH над BF16 |
|---|---|---|---|---|
| AA-LCR (длинный контекст) | 50.0 | 35.3 | 42.7 | +7.4 |
| AIME 2025 (математика) | 80.0 | 70.7 | 76.3 | +5.6 |
| LiveCodeBench (кодирование) | 66.0 | 65.5 | 66.5 | +1.0 |
Сравнение с исходным 120-миллиардным учителем также показало интересный результат: компактная 4-битная модель превзошла его по генерации кода (LiveCodeBench) и уступила менее чем на 2 балла в научных задачах. При этом она требует примерно в 4 раза меньше памяти для весов и вдвое меньше вычислительных ресурсов на токен.
С точки зрения практического внедрения, QAH демонстрирует более высокую стабильность, чем альтернативный метод QAT (квантование-осознанное обучение). QAH достигает пиковой производительности примерно в 7 раз быстрее и не теряет качества при продолжении обучения. Это снижает риски для бизнеса: модели, обученные по схеме QAH, можно безопасно запускать в эксплуатацию без сложного мониторинга деградации точности. Для индустрии это сигнал о том, что квантование перестает быть налогом на эффективность и становится инструментом для создания более дешевых и одновременно мощных ИИ-решений.
Метод QAH делает сжатые ИИ-модели точнее оригиналов и дешевле в эксплуатации
Команда Multiverse Computing представила методику Quantization-Aware Healing (QAH), которая ломает базовый принцип работы нейросетей: уменьшение размера модели не всегда ведет к потере качества. В традиционной практике квантование весов до 4 бит и урезание архитектуры воспринимаются как компромисс, требующий этапа «лечения» для возврата точности. QAH меняет логику: сжатие становится инструментом обучения, а не источником потерь. В результате 4-битная версия модели оказывается точнее своего исходного 16-битного прототипа.
Как работает «лечение» без посредников
Ключевая проблема старых методов дистилляции — зависимость от «учителя». Если архитектура модели уже урезана, полноценной копии для сравнения не существует. Приходится использовать промежуточные версии, которые сами по себе являются приближенными копиями оригинала. Это создает эффект передачи искажений: ученик не может стать лучше своего посредника.
QAH решает проблему через прямую связь с исходной моделью до сжатия. Учитель работает в полном разрешении, а ученик — в формате MXFP4 (4 бита). Передача знаний происходит через сравнение распределений выходов (логитов) с использованием дивергенции Кульбака-Лейблера. Это позволяет компактной модели «дотянуться» до информации, которую стандартные этапы восстановления теряли. Дополнительный плюс — стабильность: модель не деградирует при длительном обучении, так как привязана к фиксированному распределению учителя.
Сжатие перестает быть налогом на эффективность и становится инструментом для создания более дешевых и одновременно мощных ИИ-решений.
Экономика внедрения и риски
Тесты на базе GPT-OSS 120B показали, что сжатая до 60 млрд параметров модель в формате MXFP4 превзошла исходный чекпоинт в 7 из 9 задач. Наибольший прирост — в математике (+5.6 балла) и работе с длинным контекстом (+7.4 балла). При этом требования к памяти для весов снизились примерно в 4 раза, а вычислительная нагрузка на токен — вдвое.
Для бизнеса это означает снижение операционных расходов без потери (а часто с ростом) качества. Метод QAH достигает пиковой производительности в 7 раз быстрее альтернативного подхода QAT и не требует сложного мониторинга деградации точности после запуска. Это критично для компаний, которые внедряют ИИ в продакшн: риск «тихого» падения качества модели со временем минимизируется.
Однако есть нюанс. Результаты получены на конкретной архитектуре и наборе бенчмарков. Масштабирование метода на другие типы задач или архитектуры может потребовать дополнительной калибровки. Тем не менее, тренд очевиден: гонка за размером модели смещается в сторону оптимизации формата хранения и вычислений. Для российского рынка это сигнал о том, что доступ к мощным ИИ-моделям станет дешевле, но конкуренция за GPU для их обучения и инференса усилится. Компании, которые смогут эффективно использовать методы сжатия, получат преимущество в скорости вывода продукта на рынок при меньших затратах на инфраструктуру.
Источник: huggingface.co