Сжатие моделей ИИ


Сжатие моделей ИИ в новостной повестке, календарь упоминаний и aналитика в реальном времени.

Календарь упоминаний:

2026
26 августа

Метод QAH от Multiverse Computing позволяет сжатым моделям ИИ превосходить по точности полноразмерные аналоги

Команда разработчиков представила методику Quantization-Aware Healing, которая меняет подход к оптимизации нейросетей: вместо компенсации потерь качества после сжатия, алгоритм использует квантование как инструмент дообучения. В результате компактная 4-битная версия модели становится дешевле в эксплуатации и точнее оригинала с 16-битным разрешением, что особенно заметно в задачах на длинный контекст и математику.

Событие: Команда Multiverse Computing представила методику Quantization-Aware Healing (QAH), позволяющую создавать компактные модели, превосходящие по точности полноразмерные аналоги.

Фактор: Традиционные методы восстановления качества после сжатия дают сбой при структурном изменении архитектуры, так как для дистилляции часто требуется полная версия модели, которой в урезанной структуре не существует.

Эффект: Тестирование на базе GPT-OSS 120B показало, что сжатая до 60 млрд параметров и квантованная до MXFP4 модель превзошла исходный чекпоинт в 7 из 9 задач, набрав на +7.4 балла больше в тесте на длинный контекст.

Связь: Использование QAH снижает вычислительные затраты примерно в 2 раза на токен и уменьшает потребление памяти для весов в 4 раза по сравнению с полноразмерной версией, сохраняя при этом высокую точность.

Подробнее →


В нашей базе собрано 1 событие по теме «Сжатие моделей ИИ». Мы показываем все из них.