Moonshot AI открыла веса модели Kimi K3 — развертывание на 8 узлах с памятью 1,4 ТБ
Открытый релиз модели Kimi K3 с 2,8 трлн параметров снижает требования к памяти в четыре раза, делая развертывание ИИ уровня GPT-5.6 доступным для компаний с кластерами из 8–16 видеокарт. Это меняет экономику больших языковых моделей, но требует пересмотра подходов к тонкой настройке и инфраструктуре из-за жестких ограничений квантования.
Компания Moonshot AI 16 июля 2026 года представила модель Kimi K3 с 2,8 трлн параметров, а полный набор весов для открытого использования обещает выпустить 27 июля. Это первый в истории открытый проект класса 3 трлн параметров, который благодаря квантованию MXFP4 требует для хранения всего 1,4 ТБ памяти вместо привычных 5,6 ТБ. Такой шаг делает развертывание модели уровня GPT-5.6 доступным для организаций, обладающих кластерами из 8–16 узлов с видеокартами H100 или B200, и меняет экономику работы с большими языковыми моделями.
Архитектура и технические решения
Разработчики внедрили несколько ключевых изменений, которые позволили повысить эффективность масштабирования в 2,5 раза по сравнению с предыдущей версией. Вместо стандартного внимания, требующего огромных вычислительных ресурсов, модель использует гибридный механизм Kimi Delta Attention (KDA). Он снижает затраты на обработку контекста в 1 млн токенов, сохраняя точность в критически важных слоях.
Для управления 896 экспертами в архитектуре MoE (Mixture-of-Experts) применена система Stable LatentMoE. Она активирует только 16 экспертов на один токен, распределяя нагрузку через механизм Quantile Balancing. Дополнительно модель использует:
- Attention Residuals (AttnRes): Позволяет слоям выбирать данные из любых предыдущих уровней, а не накапливать их последовательно.
- Специализированные оптимизаторы: Настройка скорости обучения для каждого заголовка внимания отдельно.
- Кастомная функция активации SiTU: Замена стандартных GeLU/SwiGLU для повышения эффективности.
Важный нюанс: Обучение с учетом квантования (QAT) происходит на этапе дообучения, а не после него. Это означает, что модель «учится» компенсировать потери точности от сжатия данных в процессе тренировки, что предотвращает падение качества, характерное для обычного пост-обработки.
Экономика развертывания и требования к железу
Формат весов MXFP4 (4-битное плавающее число с масштабированием по блокам) и активаций MXFP8 критически важен для практического внедрения. Он снижает требования к памяти в 4 раза по сравнению с форматом FP16. Это открывает возможность для самостоятельного хостинга модели, но накладывает жесткие требования к инфраструктуре.
Для загрузки модели в память необходимо минимум 1,4 ТБ. Реалистичный сценарий развертывания требует кластера из 8 узлов, где каждый узел оснащен 8 видеокартами с памятью 80 ГБ (итого 5,12 ТБ). Такая конфигурация оставляет запас для кэша и промежуточных активаций. Формат MXFP4 нативно поддерживается ускорителями NVIDIA Blackwell и AMD MI400, что упрощает выбор оборудования.
Для обслуживания используется инфраструктура Mooncake, разделяющая процессы предзаполнения контекста и декодирования. Это позволяет достичь 90% попадания в кэш для задач по написанию кода и установить цену на кэшированные входные данные на уровне $0,30 за миллион токенов.
Результаты тестирования и сравнение
В бенчмарках Kimi K3 демонстрирует результаты, сопоставимые с закрытыми лидерами рынка, такими как GPT-5.6 Sol и Claude Fable 5 Max.
| Тест | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 Max | Примечание |
|---|---|---|---|---|
| GDPval-AA v2 | 1 687 | 1 747,8 | 1 815 | Общий интеллект |
| GPQA-Diamond | 93,5 | — | — | Сложные задачи |
| MathVision | 94,3 | — | — | Математика и зрение |
| Terminal-Bench | 88,3 | 88,8 | — | На 0,5 балла ниже лидера |
| Program Bench | 77,8 | — | — | Лучший общий результат |
| SWE Marathon | 42,0 | — | — | Лучший общий результат |
Модель лидирует в тестах на длительное программирование (SWE Marathon, Program Bench), что связано с возможностью обрабатывать контекст в 1 млн токенов. Это позволяет модели «понимать» весь репозиторий кода целиком, а не фрагментарно.
Ограничения и риски для внедрения
Несмотря на высокие показатели, разработчики указывают на три зоны риска, которые необходимо учитывать при интеграции:
- Чувствительность к истории мыслей: Если система обрезает или модифицирует цепочку рассуждений модели, качество ответов резко падает.
- Избыточная проактивность: В неясных ситуациях модель склонна действовать самостоятельно, а не запрашивать уточнения. Это особенность архитектуры MoE, где эксперты могут быть «переобучены» на данные, ориентированные на действие.
- Пользовательский опыт: В субъективных тестах на естественность диалога модель пока уступает Claude Fable 5 и GPT-5.6 Sol.
Операционные последствия, тренды и практические аспекты
- Порог входа в инфраструктуру: Для самостоятельного развертывания Kimi K3 организациям потребуется не просто одна мощная видеокарта, а готовый кластер из 8–16 узлов. Это делает модель доступной для средних и крупных предприятий, но недоступной для одиночных разработчиков или малых команд без доступа к облачным ресурсам.
- Сложность настройки фреймворков: Стандартные инструменты инференса (vLLM, TensorRT-LLM) потребуют доработок для корректной маршрутизации 896 экспертов. Без патчей система может не справиться с логикой выбора активных слоев.
- Риски при дообучении: Использование уже сжатой модели MXFP4 в качестве базы для адаптеров (LoRA/QLoRA) создает новые технические вызовы. Разработчикам придется пересматривать подходы к тонкой настройке, так как традиционные методы могут не работать с квантованными весами.
- Возможность оптимизации: Открытость весов позволяет исследователям тестировать гипотезы о сокращении числа экспертов (например, до 256 или 128) для развертывания на менее мощном оборудовании, что может стать путем к созданию более легких версий модели.
Источник: huggingface.co