Июль 2026   |   В фокусе

Moonshot AI открыла веса модели Kimi K3 — развертывание на 8 узлах с памятью 1,4 ТБ

Открытый релиз модели Kimi K3 с 2,8 трлн параметров снижает требования к памяти в четыре раза, делая развертывание ИИ уровня GPT-5.6 доступным для компаний с кластерами из 8–16 видеокарт. Это меняет экономику больших языковых моделей, но требует пересмотра подходов к тонкой настройке и инфраструктуре из-за жестких ограничений квантования.

Компания Moonshot AI 16 июля 2026 года представила модель Kimi K3 с 2,8 трлн параметров, а полный набор весов для открытого использования обещает выпустить 27 июля. Это первый в истории открытый проект класса 3 трлн параметров, который благодаря квантованию MXFP4 требует для хранения всего 1,4 ТБ памяти вместо привычных 5,6 ТБ. Такой шаг делает развертывание модели уровня GPT-5.6 доступным для организаций, обладающих кластерами из 8–16 узлов с видеокартами H100 или B200, и меняет экономику работы с большими языковыми моделями.

Архитектура и технические решения

Разработчики внедрили несколько ключевых изменений, которые позволили повысить эффективность масштабирования в 2,5 раза по сравнению с предыдущей версией. Вместо стандартного внимания, требующего огромных вычислительных ресурсов, модель использует гибридный механизм Kimi Delta Attention (KDA). Он снижает затраты на обработку контекста в 1 млн токенов, сохраняя точность в критически важных слоях.

Для управления 896 экспертами в архитектуре MoE (Mixture-of-Experts) применена система Stable LatentMoE. Она активирует только 16 экспертов на один токен, распределяя нагрузку через механизм Quantile Balancing. Дополнительно модель использует:

  • Attention Residuals (AttnRes): Позволяет слоям выбирать данные из любых предыдущих уровней, а не накапливать их последовательно.
  • Специализированные оптимизаторы: Настройка скорости обучения для каждого заголовка внимания отдельно.
  • Кастомная функция активации SiTU: Замена стандартных GeLU/SwiGLU для повышения эффективности.

Важный нюанс: Обучение с учетом квантования (QAT) происходит на этапе дообучения, а не после него. Это означает, что модель «учится» компенсировать потери точности от сжатия данных в процессе тренировки, что предотвращает падение качества, характерное для обычного пост-обработки.

Экономика развертывания и требования к железу

Формат весов MXFP4 (4-битное плавающее число с масштабированием по блокам) и активаций MXFP8 критически важен для практического внедрения. Он снижает требования к памяти в 4 раза по сравнению с форматом FP16. Это открывает возможность для самостоятельного хостинга модели, но накладывает жесткие требования к инфраструктуре.

Для загрузки модели в память необходимо минимум 1,4 ТБ. Реалистичный сценарий развертывания требует кластера из 8 узлов, где каждый узел оснащен 8 видеокартами с памятью 80 ГБ (итого 5,12 ТБ). Такая конфигурация оставляет запас для кэша и промежуточных активаций. Формат MXFP4 нативно поддерживается ускорителями NVIDIA Blackwell и AMD MI400, что упрощает выбор оборудования.

Для обслуживания используется инфраструктура Mooncake, разделяющая процессы предзаполнения контекста и декодирования. Это позволяет достичь 90% попадания в кэш для задач по написанию кода и установить цену на кэшированные входные данные на уровне $0,30 за миллион токенов.

Результаты тестирования и сравнение

В бенчмарках Kimi K3 демонстрирует результаты, сопоставимые с закрытыми лидерами рынка, такими как GPT-5.6 Sol и Claude Fable 5 Max.

ТестKimi K3GPT-5.6 SolClaude Fable 5 MaxПримечание
GDPval-AA v21 6871 747,81 815Общий интеллект
GPQA-Diamond93,5Сложные задачи
MathVision94,3Математика и зрение
Terminal-Bench88,388,8На 0,5 балла ниже лидера
Program Bench77,8Лучший общий результат
SWE Marathon42,0Лучший общий результат

Модель лидирует в тестах на длительное программирование (SWE Marathon, Program Bench), что связано с возможностью обрабатывать контекст в 1 млн токенов. Это позволяет модели «понимать» весь репозиторий кода целиком, а не фрагментарно.

Ограничения и риски для внедрения

Несмотря на высокие показатели, разработчики указывают на три зоны риска, которые необходимо учитывать при интеграции:

  1. Чувствительность к истории мыслей: Если система обрезает или модифицирует цепочку рассуждений модели, качество ответов резко падает.
  2. Избыточная проактивность: В неясных ситуациях модель склонна действовать самостоятельно, а не запрашивать уточнения. Это особенность архитектуры MoE, где эксперты могут быть «переобучены» на данные, ориентированные на действие.
  3. Пользовательский опыт: В субъективных тестах на естественность диалога модель пока уступает Claude Fable 5 и GPT-5.6 Sol.

Операционные последствия, тренды и практические аспекты

  • Порог входа в инфраструктуру: Для самостоятельного развертывания Kimi K3 организациям потребуется не просто одна мощная видеокарта, а готовый кластер из 8–16 узлов. Это делает модель доступной для средних и крупных предприятий, но недоступной для одиночных разработчиков или малых команд без доступа к облачным ресурсам.
  • Сложность настройки фреймворков: Стандартные инструменты инференса (vLLM, TensorRT-LLM) потребуют доработок для корректной маршрутизации 896 экспертов. Без патчей система может не справиться с логикой выбора активных слоев.
  • Риски при дообучении: Использование уже сжатой модели MXFP4 в качестве базы для адаптеров (LoRA/QLoRA) создает новые технические вызовы. Разработчикам придется пересматривать подходы к тонкой настройке, так как традиционные методы могут не работать с квантованными весами.
  • Возможность оптимизации: Открытость весов позволяет исследователям тестировать гипотезы о сокращении числа экспертов (например, до 256 или 128) для развертывания на менее мощном оборудовании, что может стать путем к созданию более легких версий модели.

Коротко о главном

Как гибридный механизм Kimi Delta Attention (KDA) влияет на обработку контекста?

Замена стандартного внимания на KDA позволила снизить затраты на обработку контекста в 1 млн токенов, сохранив при этом точность в критически важных слоях и повысив эффективность масштабирования в 2,5 раза.

Зачем в архитектуре MoE используется система Stable LatentMoE с 896 экспертами?

Данная система активирует только 16 экспертов на один токен и распределяет нагрузку через механизм Quantile Balancing, что предотвращает перегрузку ресурсов при работе с огромным количеством специализированных модулей.

Как обучение с учетом квантования (QAT) предотвращает падение качества модели?

Поскольку QAT происходит на этапе дообучения, модель учится компенсировать потери точности от сжатия данных в процессе тренировки, избегая проблем, характерных для обычной пост-обработки.

Какие требования к инфраструктуре необходимы для реалистичного развертывания Kimi K3?

Для загрузки модели в память и обеспечения запаса под кэш требуется кластер из 8 узлов, где каждый оснащен 8 видеокартами с памятью 80 ГБ, что в сумме дает 5,12 ТБ доступной памяти.

Почему Kimi K3 лидирует в тестах на длительное программирование SWE Marathon и Program Bench?

Способность обрабатывать контекст в 1 млн токенов позволяет модели анализировать весь репозиторий кода целиком, а не фрагментарно, что дает преимущество в сложных задачах разработки.

Какие риски возникают при использовании модели в неясных ситуациях?

Из-за особенностей архитектуры MoE, где эксперты могут быть переобучены на данные, ориентированные на действие, модель склонна проявлять избыточную проактивность и действовать самостоятельно вместо запроса уточнений.

Почему стандартные инструменты инференса потребуют доработок для работы с Kimi K3?

Без специальных патчей системы не справятся с корректной маршрутизацией 896 экспертов, так как текущие фреймворки не поддерживают сложную логику выбора активных слоев в этой конфигурации.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); ПО и разработка; Передовые технологии

Материалы по теме