Июль 2026   |   В фокусе

Moonshot AI открыла модель Kimi K3 с 2,8 трлн параметров и новой архитектурой

Moonshot AI открыла доступ к модели Kimi K3 с рекордными 2,8 триллиона параметров, обещая эффективность масштабирования в 2,5 раза выше предшественника. Это ставит под угрозу монополию закрытых систем и вынуждает бизнес пересматривать стратегии внедрения ИИ, так как теперь мощные инструменты доступны для локального развертывания.

Компания Moonshot AI выпустила модель Kimi K3, ставшую первым открытым решением класса 3 триллиона параметров (точнее 2,8 трлн). Вес модели станут доступны на платформе Hugging Face 27 июля 2026 года. Разработчики обещают, что новая архитектура обеспечивает эффективность масштабирования в 2,5 раза выше, чем у предыдущей версии Kimi K2, за счет отказа от стандартных подходов к вниманию и экспертным системам.

Важный нюанс: Несмотря на рекордные размеры, разработчики честно указывают, что модель все еще уступает самым мощным закрытым решениям, но уверенно лидирует среди всех открытых аналогов.

Архитектурные инновации: как устроена модель

Kimi K3 не является простым увеличением предыдущей версии. В её основе лежат четыре ключевых механизма, меняющих подход к обработке данных:

  • Kimi Delta Attention (KDA): Три из четырех слоев внимания используют линейное внимание с короткими свертками и нормализацией. Это заменяет традиционные квадратичные матрицы, что ускоряет вычисления. Линейное внимание сейчас встречается в 29% новых моделей, тогда как год назад этот показатель был близок к нулю.
  • Gated MLA: Каждый четвертый слой использует полное многоголовое латентное внимание с выходной блокировкой. Это позволяет сохранять глобальный поиск информации без потерь, пока KDA выполняет основную работу.
  • Attention Residuals (AttnRes): Новое решение, позволяющее блокам выборочно извлекать представления из более ранних уровней сети. Это работает как «внимание по глубине», а не только по последовательности токенов.
  • Stable LatentMoE: Модель использует пул из 896 экспертов, активируя одновременно только 16 из них. Это самая большая группа экспертов среди открытых моделей. Балансировка достигается через квантильные оценки, а не вспомогательные потери.

Стоит учесть: Активная доля экспертов в модели составляет всего 1,8%. Это демонстрирует тренд отрасли: пулы экспертов растут, но доля реально работающих в моменте единиц снижается для оптимизации ресурсов.

Результаты тестов и позиционирование на рынке

В таблице из 33 тестовых задач модель заняла первое или совместное первое место в 8 случаях. На остальных позициях Kimi K3 опережает все другие открытые модели и часто находится в нескольких баллах от лучших закрытых систем.

Ключевые показатели эффективности:

  • SWE Marathon: 42,0 балла (на 2 балла выше конкурентов и в 3 раза лучше, чем у GPT 5.5).
  • BrowseComp: 91,2 балла.
  • DeepSearchQA: 95,0 баллов.
  • OmniDocBench: 91,1 балла.

Все результаты получены при максимальных усилиях по рассуждению. Тесты проводились с использованием различных инструментов (KimiCode, Claude Code, Codex), часть данных взята из внешних лидербордов.

На фоне этого: Высокий результат в задаче SWE Marathon указывает на то, что модель способна решать сложные инженерные задачи, где традиционные модели часто ошибаются из-за отсутствия контекста.

Операционные последствия, тренды и практические аспекты

  • Снижение вычислительных затрат: Использование линейного внимания (KDA) вместо квадратичного позволяет обрабатывать контекст в 1 миллион токенов с меньшими затратами памяти и времени, что критично для развертывания на локальных серверах.
  • Рост требований к инфраструктуре: Работа с пулом из 896 экспертов потребует от пользователей более сложной системы маршрутизации запросов и стабильного доступа к вычислительным ресурсам, способным поддерживать высокую степень разреженности.
  • Смена парадигмы в открытых моделях: Появление механизма Attention Residuals (AttnRes) может стать стандартом для следующих поколений моделей, так как он позволяет эффективнее использовать информацию из глубоких слоев сети, что ранее было доступно только в закрытых разработках.
  • Конкурентное давление: Лидерство среди открытых моделей и близость к показателям закрытых систем заставит других поставщиков решений пересмотреть свои архитектуры, чтобы не отстать в гонке за эффективность.

Коротко о главном

Почему Kimi K3 обеспечивает эффективность масштабирования в 2,5 раза выше предшественника?

Разработчики отказались от стандартных подходов к вниманию и экспертным системам, внедрив линейное внимание с короткими свертками, что заменило ресурсоемкие квадратичные матрицы и ускорило вычисления.

Как механизм Stable LatentMoE оптимизирует использование ресурсов модели?

Система активирует одновременно только 16 экспертов из общего пула в 896 единиц, что снижает активную долю до 1,8% и позволяет обрабатывать запросы с высокой степенью разреженности без потери качества.

В чем заключается уникальность механизма Attention Residuals (AttnRes)?

Новый алгоритм позволяет блокам выборочно извлекать представления из более ранних уровней сети, реализуя «внимание по глубине» вместо фокусировки только на последовательности токенов, что ранее было доступно лишь в закрытых разработках.

Какие результаты показала модель в тесте SWE Marathon?

Kimi K3 набрала 42,0 балла, превзойдя конкурентов на 2 балла и показав результат в 3 раза лучше, чем у GPT 5.5, благодаря способности решать сложные инженерные задачи с полным контекстом.

Как внедрение линейного внимания (KDA) влияет на обработку контекста?

Замена квадратичных вычислений на линейные позволяет обрабатывать последовательности до 1 миллиона токенов с меньшими затратами памяти и времени, что критично для развертывания на локальных серверах.

Какие требования к инфраструктуре возникают из-за архитектуры модели?

Работа с пулом из 896 экспертов потребует от пользователей внедрения сложных систем маршрутизации запросов и обеспечения стабильного доступа к вычислительным ресурсам для поддержки высокой разреженности.

Каково текущее позиционирование Kimi K3 среди аналогов?

Модель занимает первое место в 8 из 33 тестовых задач и уверенно лидирует среди всех открытых решений, хотя разработчики признают, что она все еще уступает самым мощным закрытым системам.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); ПО и разработка; Передовые технологии

Материалы по теме