Moonshot AI открыла модель Kimi K3 с 2,8 трлн параметров и новой архитектурой
Moonshot AI открыла доступ к модели Kimi K3 с рекордными 2,8 триллиона параметров, обещая эффективность масштабирования в 2,5 раза выше предшественника. Это ставит под угрозу монополию закрытых систем и вынуждает бизнес пересматривать стратегии внедрения ИИ, так как теперь мощные инструменты доступны для локального развертывания.
Компания Moonshot AI выпустила модель Kimi K3, ставшую первым открытым решением класса 3 триллиона параметров (точнее 2,8 трлн). Вес модели станут доступны на платформе Hugging Face 27 июля 2026 года. Разработчики обещают, что новая архитектура обеспечивает эффективность масштабирования в 2,5 раза выше, чем у предыдущей версии Kimi K2, за счет отказа от стандартных подходов к вниманию и экспертным системам.
Важный нюанс: Несмотря на рекордные размеры, разработчики честно указывают, что модель все еще уступает самым мощным закрытым решениям, но уверенно лидирует среди всех открытых аналогов.
Архитектурные инновации: как устроена модель
Kimi K3 не является простым увеличением предыдущей версии. В её основе лежат четыре ключевых механизма, меняющих подход к обработке данных:
- Kimi Delta Attention (KDA): Три из четырех слоев внимания используют линейное внимание с короткими свертками и нормализацией. Это заменяет традиционные квадратичные матрицы, что ускоряет вычисления. Линейное внимание сейчас встречается в 29% новых моделей, тогда как год назад этот показатель был близок к нулю.
- Gated MLA: Каждый четвертый слой использует полное многоголовое латентное внимание с выходной блокировкой. Это позволяет сохранять глобальный поиск информации без потерь, пока KDA выполняет основную работу.
- Attention Residuals (AttnRes): Новое решение, позволяющее блокам выборочно извлекать представления из более ранних уровней сети. Это работает как «внимание по глубине», а не только по последовательности токенов.
- Stable LatentMoE: Модель использует пул из 896 экспертов, активируя одновременно только 16 из них. Это самая большая группа экспертов среди открытых моделей. Балансировка достигается через квантильные оценки, а не вспомогательные потери.
Стоит учесть: Активная доля экспертов в модели составляет всего 1,8%. Это демонстрирует тренд отрасли: пулы экспертов растут, но доля реально работающих в моменте единиц снижается для оптимизации ресурсов.
Результаты тестов и позиционирование на рынке
В таблице из 33 тестовых задач модель заняла первое или совместное первое место в 8 случаях. На остальных позициях Kimi K3 опережает все другие открытые модели и часто находится в нескольких баллах от лучших закрытых систем.
Ключевые показатели эффективности:
- SWE Marathon: 42,0 балла (на 2 балла выше конкурентов и в 3 раза лучше, чем у GPT 5.5).
- BrowseComp: 91,2 балла.
- DeepSearchQA: 95,0 баллов.
- OmniDocBench: 91,1 балла.
Все результаты получены при максимальных усилиях по рассуждению. Тесты проводились с использованием различных инструментов (KimiCode, Claude Code, Codex), часть данных взята из внешних лидербордов.
На фоне этого: Высокий результат в задаче SWE Marathon указывает на то, что модель способна решать сложные инженерные задачи, где традиционные модели часто ошибаются из-за отсутствия контекста.
Операционные последствия, тренды и практические аспекты
- Снижение вычислительных затрат: Использование линейного внимания (KDA) вместо квадратичного позволяет обрабатывать контекст в 1 миллион токенов с меньшими затратами памяти и времени, что критично для развертывания на локальных серверах.
- Рост требований к инфраструктуре: Работа с пулом из 896 экспертов потребует от пользователей более сложной системы маршрутизации запросов и стабильного доступа к вычислительным ресурсам, способным поддерживать высокую степень разреженности.
- Смена парадигмы в открытых моделях: Появление механизма Attention Residuals (AttnRes) может стать стандартом для следующих поколений моделей, так как он позволяет эффективнее использовать информацию из глубоких слоев сети, что ранее было доступно только в закрытых разработках.
- Конкурентное давление: Лидерство среди открытых моделей и близость к показателям закрытых систем заставит других поставщиков решений пересмотреть свои архитектуры, чтобы не отстать в гонке за эффективность.
Источник: huggingface.co