Архитектура MoE


Архитектура MoE в новостной повестке, календарь упоминаний и aналитика в реальном времени.

Календарь упоминаний:

2026
19 июля

Архитектура MoE в модели Kimi K3 использует систему Stable LatentMoE для управления 896 экспертами

В модели Kimi K3 Архитектура MoE реализована через систему Stable LatentMoE, которая активирует только 16 из 896 доступных экспертов на один токен, распределяя нагрузку с помощью механизма Quantile Balancing. Это решение позволяет снизить вычислительные затраты при обработке контекста в 1 млн токенов, однако вводит специфические поведенческие риски, такие как избыточная проактивность модели в неясных ситуациях.

Событие: 16 июля 2026 года компания Moonshot AI представила модель Kimi K3, где Архитектура MoE управляет 896 экспертами с активацией 16 на токен.

Риск: Избыточная проактивность модели в неясных ситуациях является прямым следствием особенностей Архитектуры MoE, где эксперты могут быть переобучены на данные, ориентированные на действие.

Фактор: Стандартные инструменты инференса потребуют доработок для корректной маршрутизации 896 экспертов в рамках Архитектуры MoE без применения специальных патчей.

Инсайт: Архитектура MoE в сочетании с квантованием MXFP4 позволяет развертывать модель уровня 2,8 трлн параметров на кластерах из 8–16 узлов, меняя экономику работы с большими языковыми моделями.

Подробнее →

16 июля

Модель Inkling демонстрирует реализацию гибридной архитектуры MoE для мультимодального анализа

Контекст: Новость иллюстрирует применение архитектуры MoE в модели Inkling, где из 975 млрд общих параметров активны только 41 млрд, обеспечивая баланс между емкостью и вычислительной эффективностью при обработке текста, изображений и аудио.

Классификация: Архитектура MoE в данном случае классифицируется как гибридная система, сочетающая роутинг 6 специализированных экспертов из пула в 256 с двумя постоянно активными общими экспертами для каждого запроса.

Влияние: Использование архитектуры MoE в сочетании со спекулятивным декодированием и квантованием позволяет снизить требования к видеопамяти с 2 ТБ до 600 ГБ, расширяя возможности развертывания сверхмасштабных моделей.

Проблематика: Несмотря на преимущества архитектуры MoE в ускорении инференса, полная версия модели сохраняет высокий порог входа для локального развертывания из-за необходимости специализированного оборудования с огромным объемом VRAM.

Подробнее →


В нашей базе собрано 2 события по теме «Архитектура MoE». Мы показываем все из них.