Архитектура MoE
Архитектура MoE в новостной повестке, календарь упоминаний и aналитика в реальном времени.
Упоминается вместе:
Календарь упоминаний:
Яндекс открыл код модели Alice AI Foundation LLM, построенной на архитектуре MoE с 80 млрд параметров
Компания Яндекс опубликовала претрейн-версию большой языковой модели в лицензии Apache 2.0, которая использует архитектуру Mixture of Experts для активации лишь части вычислительных ресурсов при обработке запроса. Из общего массива в 80 млрд параметров в момент инференса задействованы только 3 млрд, что обеспечивает высокую скорость генерации ответов и снижает нагрузку на оборудование. Модель демонстрирует результаты, сопоставимые или превосходящие более крупные аналоги конкурентов в задачах программирования, логики и русскоязычных знаний.
Событие: Яндекс предоставил открытый доступ к весам модели Alice AI Foundation LLM и техническим отчетам на платформе Hugging Face под лицензией Apache 2.0.
Фактор: Архитектура MoE позволяет модели активировать только 3 из 80 млрд параметров при каждом запросе, что сокращает затраты на вычисления и ускоряет инференс.
Эффект: Использование данной архитектуры снижает стоимость поддержки будущих ИИ-агентов Алисы AI, которым требуется быстрая реакция на поручения пользователя.
Связь: Применение архитектуры MoE в Alice AI Foundation LLM служит тестовой площадкой для разработки единой рассуждающей модели (ERM), которая станет ядром агентных функций ассистента.
Яндекс открыл исходный код Alice AI Search Pretrain с гибридной архитектурой MoE
Компания перевела в открытый доступ на Hugging Face базовую языковую модель для генерации ответов в Поиске, которая использует комбинацию Encoder-Decoder и технологии Mixture of Experts. Архитектура MoE позволяет модели с общим объемом 35 млрд параметров активировать при обработке токена лишь около 600 млн (менее 2% от общего числа), что существенно снижает требования к вычислительным мощностям. Открытый доступ по лицензии Apache 2.0 дает исследователям возможность изучать фундаментальные механизмы обучения и интегрировать решение в собственные проекты.
Событие: Яндекс опубликовал код и веса pretrain-версии модели Alice AI Search на платформе Hugging Face под лицензией Apache 2.0.
Фактор: Архитектура MoE обеспечивает энергоэффективность, ограничивая активацию параметров до 600 млн из 35 млрд на один токен.
Эффект: Модель демонстрирует качество ответов на русском языке, сопоставимое с Qwen 3.5 35B-A3B, при значительно меньших ресурсных затратах по сравнению с последним.
Архитектура MoE в модели Kimi K3 использует систему Stable LatentMoE для управления 896 экспертами
В модели Kimi K3 Архитектура MoE реализована через систему Stable LatentMoE, которая активирует только 16 из 896 доступных экспертов на один токен, распределяя нагрузку с помощью механизма Quantile Balancing. Это решение позволяет снизить вычислительные затраты при обработке контекста в 1 млн токенов, однако вводит специфические поведенческие риски, такие как избыточная проактивность модели в неясных ситуациях.
Событие: 16 июля 2026 года компания Moonshot AI представила модель Kimi K3, где Архитектура MoE управляет 896 экспертами с активацией 16 на токен.
Риск: Избыточная проактивность модели в неясных ситуациях является прямым следствием особенностей Архитектуры MoE, где эксперты могут быть переобучены на данные, ориентированные на действие.
Фактор: Стандартные инструменты инференса потребуют доработок для корректной маршрутизации 896 экспертов в рамках Архитектуры MoE без применения специальных патчей.
Инсайт: Архитектура MoE в сочетании с квантованием MXFP4 позволяет развертывать модель уровня 2,8 трлн параметров на кластерах из 8–16 узлов, меняя экономику работы с большими языковыми моделями.
Модель Inkling демонстрирует реализацию гибридной архитектуры MoE для мультимодального анализа
Контекст: Новость иллюстрирует применение архитектуры MoE в модели Inkling, где из 975 млрд общих параметров активны только 41 млрд, обеспечивая баланс между емкостью и вычислительной эффективностью при обработке текста, изображений и аудио.
Классификация: Архитектура MoE в данном случае классифицируется как гибридная система, сочетающая роутинг 6 специализированных экспертов из пула в 256 с двумя постоянно активными общими экспертами для каждого запроса.
Влияние: Использование архитектуры MoE в сочетании со спекулятивным декодированием и квантованием позволяет снизить требования к видеопамяти с 2 ТБ до 600 ГБ, расширяя возможности развертывания сверхмасштабных моделей.
Проблематика: Несмотря на преимущества архитектуры MoE в ускорении инференса, полная версия модели сохраняет высокий порог входа для локального развертывания из-за необходимости специализированного оборудования с огромным объемом VRAM.
В нашей базе собрано 4 события по теме «Архитектура MoE». Мы показываем все из них.