Архитектура смеси экспертов


Архитектура смеси экспертов в новостной повестке, календарь упоминаний и aналитика в реальном времени.

Календарь упоминаний:

2026
23 июля

Оптимизация архитектуры смеси экспертов для локального ИИ через селективную активацию параметров

Контекст: Новость демонстрирует применение архитектуры смеси экспертов в модели POCKET, где из 35 млрд параметров активируется лишь 3 млрд на токен, что позволяет запускать систему на стандартных ноутбуках и смартфонах без специализированных видеокарт.

Влияние: Внедрение данной конфигурации меняет ключевое ограничение локального ИИ, смещая фокус с вычислительной мощности GPU на объем и пропускную способность оперативной памяти как критический ресурс.

Проблематика: Архитектура смеси экспертов выявляет компромисс между скоростью генерации и обработкой входных запросов, где активация множества подмодулей одновременно замедляет этап prefill на мощных серверных ускорителях.

Классификация: Оптимизация требует дифференцированного подхода к сжатию экспертов в зависимости от языка, так как методы обрезки и квантования по-разному влияют на качество корейской и английской версий модели.

Следствие: Успешная адаптация архитектуры смеси экспертов под массовое оборудование снижает порог входа для пользователей, делая доступными модели высокого уровня точности через стандартные инструменты без модификаций.

Подробнее →

19 июля

Разработчик опубликовал открытый код реализации разреженной архитектуры смеси экспертов с нуля

Проект makeMoE демонстрирует практическое создание языковой модели, где Архитектура смеси экспертов заменяет стандартные полносвязные слои на набор специализированных подсетей, активируемых маршрутизатором. Реализация включает механизмы Top-k и Noisy Top-k Gating для выбора экспертов, а также показывает процесс обучения модели в 9 млн параметров на данных в стиле Шекспира. Архитектура смеси экспертов в данном контексте выступает центральным объектом исследования, позволяющим увеличить количество параметров без пропорционального роста вычислительной нагрузки на каждый шаг генерации.

Исследование: Автор реализовал модель на PyTorch с использованием механизма маршрутизации, где для каждого токена активируется лишь часть экспертов, что подтверждено снижением функции потерь до шага 4500.

Риск: Отсутствие функции потерь для балансировки нагрузки в текущей версии кода создает вероятность бездействия 85–90% экспертов, что снижает общую эффективность Архитектуры смеси экспертов.

Фактор: Необходимость загрузки всех параметров модели в память GPU, даже при разреженной активации, остается критическим ограничением для масштабирования Архитектуры смеси экспертов до сотен миллиардов параметров.

Инсайт: Добавление случайного шума в процесс выбора экспертов (Noisy Top-k Gating) предотвращает застой маршрутизатора на одних и тех же подсетях, обеспечивая более равномерное распределение нагрузки в Архитектуре смеси экспертов.

Подробнее →


В нашей базе собрано 2 события по теме «Архитектура смеси экспертов». Мы показываем все из них.