MoE стала стандартом для локального ИИ, но скрытая цена — в инфраструктуре

Локальный ИИ на базе MoE запустился на обычном ноутбуке без дискретной видеокарты, обрабатывая 17 токенов в секунду за счет активации лишь части параметров. Скрытая цена этого прорыва — сложность балансировки нагрузки, где некорректная маршрутизация превращает экономию в простои дорогостоящего оборудования. / Страница 2


Читать полностью

Календарь упоминаний. Страница 2:

2026
19 июля

Разработчик Авинош Сурьяраччи реализовал с нуля архитектуру Mixture of Experts в проекте makeMoE

Проект makeMoE демонстрирует практическое создание языковой модели, где Mixture of Experts заменяет стандартные полносвязные слои трансформера на набор специализированных подсетей. Механизм маршрутизации с использованием алгоритмов Top-k и Noisy Top-k Gating определяет, какие эксперты активируются для обработки токена, что позволяет увеличить общее количество параметров модели без пропорционального роста вычислительной нагрузки. Обучение модели с 9 млн параметров на NVIDIA A100 показало снижение функции потерь и способность генерировать текст в стиле Шекспира, однако отсутствие функции балансировки нагрузки создает риск неравномерного использования экспертов.

Исследование: Реализация архитектуры Mixture of Experts на 9 млн параметров подтвердила работоспособность механизма разреженной активации и снижение функции потерь на шаге 4500 при обучении на данных Шекспира.

Риск: Отсутствие функции потерь для балансировки нагрузки в текущей реализации Mixture of Experts может привести к тому, что в процессе обучения активируется лишь 10–15% доступных экспертов, а остальные останутся неиспользованными.

Фактор: Необходимость загрузки всех параметров модели в память GPU, даже если активны только несколько экспертов, становится критическим ограничением для масштабирования Mixture of Experts до сотен миллиардов параметров.

Связь: Эффективность работы Mixture of Experts напрямую зависит от качества маршрутизатора, так как его неспособность равномерно распределять токены приводит к простоям вычислительных ресурсов и сводит на нет преимущества разреженности.

Подробнее →

16 июля

Архитектура Mixture-of-Experts обеспечивает Inkling активацию 41 млрд параметров из 975 млрд

Суть: Mixture-of-Experts выступает ключевым механизмом модели Inkling, позволяя активировать лишь 41 млрд параметров из общего пула в 975 млрд для ускорения вычислений и обработки мультимодальных данных.

Фактор: В модели задействовано 256 экспертов, при этом роутер отбирает 6 лучших для каждого запроса и 2 общих, работающих постоянно, что оптимизирует распределение нагрузки.

Эффект: Применение Mixture-of-Experts совместно со спекулятивным декодированием снижает стоимость инференса и время генерации при работе с длинными контекстами.

Риск: Несмотря на эффективность архитектуры Mixture-of-Experts, полная версия модели требует от 600 ГБ до 2 ТБ видеопамяти, что создает барьер для локального развертывания без квантования.

Подробнее →

16 июля

DeepSeek-V3 меняет подход к балансировке нагрузки в MoE через динамическое смещение

Суть: Архитектура MoE в модели DeepSeek-V3 отказалась от традиционных штрафных функций в пользу динамического обновления смещений для каждого эксперта, создав самоорганизующуюся систему распределения задач.

Тренд: Индустрия переходит от жестких правил отбрасывания данных и глобальных штрафов к тонкой настройке привлекательности экспертов, что позволяет избежать простоев вычислительных ресурсов.

Эффект: Улучшенная балансировка в MoE снижает расход вычислительных мощностей и повышает скорость генерации ответов за счет равномерной загрузки тысяч специализированных подмодулей.

Риск: Отказ от жестких штрафов в пользу динамической настройки требует точного подбора скорости обновления параметров, так как ошибка может привести к нестабильности работы системы.

Подробнее →

13 июля

Архитектура MoE обеспечила запуск 35-миллиардной модели на ноутбуке без видеокарты

Суть: Архитектура с разреженным включением экспертов (MoE) позволила запустить модель Ourbox-35B-JGOS на потребительском оборудовании, активируя лишь 3 млрд параметров из 34,7 млрд на каждый токен.

Событие: Благодаря механизму MoE модель достигла скорости 17 токенов в секунду на процессоре без дискретной видеокарты и 20 токенов в секунду на ноутбуке с 8 ГБ видеопамяти.

Эффект: Использование MoE снизило объем перемещаемых данных за токен с 16,7 ГБ до 1,45 ГБ, что уменьшило нагрузку на память в 11 раз по сравнению с плотными аналогами.

Фактор: Механизм маршрутизации в MoE позволил обойти ограничение пропускной способности памяти, сделав возможным локальное развертывание сложных моделей без дорогостоящих серверов.

Связь: Внедрение архитектуры MoE напрямую привело к снижению порога входа для бизнеса, позволив обрабатывать конфиденциальные данные локально вместо аренды облачных инстансов.

Подробнее →

30 июня

Mixture-of-Experts как имитация специализации внутри единой архитектуры

Суть: Архитектура Mixture-of-Experts не обучает одну нейросеть всем задачам одновременно, а маршрутизирует запросы к узким экспертам внутри сети. Это фактически попытка имитировать принцип специализации в рамках одной оболочки.

Фактор: Попытки создать универсальные модели сталкиваются с эффектом отрицательного переноса, когда обучение на множестве разнородных задач мешает усвоению каждой из них.

Эффект: Использование Mixture-of-Experts позволяет избежать снижения качества выполнения функций, которое возникает при попытке охватить всё в рамках одной универсальной модели.

Подробнее →



В нашей базе собрано 15 событий по теме «Экспертная смесь». Мы показываем все из них.
Объединили похожие карточки: Экспертная смесь; Expert Mixture Model; Mixture of Experts и другие.