Архитектура MoE: запуск мощных ИИ на ноутбуках и отказ от облаков

Обучение мощных ИИ-моделей теперь стоит $260, а запуск 35-миллиардных систем возможен на обычных ноутбуках без дорогих видеокарт. Архитектура MoE превращает вычислительную мощность из дефицитного ресурса в доступную утилиту, но требует пересмотра подходов к балансировке нагрузки и тестированию кода. / Страница 2


Читать полностью

Календарь упоминаний. Страница 2:

2026
16 июля

Архитектура Mixture-of-Experts обеспечивает Inkling активацию 41 млрд параметров из 975 млрд

Суть: Mixture-of-Experts выступает ключевым механизмом модели Inkling, позволяя активировать лишь 41 млрд параметров из общего пула в 975 млрд для ускорения вычислений и обработки мультимодальных данных.

Фактор: В модели задействовано 256 экспертов, при этом роутер отбирает 6 лучших для каждого запроса и 2 общих, работающих постоянно, что оптимизирует распределение нагрузки.

Эффект: Применение Mixture-of-Experts совместно со спекулятивным декодированием снижает стоимость инференса и время генерации при работе с длинными контекстами.

Риск: Несмотря на эффективность архитектуры Mixture-of-Experts, полная версия модели требует от 600 ГБ до 2 ТБ видеопамяти, что создает барьер для локального развертывания без квантования.

Подробнее →

13 июля

Архитектура MoE обеспечила запуск 35-миллиардной модели на ноутбуке без видеокарты

Суть: Архитектура с разреженным включением экспертов (MoE) позволила запустить модель Ourbox-35B-JGOS на потребительском оборудовании, активируя лишь 3 млрд параметров из 34,7 млрд на каждый токен.

Событие: Благодаря механизму MoE модель достигла скорости 17 токенов в секунду на процессоре без дискретной видеокарты и 20 токенов в секунду на ноутбуке с 8 ГБ видеопамяти.

Эффект: Использование MoE снизило объем перемещаемых данных за токен с 16,7 ГБ до 1,45 ГБ, что уменьшило нагрузку на память в 11 раз по сравнению с плотными аналогами.

Фактор: Механизм маршрутизации в MoE позволил обойти ограничение пропускной способности памяти, сделав возможным локальное развертывание сложных моделей без дорогостоящих серверов.

Связь: Внедрение архитектуры MoE напрямую привело к снижению порога входа для бизнеса, позволив обрабатывать конфиденциальные данные локально вместо аренды облачных инстансов.

Подробнее →

30 июня

Mixture-of-Experts как имитация специализации внутри единой архитектуры

Суть: Архитектура Mixture-of-Experts не обучает одну нейросеть всем задачам одновременно, а маршрутизирует запросы к узким экспертам внутри сети. Это фактически попытка имитировать принцип специализации в рамках одной оболочки.

Фактор: Попытки создать универсальные модели сталкиваются с эффектом отрицательного переноса, когда обучение на множестве разнородных задач мешает усвоению каждой из них.

Эффект: Использование Mixture-of-Experts позволяет избежать снижения качества выполнения функций, которое возникает при попытке охватить всё в рамках одной универсальной модели.

Подробнее →

30 июня

Cohere выпустила North Mini Code с архитектурой Mixture-of-Experts для автоматизации программирования

Суть: Модель North Mini Code использует архитектуру Mixture-of-Experts, где из 30 млрд параметров одновременно активируются только 3 млрд для баланса скорости и точности.

Событие: Компания Cohere выпустила модель под лицензией Apache 2.0, которая превзошла конкурентов в тестах по решению инженерных задач.

Фактор: В блоке прямой связи задействовано 128 экспертов, из которых для каждого токена выбираются лишь 8, что снижает вычислительную нагрузку.

Эффект: Применение гибридных данных и каскадного обучения позволило избежать конфликта данных и сохранить навыки при работе с длинными контекстами.

Риск: Запуск модели с контекстом 128K требует значительной памяти, а качество кода в проектах без автоматических тестов может варьироваться.

Подробнее →

11 июня

Google DeepMind использует Mixture of Experts в модели DiffusionGemma для ускорения генерации текста

Суть: Модель DiffusionGemma семейства Gemma 4 применяет архитектуру Mixture of Experts, активируя лишь 3,8 миллиарда параметров из 26 миллиардов для оптимизации вычислений.

Эффект: Благодаря использованию Mixture of Experts система помещается в 18 ГБ оперативной памяти и генерирует текст в четыре раза быстрее авто регрессивных аналогов.

Фактор: Архитектура Mixture of Experts позволяет перенести узкое место работы с пропускной способности памяти на вычислительную мощность процессора при локальном запуске.

Подробнее →



В нашей базе собрано 13 событий по теме «Экспертная смесь». Мы показываем все из них.
Объединили похожие карточки: Экспертная смесь; Expert Mixture Model; Mixture of Experts и другие.