MoE стала стандартом для локального ИИ, но скрытая цена — в инфраструктуре

Локальный ИИ на базе MoE запустился на обычном ноутбуке без дискретной видеокарты, обрабатывая 17 токенов в секунду за счет активации лишь части параметров. Скрытая цена этого прорыва — сложность балансировки нагрузки, где некорректная маршрутизация превращает экономию в простои дорогостоящего оборудования. / Страница 3


Читать полностью

Календарь упоминаний. Страница 3:

2026
30 июня

Cohere выпустила North Mini Code с архитектурой Mixture-of-Experts для автоматизации программирования

Суть: Модель North Mini Code использует архитектуру Mixture-of-Experts, где из 30 млрд параметров одновременно активируются только 3 млрд для баланса скорости и точности.

Событие: Компания Cohere выпустила модель под лицензией Apache 2.0, которая превзошла конкурентов в тестах по решению инженерных задач.

Фактор: В блоке прямой связи задействовано 128 экспертов, из которых для каждого токена выбираются лишь 8, что снижает вычислительную нагрузку.

Эффект: Применение гибридных данных и каскадного обучения позволило избежать конфликта данных и сохранить навыки при работе с длинными контекстами.

Риск: Запуск модели с контекстом 128K требует значительной памяти, а качество кода в проектах без автоматических тестов может варьироваться.

Подробнее →

11 июня

Google DeepMind использует Mixture of Experts в модели DiffusionGemma для ускорения генерации текста

Суть: Модель DiffusionGemma семейства Gemma 4 применяет архитектуру Mixture of Experts, активируя лишь 3,8 миллиарда параметров из 26 миллиардов для оптимизации вычислений.

Эффект: Благодаря использованию Mixture of Experts система помещается в 18 ГБ оперативной памяти и генерирует текст в четыре раза быстрее авто регрессивных аналогов.

Фактор: Архитектура Mixture of Experts позволяет перенести узкое место работы с пропускной способности памяти на вычислительную мощность процессора при локальном запуске.

Подробнее →

27 апреля

DeepSeek V4 применяет квантование FP4 для весов экспертов в архитектуре MoE

Суть: Новая модель использует квантование с учетом обучения для весов экспертов в архитектуре Mixture-of-Experts, что позволяет вдвое сократить объем памяти для их хранения по сравнению с форматом FP8.

Эффект: Снижение требований к памяти критично для масштабных развертываний модели и делает ее экономически выгодной даже на существующем оборудовании без новейших ускорителей.

Фактор: Применение смешанной точности данных (комбинация FP8 и FP4) в связке с MoE является ключевым элементом оптимизации инфраструктуры для снижения нагрузки.

Подробнее →

14 января

Улучшение точности и снижение зависимости от HBM за счёт Engram

Технология Engram, разработанная DeepSeek, позволяет ИИ-моделям эффективнее использовать системную память для хранения и извлечения информации, сокращая нагрузку на GPU и зависимость от высокопроизводительной памяти (HBM). В отличие от традиционных подходов, Engram сохраняет часто используемые данные в статической памяти, что ускоряет обработку длинных контекстов и повышает точность. В тестах модель с Engram показала на 3,4–5 пунктов лучшие результаты по сравнению с MoE в задачах на знания и логику. Эта методология может стать основой для будущих ИИ-моделей, снижая затраты и улучшая производительность.

Подробнее →

2025
03 декабря

Прорыв в масштабировании моделей MoE

Mixture of Experts (MoE) — архитектура, при которой только часть параметров активируется при обработке запроса, что повышает эффективность больших языковых моделей. NVIDIA преодолела технические барьеры масштабирования MoE с помощью подхода co-design, оптимизировав как архитектуру, так и программное обеспечение. Это позволило достичь десятикратного увеличения производительности на системе GB200 NVL72 по сравнению с предыдущим поколением. В результате модель MoE может поддерживать модели с 32 млрд активных параметров на один проход, что делает её всё более востребованной в различных применениях.

Подробнее →



В нашей базе собрано 15 событий по теме «Экспертная смесь». Мы показываем все из них.
Объединили похожие карточки: Экспертная смесь; Expert Mixture Model; Mixture of Experts и другие.