MoE стала стандартом для локального ИИ, но скрытая цена — в инфраструктуре
Локальный ИИ на базе MoE запустился на обычном ноутбуке без дискретной видеокарты, обрабатывая 17 токенов в секунду за счет активации лишь части параметров. Скрытая цена этого прорыва — сложность балансировки нагрузки, где некорректная маршрутизация превращает экономию в простои дорогостоящего оборудования. / Страница 3
Читать полностью
Календарь упоминаний. Страница 3:
Cohere выпустила North Mini Code с архитектурой Mixture-of-Experts для автоматизации программирования
Суть: Модель North Mini Code использует архитектуру Mixture-of-Experts, где из 30 млрд параметров одновременно активируются только 3 млрд для баланса скорости и точности.
Событие: Компания Cohere выпустила модель под лицензией Apache 2.0, которая превзошла конкурентов в тестах по решению инженерных задач.
Фактор: В блоке прямой связи задействовано 128 экспертов, из которых для каждого токена выбираются лишь 8, что снижает вычислительную нагрузку.
Эффект: Применение гибридных данных и каскадного обучения позволило избежать конфликта данных и сохранить навыки при работе с длинными контекстами.
Риск: Запуск модели с контекстом 128K требует значительной памяти, а качество кода в проектах без автоматических тестов может варьироваться.
Google DeepMind использует Mixture of Experts в модели DiffusionGemma для ускорения генерации текста
Суть: Модель DiffusionGemma семейства Gemma 4 применяет архитектуру Mixture of Experts, активируя лишь 3,8 миллиарда параметров из 26 миллиардов для оптимизации вычислений.
Эффект: Благодаря использованию Mixture of Experts система помещается в 18 ГБ оперативной памяти и генерирует текст в четыре раза быстрее авто регрессивных аналогов.
Фактор: Архитектура Mixture of Experts позволяет перенести узкое место работы с пропускной способности памяти на вычислительную мощность процессора при локальном запуске.
DeepSeek V4 применяет квантование FP4 для весов экспертов в архитектуре MoE
Суть: Новая модель использует квантование с учетом обучения для весов экспертов в архитектуре Mixture-of-Experts, что позволяет вдвое сократить объем памяти для их хранения по сравнению с форматом FP8.
Эффект: Снижение требований к памяти критично для масштабных развертываний модели и делает ее экономически выгодной даже на существующем оборудовании без новейших ускорителей.
Фактор: Применение смешанной точности данных (комбинация FP8 и FP4) в связке с MoE является ключевым элементом оптимизации инфраструктуры для снижения нагрузки.
Улучшение точности и снижение зависимости от HBM за счёт Engram
Технология Engram, разработанная DeepSeek, позволяет ИИ-моделям эффективнее использовать системную память для хранения и извлечения информации, сокращая нагрузку на GPU и зависимость от высокопроизводительной памяти (HBM). В отличие от традиционных подходов, Engram сохраняет часто используемые данные в статической памяти, что ускоряет обработку длинных контекстов и повышает точность. В тестах модель с Engram показала на 3,4–5 пунктов лучшие результаты по сравнению с MoE в задачах на знания и логику. Эта методология может стать основой для будущих ИИ-моделей, снижая затраты и улучшая производительность.
Прорыв в масштабировании моделей MoE
Mixture of Experts (MoE) — архитектура, при которой только часть параметров активируется при обработке запроса, что повышает эффективность больших языковых моделей. NVIDIA преодолела технические барьеры масштабирования MoE с помощью подхода co-design, оптимизировав как архитектуру, так и программное обеспечение. Это позволило достичь десятикратного увеличения производительности на системе GB200 NVL72 по сравнению с предыдущим поколением. В результате модель MoE может поддерживать модели с 32 млрд активных параметров на один проход, что делает её всё более востребованной в различных применениях.
В нашей базе собрано 15 событий по теме «Экспертная смесь». Мы показываем все из них.
Объединили похожие карточки: Экспертная смесь; Expert Mixture Model; Mixture of Experts и другие.