MakeMoE
MakeMoE в новостной повестке, календарь упоминаний и aналитика в реальном времени.
Календарь упоминаний:
makeMoE реализует с нуля архитектуру Sparse Mixture of Experts на базе PyTorch
Проект makeMoE представляет собой открытый код, демонстрирующий пошаговое создание языковой модели с разреженной архитектурой «смесь экспертов» для генерации текста в стиле Шекспира. Реализация использует механизм маршрутизации Top-k и Noisy Top-k Gating для выбора активных подсетей, что позволяет увеличить общее количество параметров без пропорционального роста вычислительной нагрузки. Модель с 9 млн параметров была обучена на видеокарте NVIDIA A100, показав снижение функции потерь и способность генерировать узнаваемые паттерны, однако текущая версия не включает функцию потерь для балансировки нагрузки.
Исследование: makeMoE обучил модель с 9 млн параметров на задаче генерации шекспировского текста, достигнув оптимальной точки остановки на 4500-м шаге.
Риск: Отсутствие в makeMoE функции потерь для балансировки нагрузки создает угрозу активации лишь 10–15% экспертов, оставляя остальные подсети бездействующими.
Фактор: makeMoE использует механизм Noisy Top-k Gating, добавляя случайный шум к оценкам релевантности, чтобы предотвратить закрепление маршрутизатора за одними и теми же экспертами.
Риск: makeMoE сталкивается с критическим ограничением памяти GPU, так как все параметры модели должны быть загружены в память, несмотря на разреженную активацию на каждом шаге.
Анонс: Для промышленного применения makeMoE потребуется внедрение механизма «емкости экспертов» (Expert Capacity) для предотвращения перегрузки отдельных узлов.
В нашей базе собрано 1 событие по теме «MakeMoE». Мы показываем все из них.