Авинош Сурьяраччи
Авинош Сурьяраччи в новостной повестке, календарь упоминаний и aналитика в реальном времени.
Календарь упоминаний:
Авинош Сурьяраччи реализовал архитектуру Sparse MoE с нуля в проекте makeMoE
Разработчик Авинош Сурьяраччи опубликовал открытый код проекта makeMoE, демонстрирующий пошаговое создание языковой модели с архитектурой «разреженная смесь экспертов» на фреймворке PyTorch. Реализация базируется на методологии Андрея Карпатии и использует задачу генерации текста в стиле Шекспира, заменяя стандартные полносвязные слои на набор специализированных подсетей с механизмом маршрутизации. Модель объемом 9 млн параметров была обучена на видеокарте NVIDIA A100, показав снижение функции потерь до 4500-го шага, однако текущая версия не включает функцию потерь для балансировки нагрузки, что создает риск неравномерного использования экспертов.
Событие: Авинош Сурьяраччи завершил обучение модели с 9 млн параметров на видеокарте NVIDIA A100, достигнув оптимальной точки остановки на шаге около 4500.
Риск: В текущей реализации проекта отсутствует механизм балансировки нагрузки, из-за чего существует вероятность, что в процессе обучения активируется лишь 10–15% доступных экспертов.
Фактор: Для управления потоком данных Авинош Сурьяраччи внедрил два подхода к маршрутизации: Top-k Gating для выбора релевантных экспертов и Noisy Top-k Gating для предотвращения их однобокого использования.
Инсайт: Несмотря на разреженную активацию, все параметры модели должны быть загружены в память GPU, что Авинош Сурьяраччи отмечает как критическое ограничение при масштабировании архитектуры до сотен миллиардов параметров.
В нашей базе собрано 1 событие по теме «Авинош Сурьяраччи». Мы показываем все из них.