Рекурсия в малых моделях снижает ошибку на 7% без новых параметров
Смена архитектуры вместо увеличения параметров снизила ошибку предсказания на 7%, сделав алгоритмы обучения бессильными при малом объеме модели. Рост вычислительной глубины через циклы повышает связность текста, но требует четырехкратного увеличения времени генерации без расширения базы знаний.
Исследование, опубликованное на платформе Hugging Face автором Théo Charlet, демонстрирует, что для малых языковых моделей (LLM) ключевым фактором роста качества является не изменение алгоритмов обучения, а перестройка формы вычислений. Разработчик создал французскую модель объемом 15 млн параметров, обученную с нуля на видеокарте GTX 1080 Ti, и доказал, что увеличение глубины вычислений через повторное использование одного и того же блока (рекурсия) снижает ошибку предсказания (perplexity) на 7%. При этом количество параметров модели не изменилось. Эксперимент показал, что попытки улучшить процесс обучения через смену оптимизаторов или инициализацию не дали результата, тогда как изменение архитектуры позволило повысить внутреннюю согласованность текста.
Важный нюанс: Увеличение вычислительной глубины через циклы не добавляет модели новых фактов, но заставляет её последовательнее использовать уже имеющиеся знания, снижая количество вымышленных имен и логических разрывов.
Четыре неудачи и поиск правильного рычага
Перед тем как найти работающее решение, автор протестировал четыре гипотезы, направленные на изменение динамики обучения при неизменной архитектуре. Все они провалились, что позволило сделать важный вывод: при ограниченном объеме модели (15 млн параметров) «потолок» качества определяется структурой, а не тем, как модель обновляет свои веса.
Тестировались следующие методы:
- Смена оптимизатора: Переход с AdamW на Lion или изменение коэффициента сглаживания (β2) не улучшил метрики, а в некоторых случаях ухудшил согласованность текста.
- Многопоточное предсказание: Попытка заставить модель предсказывать сразу два токена вперед привела к резкому росту ошибки (self_ppl вырос с 9 до 20).
- Масштабирование слоев (LayerScale): Использование обучаемых шлюзов для старта блоков с тождественного преобразования привело к недообучению модели.
Эти неудачи подтвердили, что при малом объеме параметров ни один алгоритм обновления весов не может создать способности к сложной композиции, которых нет в самой архитектуре. Единственным оставшимся рычагом стало изменение формы вычислений.
Стоит учесть: Ошибка в настройке гиперпараметров (например, слишком малый шаг обучения для оптимизатора Lion) может имитировать провал метода. Автор выделил этот случай, чтобы показать разницу между технической ошибкой настройки и фундаментальной несостоятельностью подхода.
Рекурсия как замена глубине: принцип работы
Вместо добавления новых слоев, которые потребовали бы увеличения количества параметров, автор применил подход Recurrent-Depth Transformer. Суть метода заключается в том, что один и тот же блок нейросети применяется к данным несколько раз (в эксперименте 4 раза, R=4). Это создает эффективную глубину в 32 слоя без добавления новых весов.
Механизм работает следующим образом:
- Повторное использование: Блок обрабатывает данные, затем результат снова пропускается через тот же блок.
- Вектор глубины: В модель добавляется специальный вектор, позволяющий блоку отличать первую итерацию от четвертой.
- Нулевая инициализация: Выходные проекции инициализируются нулями, чтобы избежать нестабильности при глубоком прокручивании.
Этот подход решает проблему «разрыва цепочки»: в обычной модели факт из одного слоя может быть недоступен для фактов из другого, тогда как рекурсия позволяет данным проходить через одни и те же веса многократно, улучшая связность мыслей.
Адаптивная глубина: когда модели стоит остановиться
Автор также реализовал механизм адаптивной остановки вычислений для каждого токена. Идея заключается в том, что простые слова (например, предлоги) не требуют четырех проходов, тогда как редкие имена или сложные конструкции нуждаются в максимальной глубине.
В отличие от предыдущих попыток, где решение принималось на этапе генерации (инференса), автор заставил модель учиться останавливаться в процессе обучения. Критерием остановки стала энтропия распределения вероятностей: если модель уверена в предсказании, цикл прерывается раньше.
Было протестировано три варианта модели:
- Cadence: Фиксированная глубина (4 цикла) для всех токенов.
- Focal: Адаптивная остановка по абсолютному порогу энтропии.
- Nomade: Адаптивная остановка по процентному порогу (фиксированная доля токенов останавливается на каждом шаге).
Результаты показали, что универсального победителя нет. Модель Cadence показала лучшую общую ошибку (28.9 против 31.2 у базовой версии). Модель Focal достигла максимальной согласованности на знакомых данных (44.1), но проиграла на незнакомых. Модель Nomade лучше всего справилась с незнакомыми темами и минимизировала вымышленные имена (0.094).
Важный нюанс: Адаптивная остановка на этапе генерации почти не срабатывает на свободном тексте, так как токены редко достигают порога уверенности. Реальный выигрыш достигается за счет того, что обучение с остановкой действует как регуляризатор, заставляя модель формировать более качественные представления на ранних этапах.
Операционные последствия и технические барьеры
- Рост вычислительных затрат: Увеличение глубины через циклы (R=4) приводит к росту времени вычислений примерно в 4 раза на каждый шаг генерации. Это прямая плата за улучшение качества без увеличения размера модели.
- Проблемы с памятью: Глубокая рекурсия требует хранения большого количества промежуточных активаций. Для работы на ограниченном оборудовании (например, 11 ГБ VRAM) потребовалось внедрение checkpointing (контрольных точек) и корректная настройка случайных чисел (dropout), чтобы избежать ошибок детерминизма.
- Компромисс между точностью и универсальностью: Рекурсия улучшает работу на данных, похожих на обучающие (in-domain), но может ухудшать результаты на новых темах (out-of-domain). Выбор архитектуры зависит от целевой задачи: нужна ли максимальная точность на узкой теме или устойчивость к новым данным.
- Отсутствие «магического» фактора: Ни один из протестированных методов не позволил модели запомнить новые факты (например, назвать столицу Франции), если они отсутствовали в обучающей выборке. Архитектура улучшает связность и снижает галлюцинации, но не расширяет базу знаний.
Модели Cadence-15M-fr, Focal-15M-fr и Nomade-15M-fr доступны в открытом доступе под лицензией Apache-2.0, что позволяет исследователям воспроизвести результаты и проверить гипотезы на других датасетах.
Источник: huggingface.co