Алгоритмы DAPO и GSPO решают проблему нестабильности обучения ИИ на длинных текстах
Современный алгоритм GRPO теряет эффективность при обучении на длинных текстах, вызывая нестабильность и рост вычислительных расходов. Новые методы DAPO и GSPO меняют подход к оптимизации, оценивая не отдельные слова, а целые последовательности, что стабилизирует работу сложных моделей и снижает затраты на инфраструктуру.
В статье от 9 августа 2025 года автор Ихуа Чжан (Yihua Zhang) описывает переход от алгоритма GRPO к новым методам DAPO и GSPO для обучения больших языковых моделей. Основная проблема, которую решают эти обновления, — нестабильность обучения и неэффективность использования вычислительных ресурсов при генерации длинных текстов. Новые подходы меняют принцип оптимизации с уровня отдельных слов на уровень целых последовательностей, что критически важно для архитектур с динамически активируемыми экспертами (MoE).
Важный нюанс: Переход к оптимизации целых последовательностей, а не отдельных токенов, позволяет избежать «шума» при обучении сложных моделей, где выбор экспертов меняется от шага к шагу.
Проблемы текущего стандарта GRPO
Алгоритм GRPO стал популярной альтернативой PPO, так как он отказался от использования отдельной модели оценки (value model), что упростило масштабирование. Однако при работе с длинными ответами и сложными задачами GRPO демонстрирует уязвимости.
- Потеря сигнала: При генерации длинных ответов вклад каждого отдельного слова в общий градиент становится слишком малым. Ценные корректировки «размываются» среди множества нейтральных токенов.
- Нестабильность в MoE: В архитектурах, где для каждого запроса активируется разный набор нейронных модулей (экспертов), оценка качества по отдельным токенам приводит к огромным скачкам в расчетах. Это вызывает «коллапс» обучения, когда модель перестает прогрессировать или начинает выдавать бессмыслицу.
- Неэффективность выборки: Если модель генерирует несколько ответов, которые все либо идеальны, либо полностью ошибочны, алгоритм не получает полезного сигнала для обучения, так как разница в качестве (advantage) равна нулю.
Уточнения в алгоритме DAPO
Метод DAPO сохраняет базовую структуру GRPO, но вносит четыре точечных улучшения для повышения стабильности и скорости обучения.
- Clip-Higher (Повышение верхней границы): В классическом GRPO есть жесткое ограничение на то, насколько сильно модель может увеличить вероятность «хорошего» слова. Если старая модель оценивала слово как маловероятное, но оно оказалось полезным, GRPO мог отсечь этот прогресс. DAPO повышает верхнюю границу ограничения, позволяя модели увереннее закреплять удачные решения.
- Dynamic Sampling (Динамическая выборка): Алгоритм принудительно требует разнообразия в ответах. Если для одного запроса все сгенерированные варианты получили одинаковую оценку (все 0 или все 1), система генерирует дополнительные варианты, пока не появятся ответы с разной степенью качества. Это гарантирует наличие полезного сигнала для обучения.
- Token-Level Gradient Loss (Потери на уровне токенов): Вместо усреднения градиентов внутри каждого ответа отдельно, DAPO усредняет их по всем сгенерированным токенам в пакете. Это выравнивает влияние коротких и длинных ответов: длинный качественный текст теперь вносит вклад в обучение, пропорциональный своей длине, а не размытый до нуля.
- Overlong Reward Shaping (Штраф за длину): Вводится мягкое наказание за чрезмерно длинные ответы. Если текст превышает определенный порог, награда за него снижается линейно. Это предотвращает склонность модели к «воду» и повторениям ради получения высокой оценки.
Стоит учесть: Механизм динамической выборки в DAPO устраняет ситуацию, когда модель «застревает» в состоянии, где она либо всегда права, либо всегда ошибается, что делает обучение невозможным.
GSPO: Смена парадигмы для MoE-моделей
Алгоритм GSPO (Group Sequence Policy Optimization) делает фундаментальный шаг, меняя гранулярность оптимизации с токенов на последовательности. Это решение особенно актуально для моделей типа Qwen3, использующих архитектуру MoE.
Вместо того чтобы оценивать и корректировать вероятность каждого слова отдельно, GSPO вычисляет один коэффициент важности для всего сгенерированного ответа.
- Снижение дисперсии: Поскольку оценка качества (reward) дается за весь ответ, логично и обучение вести на уровне всего ответа. Это устраняет рассинхронизацию между сигналом награды и целью оптимизации.
- Отказ от Routing Replay: В MoE-моделях традиционные методы требуют фиксации маршрута активации экспертов (Routing Replay) во время обучения, чтобы избежать несоответствий. Это дорого и сложно в реализации. GSPO обходит эту проблему, так как последовательная оптимизация не требует жесткого совпадения активации экспертов на каждом шаге.
- Стабильность: GSPO демонстрирует более плавное обучение и меньшее количество сбоев, даже если эффективное количество обучаемых токенов снижается из-за более агрессивного отсечения (clipping) целых последовательностей.
На фоне этого: Использование GSPO позволяет обучать сложные MoE-модели без необходимости внедрения дорогостоящих инженерных решений для синхронизации маршрутизации экспертов.
Операционные последствия и тренды
- Снижение вычислительных затрат: Отказ от сложных механизмов синхронизации (как Routing Replay) в GSPO упрощает инфраструктуру обучения. Это может сократить время подготовки данных и стоимость вычислений для крупных моделей.
- Улучшение качества длинных ответов: Методы DAPO и GSPO решают проблему «размывания» сигнала в длинных текстах. Для бизнеса это означает, что модели смогут стабильнее выполнять сложные задачи, требующие развернутых рассуждений, без потери качества на длинных отрезках текста.
- Риск внедрения: Переход на новые алгоритмы требует пересмотра конвейеров обучения (training pipelines). Существующие настройки, оптимизированные под GRPO, могут потребовать значительной доработки, особенно в части настройки параметров клиппинга и штрафов за длину.
- Тренд на упрощение: Эволюция от PPO к GSPO показывает движение от сложных, многоступенчатых схем к более прямым методам, где цель обучения максимально совпадает с формой оценки результата.
Эти изменения сигнализируют о зрелости методов обучения с подкреплением для ИИ: фокус смещается с поиска «хитрых» трюков на устранение фундаментальных нестыковок между математической моделью и реальными задачами.
Источник: huggingface.co