NVIDIA Vera Rubin снижает затраты на обучение ИИ-агентов в четыре раза
NVIDIA представила платформу Vera Rubin, которая обучает модели искусственного интеллекта в четыре раза дешевле, сокращая потребность в мощностях. Это меняет экономику бизнеса: создание умных агентов превращается из разового вложения в постоянную операционную статью расходов, где выгоду приносит скорость адаптации, а не начальное качество.
Компания NVIDIA представила платформу Vera Rubin, ориентированную на непрерывное дообучение агентов искусственного интеллекта. Главная цель — максимизировать показатель «интеллект за доллар», который становится ключевым для эпохи агентов, способных самостоятельно планировать задачи и исправлять ошибки. В отличие от стандартных моделей, генерирующих текст по запросу, агенты требуют постоянного обновления навыков в меняющейся среде, что делает процесс обучения бесконечным циклом, а не разовым этапом.
Платформа Vera Rubin спроектирована так, чтобы обучать модели того же размера, что и на предыдущем поколении Blackwell, но с использованием в четыре раза меньше графических ускорителей. Это снижает стоимость каждого цикла обучения и делает экономически оправданным частое обновление моделей в ответ на новые задачи и инструменты.
От предобучения к непрерывному развитию
В классическом подходе модель обучают один раз на огромных массивах данных, чтобы она умела предсказывать следующее слово. Это дает ей плавность речи, но не способность решать сложные задачи. Истинный интеллект формируется на этапе пост-тренинга (дообучения), когда модель учится писать код, планировать многоступенчатые действия и использовать внешние инструменты.
Процесс работает по принципу проб и ошибок с использованием методов обучения с подкреплением:
- Модель получает задачу и пытается её решить (прямой проход).
- Результат оценивается по системе вознаграждений.
- На основе оценки корректируются внутренние параметры модели (обратный проход).
- Цикл повторяется миллионы раз, пока модель не научится справляться с непредвиденными ситуациями.
Для масштабирования этого процесса требуются тысячи параллельных сред, где модели одновременно выполняют попытки, а результаты мгновенно возвращаются в систему обучения. Библиотеки NVIDIA NeMo превращают этот сложный исследовательский процесс в стандартизированную инфраструктуру, доступную для бизнеса.
Важный нюанс: Снижение стоимости обучения на платформе Vera Rubin делает экономически выгодным не просто создание модели, а её постоянное «обновление» в реальном времени. Это меняет бизнес-модель: ценность продукта теперь зависит от скорости адаптации к новым условиям, а не только от начального качества.
Практическое применение и результаты
Платформа уже используется для обучения крупных открытых моделей, таких как Nemotron 3 Ultra (550 миллиардов параметров). На стандартном тесте по исправлению реальных ошибок в программном коде (SWE-bench) модель показала результат 71,7%, успешно исправляя примерно семь из десяти багов в проектах с открытым исходным кодом.
Ряд компаний уже интегрировали новые решения в свои процессы:
- Prime Intellect использует Vera Rubin для масштабирования сред обучения с подкреплением. Тесты показали, что процессоры Vera обеспечивают на 30% большую пропускную способность по сравнению с альтернативными архитектурами x86 при выполнении задач в песочницах.
- Perplexity применяет асинхронный стек обучения с подкреплением на сотнях GPU NVIDIA. Система синхронизирует модели с триллионами параметров между узлами обучения и вывода за менее чем две секунды. Обученные модели Qwen3 235B затем развертываются на системах GB200 NVL72.
- Together AI предлагает услуги пост-тренинга как сервис, включая тонкую настройку и оптимизацию предпочтений, и планирует переход на платформу Vera Rubin для повышения эффективности.
Операционные последствия, тренды и практические аспекты
- Сдвиг метрики эффективности: Бизнесу придется переориентироваться с оценки стоимости одного токена вывода (inference) на показатель «интеллект за доллар». Это означает, что инвестиции в инфраструктуру обучения напрямую влияют на ценность каждого сгенерированного ответа, так как более умная модель решает больше задач за то же время.
- Необходимость непрерывной инфраструктуры: Для работы агентов требуется не статичное хранилище модели, а «фабрика» непрерывного обучения. Это создает зависимость от систем, способных запускать тысячи параллельных сред обучения и мгновенно обновлять веса модели без остановки сервиса.
- Рост требований к энергоэффективности: Поскольку циклы обучения становятся бесконечными, даже незначительное снижение энергопотребления на один цикл (как в случае с Vera Rubin) приводит к существенной экономии операционных расходов в долгосрочной перспективе.
- Зависимость от экосистемы: Использование специализированных библиотек (NeMo Gym, NeMo RL) и аппаратного обеспечения становится критическим фактором. Компании, полагающиеся на кастомные решения без поддержки масштабируемой инфраструктуры, могут столкнуться с невозможностью поддерживать актуальность своих агентов.
Ключевой момент: Переход к агентам ИИ превращает обучение модели из разового капитального вложения в постоянную операционную статью расходов. Компании, не готовые к этому переходу, рискуют получить устаревшие модели, которые не смогут адаптироваться к изменениям в инструментах и правилах работы.
Источник: blogs.nvidia.com