Июнь 2026   |   В фокусе

NVIDIA представила GraspGen-X, LCDrive и NitroGen для ускорения обучения роботов и автопилота

Обучение роботов на двух миллиардах симулированных захватов и тысячи часов игровых сценариев позволяет отказаться от дорогостоящего переобучения алгоритмов под каждое новое оборудование. Компании получают возможность запускать автономные системы без апгрейда вычислительных мощностей, но сталкиваются с критической зависимостью от качества виртуальных симуляторов.

NVIDIA представила на конференции CVPR три новые модели, направленные на решение проблемы масштабирования обучения для роботов и автономных систем. Ключевая идея заключается в переходе от узкоспециализированного обучения к универсальным фундаментальным моделям, способным адаптироваться к новым задачам без повторной настройки. В центре внимания — GraspGen-X для роботов, LCDrive для автомобилей и NitroGen для агентов в виртуальных средах. Две работы, NitroGen и PixelDIT, стали финалистами конкурса на лучшую статью среди более 4000 принятых работ.

Универсальность роботизированного захвата

Традиционные системы управления захватом требуют отдельного обучения под каждый тип манипулятора. Если робот меняет «руку», алгоритм нужно переучивать с нуля. GraspGen-X устраняет эту зависимость, выступая в роли универсальной модели, которая понимает геометрию и физику контакта. Она способна предложить надежную траекторию захвата для любого объекта и любого типа захвата, с которыми ранее не сталкивалась.

Для создания такой модели исследователи сгенерировали 2 миллиарда симулированных захватов. Это объем данных, недостижимый для сбора в реальном мире. Модель обучалась на тысячах форм объектов и конфигураций захватчиков, охватывая всё разнообразие, с которым может столкнуться робот в эксплуатации.

Важный нюанс: Внедрение GraspGen-X позволяет компаниям отказаться от привязки к одному типу оборудования, сокращая время вывода роботов на рынок за счет отсутствия необходимости в циклах дообучения под каждый новый манипулятор.

Модель работает в связке с библиотекой планирования движения curoboV2, ускоренной через CUDA. Это позволяет роботам выполнять захват в неизвестных средах сразу после получения геометрии объекта и захватчика.

Ускорение принятия решений в автономном вождении

Автономные транспортные средства сталкиваются с ограничением вычислительных ресурсов. Современные методы, использующие текстовое логическое рассуждение (chain-of-thought), требуют генерации множества токенов, что замедляет реакцию системы. LCDrive предлагает заменить текстовые рассуждения на компактные латентные представления.

Вместо того чтобы «думать» словами, система оперирует сжатыми состояниями, кодирующими пространственную информацию. Архитектура работает по циклу: предложение действия, предсказание состояния мира после этого действия и уточнение следующего шага. Это сохраняет логику принятия решений, но требует в 2 раза меньше токенов по сравнению с текстовыми методами.

Модель построена на базе NVIDIA Alpamayo и обучена с использованием данных, полученных от реальных автомобилей. Результат — качество траектории движения, сопоставимое с текстовыми моделями, но при значительно меньшей нагрузке на процессор автомобиля.

Обучение агентов в виртуальных мирах

Принцип обучения роботов через разнообразие ситуаций, заложенный в модели Isaac GR00T, получил развитие в проекте NitroGen. Эта модель использует архитектуру GR00T для обучения агентов в виртуальных средах, в частности в видеоиграх. Игры предоставляют структурированные миры с четкими целями, что делает их идеальным полигоном для отработки навыков.

Агенты, обученные с помощью NitroGen, прошли через 1000 различных игр и 40 000 часов взаимодействия. Они демонстрируют способность к обобщению навыков в таких жанрах, как боевые RPG, платформеры и игры с открытым миром. В условиях малых данных (когда агент видит лишь несколько примеров новой среды) использование NitroGen повышает производительность на 52% по сравнению с предыдущими методами.

Стоит учесть: Использование видеоигр как среды обучения позволяет создавать адаптивных неигровых персонажей и тестировать сложные сценарии поведения, которые трудно воспроизвести в физическом мире или стандартных симуляторах.

Модель NitroGen доступна с открытым исходным кодом на платформах GitHub и Hugging Face. Это дает разработчикам возможность использовать готовые навыки для создания роботов, способных выполнять бытовые задачи по общим инструкциям, например, «убери эти предметы в кладовую».

Операционные последствия и скрытые риски

На основе представленных данных можно выделить несколько практических аспектов для внедрения:

  • Снижение затрат на разработку: Переход на фундаментальные модели типа GraspGen-X уменьшает потребность в сборе уникальных датасетов для каждого нового робота, что сокращает время и бюджет на запуск проектов.
  • Эффективность вычислений: Внедрение LCDrive позволяет использовать более мощные алгоритмы принятия решений на существующем бортовом оборудовании без необходимости апгрейда «железа», что критично для масштабирования автопарков.
  • Зависимость от симуляции: Высокая точность моделей GraspGen-X и NitroGen напрямую зависит от качества симуляции. Разрыв между виртуальным обучением и реальным миром (sim-to-real gap) остается фактором, требующим валидации на физических прототипах.
  • Доступность технологий: Открытость исходного кода NitroGen и инструментов Isaac GR00T демократизирует доступ к передовым методам обучения, позволяя небольшим компаниям конкурировать с крупными игроками.

На фоне этого: Успех данных моделей подтверждает тренд на использование синтетических данных и виртуальных сред как основного источника обучения для ИИ, что меняет подход к сбору данных в робототехнике и автономном транспорте.

Коротко о главном

Почему модель GraspGen-X устраняет необходимость переобучения при смене манипулятора?

Модель была обучена на 2 миллиардах симулированных захватов, что позволило ей понять геометрию и физику контакта для любых типов роботов и объектов. Это дает компаниям возможность запускать роботов на рынок быстрее, так как отпадает потребность в циклах дообучения под каждый новый тип «руки».

Как LCDrive снижает вычислительную нагрузку на автономные транспортные средства?

Система заменяет ресурсоемкие текстовые рассуждения на компактные латентные представления, что сокращает потребление токенов в 2 раза по сравнению с традиционными методами. Благодаря этому качество траектории движения сохраняется на уровне текстовых моделей, но без перегрузки бортового процессора.

На сколько процентов NitroGen повышает производительность агентов в условиях малых данных?

Использование этой архитектуры позволяет увеличить эффективность на 52% при обучении на ограниченном количестве примеров новых сред. Такой результат был достигнут после прохождения агентами 1000 различных игр и 40 000 часов взаимодействия в виртуальных мирах.

Почему видеоигры стали ключевой средой для обучения модели NitroGen?

Игры предоставляют структурированные миры с четкими целями, что позволяет отрабатывать навыки в жанрах от RPG до платформеров, которые трудно воспроизвести в физическом мире. Это обучение обеспечивает агентам способность к обобщению навыков для выполнения бытовых задач по общим инструкциям.

Какие две работы NVIDIA стали финалистами конкурса на лучшую статью?

Модели NitroGen и PixelDIT были отмечены как финалисты среди более 4000 принятых работ конференции. Этот статус подтверждает актуальность подхода к обучению агентов через виртуальные среды и использование синтетических данных.

Как открытость исходного кода NitroGen влияет на рынок робототехники?

Публикация кода на GitHub и Hugging Face позволяет небольшим компаниям использовать готовые навыки для создания роботов, способных конкурировать с крупными игроками. Это снижает барьеры для входа в отрасль, предоставляя доступ к передовым методам обучения без необходимости их самостоятельной разработки.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Транспорт и логистика; Беспилотный транспорт; Передовые технологии; Робототехника

Материалы по теме