Июль 2026   |   В фокусе

NVIDIA Cosmos 3 Edge запускает роботов без облака — решения в реальном времени

NVIDIA выпустила компактную модель ИИ, которая позволяет роботам принимать решения мгновенно, без задержек на связь с облаком. Это устраняет главную проблему автономных систем — риск сбоя при потере сети и открывает путь к безопасному внедрению роботов в реальный производственный процесс.

Компания NVIDIA представила модель Cosmos 3 Edge — инструмент для искусственного интеллекта, способный работать непосредственно на роботизированных устройствах без подключения к облачным серверам. Модель объемом 4 миллиарда параметров позволяет роботам анализировать окружение, предсказывать последствия действий и принимать решения в реальном времени. Продукт доступен для скачивания на платформе Hugging Face и оптимизирован для работы на вычислительных модулях NVIDIA Jetson, RTX PRO и DGX.

Важный нюанс: Перенос сложных вычислений с дата-центров на сами устройства устраняет задержки связи, что критично для задач, где скорость реакции определяет безопасность, например, при управлении промышленными манипуляторами.

Архитектура и возможности модели

Модель построена на архитектуре «мирового моделирования» (world modeling), которая учит ИИ понимать не только текущее состояние сцены, но и динамику изменений. В отличие от простых систем распознавания, Cosmos 3 Edge связывает визуальные данные с физическими действиями.

Ключевые особенности архитектуры:

  • Два трансформера: Один блок обрабатывает текст и изображения для понимания контекста, второй — видео, звук и действия для генерации предсказаний.
  • Единое представление: Разные типы действий (движение камеры, поворот манипулятора, захват объекта) переводятся в общие геометрические векторы. Это позволяет модели связывать изменение пикселей на экране с конкретным физическим движением.
  • Режим политики (Policy Mode): Модель не просто предсказывает картинку, но и выдает команду действию, одновременно симулируя его визуальный результат.

Система работает с разрешением 640×360 пикселей, что достаточно для управления роботами. На модуле NVIDIA Jetson Thor модель генерирует 32 действия за один цикл вывода, обеспечивая частоту управления 15 Гц. По результатам тестов на бенчмарке VANTAGE-Bench, Cosmos 3 Edge занимает первое место среди моделей своего размера в задачах визуального анализа и обучения робототехнических политик.

Стоит учесть: Способность модели предсказывать визуальный результат действия до его выполнения позволяет обучать роботов на симуляции, снижая риск поломки оборудования при реальных тренировках.

Инструменты для разработчиков и оптимизация

NVIDIA предоставила не только базовую модель, но и набор инструментов для её адаптации под конкретные задачи. Разработчики могут дообучать (fine-tune) модель на своих данных, используя кластеры на базе H100 или станции NVIDIA DGX Station, а затем развертывать результат на периферийных устройствах.

В релиз вошли следующие компоненты:

  • Cosmos 3 Edge Policy (DROID): Версия модели, дообученная на наборе данных DROID для задач «взять и положить» (pick-and-place).
  • Скрипты дообучения: Готовые алгоритмы для адаптации модели под узкоспециализированные применения.
  • Cosmos 3 Super 4-Step: Оптимизированная версия для генерации изображений и видео. Она сокращает количество шагов шумоподавления с 35–50 до 4, ускоряя вывод в 25 раз без потери качества.

Компания планирует дальнейшее развитие платформы, включая симуляцию сценариев вождения и улучшение интерактивной генерации миров. Также ведется работа по оптимизации вычислений через открытые фреймворки, такие как vLLM, чтобы сократить время и ресурсы, необходимые для создания прикладных моделей.

Операционные последствия и технические барьеры

  • Требования к оборудованию: Для эффективной работы модели необходимы специализированные ускорители NVIDIA (серии Jetson, RTX, DGX). Использование стандартных процессоров или чипов других производителей может не обеспечить заявленную скорость вывода в реальном времени.
  • Ресурсы для адаптации: Хотя сама модель компактна, процесс её дообучения под специфические задачи требует доступа к мощным вычислительным кластерам (например, с картами H100), что создает порог входа для малых разработчиков.
  • Снижение зависимости от сети: Развертывание модели на устройстве (on-device) устраняет необходимость в постоянной высокоскоростной передаче видеопотока в облако, что упрощает внедрение в удаленных или защищенных зонах с ограниченным интернетом.
  • Ускорение разработки: Использование предобученных чекпоинтов и скриптов дистилляции позволяет сократить время настройки ИИ-решений с недель до дней, так как разработчикам не нужно создавать архитектуру с нуля.

На фоне этого: Появление открытых, оптимизированных моделей для периферийных устройств может ускорить массовое внедрение автономных роботов в логистике и производстве, где критична автономность и низкая задержка.

Коротко о главном

Какую частоту управления обеспечивает модель на модуле Jetson Thor?

На этом вычислительном модуле система генерирует 32 действия за цикл, достигая частоты 15 Гц, что необходимо для безопасного и быстрого реагирования промышленных манипуляторов.

Как архитектура модели связывает визуальные данные с физическими действиями?

Два трансформера переводят различные движения в общие геометрические векторы, позволяя системе связывать изменение пикселей на экране с конкретными физическими перемещениями манипулятора.

Как версия Cosmos 3 Super 4-Step ускоряет генерацию контента?

Оптимизированная модель сокращает количество шагов шумоподавления с 35–50 до 4, что увеличивает скорость вывода в 25 раз без снижения качества изображений и видео.

Какое оборудование требуется для эффективного дообучения модели?

Адаптация под специфические задачи требует доступа к мощным кластерам с ускорителями H100 или станциям DGX, что создает высокий порог входа для небольших разработчиков.

Какое место занимает модель в бенчмарке VANTAGE-Bench?

Cosmos 3 Edge заняла первое место среди аналогичных по размеру систем в задачах визуального анализа и обучения робототехнических политик благодаря способности предсказывать последствия действий.

Какое влияние оказывает работа модели на устройстве на внедрение в удаленных зонах?

Перенос вычислений на периферию устраняет необходимость в постоянной высокоскоростной передаче видеопотока, что упрощает использование роботов в местах с ограниченным интернетом.

Как использование готовых скриптов влияет на сроки разработки ИИ-решений?

Применение предобученных чекпоинтов и алгоритмов дистилляции сокращает время настройки с недель до дней, так как разработчикам не требуется создавать архитектуру с нуля.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Передовые технологии; Робототехника

Материалы по теме