NVIDIA Rubin снижает стоимость токенов ИИ в 10 раз, но требует полной замены инфраструктуры
Платформа Rubin требует полной замены дата-центров, так как старые серверы не раскроют заявленное десятикратное снижение стоимости генерации токенов. Отказ от модернизации инфраструктуры превратит владение ИИ-решениями в убыточный актив из-за скрытых издержек на неэффективную сеть и память.
На выставке CES 2026 NVIDIA представила платформу Rubin, которая официально перешла в стадию полного производства. Это первое в истории компании решение с экстремальным совместным проектированием из шести чипов, созданное для снижения стоимости генерации токенов искусственного интеллекта в 10 раз по сравнению с предыдущим поколением. Параллельно компания анонсировала открытую модель Alpamayo для автономного вождения, а также расширила линейку продуктов для персональных компьютеров и робототехники, стремясь внедрить ИИ в каждое устройство.
Архитектура нового поколения: платформа Rubin
Основой обновления стала платформа Rubin, названная в честь астронома Веры Рубин. Она пришла на смену архитектуре Blackwell и представляет собой не просто набор компонентов, а единый оптимизированный стек. Ключевая особенность — экстремальное совместное проектирование (extreme codesign), когда все элементы создаются синхронно для устранения узких мест в передаче данных и вычислений.
Платформа включает следующие компоненты:
- Rubin GPUs: обеспечивают производительность 50 петафлопс в режиме инференса с точностью NVFP4.
- Vera CPUs: процессоры, спроектированные специально для управления потоками данных и агентской обработки.
- NVLink 6: технология масштабирования внутри сервера (scale-up).
- Spectrum-X Ethernet: решение для масштабирования между серверами (scale-out) с использованием фотоники.
- ConnectX-9 SuperNICs и BlueField-4 DPUs: сетевые и вычислительные ускорители.
Дополнительно была представлена система хранения данных NVIDIA Inference Context Memory Storage Platform. Это специализированный уровень кэша для контекста (KV-cache), который ускоряет работу с длинными контекстами. Заявленные показатели эффективности:
- В 5 раз больше токенов в секунду.
- В 5 раз выше производительность на доллар совокупной стоимости владения (TCO).
- В 5 раз выше энергоэффективность.
Важный нюанс: Переход к экстремальному совместному проектированию означает, что компании больше не могут просто заменить один чип в сервере. Для получения заявленной производительности требуется полная замена инфраструктуры: от чипов до стоек и сетевого оборудования.
Открытые модели и физический интеллект
NVIDIA смещает фокус с закрытых решений на открытые модели, обученные на собственных суперкомпьютерах. Это создает глобальную экосистему, где разработчики могут создавать, оценивать и развертывать модели. Портфель охватывает шесть ключевых направлений:
- Clara: здравоохранение.
- Earth-2: климатическая наука.
- Nemotron: логическое мышление и мультимодальный ИИ.
- Cosmos: робототехника и симуляция.
- GR00T: воплощенный интеллект (embodied intelligence).
- Alpamayo: автономное вождение.
Особое внимание уделено модели Alpamayo — семейству открытых моделей, объединяющих зрение, язык и действия (VLA). Она включает Alpamayo R1 (первая открытая модель с логическим мышлением для автономного вождения) и AlpaSim (полностью открытый сценарий симуляции для тестирования).
Первый серийный автомобиль с этой технологией — Mercedes-Benz CLA. Машина построена на базе платформы NVIDIA DRIVE и получит возможность автономного вождения уровня 4 в США в текущем году. Также набирает обороты платформа DRIVE Hyperion, модульное решение уровня 4, которое уже используют ведущие автопроизводители и поставщики роботакси.
Стоит учесть: Открытость моделей Alpamayo и Cosmos позволяет обучать роботов и авто в виртуальных мирах на синтетических данных. Это снижает необходимость в сборе миллионов часов реальных дорожных испытаний, что критически ускоряет вывод технологий на рынок.
ИИ на рабочем столе и в играх
Компания демонстрирует, что мощные ИИ-агенты теперь могут работать локально. На примере персонального суперкомпьютера DGX Spark был показан агент, управляющий роботом Reachy Mini с использованием моделей Hugging Face. DGX Spark обеспечивает ускорение работы крупных моделей в 2,6 раза и поддерживает новые модели генерации изображений Lightricks LTX-2 и FLUX.
В игровом сегменте представлен DLSS 4.5 с функцией динамической генерации нескольких кадров (Dynamic Multi Frame Generation) и режимом 6X. Технология уже поддерживается более чем в 250 играх и приложениях, включая новинки 007 First Light, Phantom Blade Zero, PRAGMATA и Resident Evil Requiem.
Дополнительные обновления для геймеров и создателей:
- RTX Remix Logic: позволяет моддерам привязывать графические эффекты к событиям в реальном времени.
- NVIDIA ACE: технология, добавляющая долгосрочную память и эволюционирующий интеллект NPC (например, в PUBG: BATTLEGROUNDS).
- G-SYNC Pulsar: мониторы с эффективной частотой обновления более 1000 Гц и адаптивной подсветкой.
- Поддержка GeForce NOW на Linux и устройствах Amazon Fire TV.
Операционные последствия и скрытые риски
На основе представленных данных можно выделить несколько практических аспектов для бизнеса и разработчиков:
- Зависимость от полного стека: Внедрение платформы Rubin потребует полной модернизации дата-центров. Попытка использовать новые GPU в старой инфраструктуре не даст заявленного снижения стоимости токенов в 10 раз, так как узкими местами станут сеть и память.
- Снижение порога входа для автономного вождения: Открытость моделей Alpamayo и симуляторов AlpaSim позволяет средним автопроизводителям и стартапам создавать решения уровня 4 без необходимости строить собственные гигантские симуляционные фермы с нуля.
- Энергоэффективность как драйвер: Увеличение энергоэффективности в 5 раз делает развертывание ИИ экономически оправданным в регионах с высокой стоимостью электроэнергии или жесткими квотами на потребление.
- Локализация вычислений: Появление мощных персональных решений (DGX Spark) смещает часть инференса из облака на устройство пользователя, что может снизить затраты на передачу данных и повысить конфиденциальность, но требует пересмотра архитектуры приложений.
На фоне этого: Успех стратегии NVIDIA теперь зависит не только от продаж чипов, но и от скорости, с которой разработчики смогут адаптировать свои приложения под новую архитектуру Rubin и открытые модели. Те, кто отложит переход, рискуют столкнуться с резким ростом стоимости владения ИИ-решениями по сравнению с конкурентами.
Источник: blogs.nvidia.com