Июнь 2026   |   В фокусе

NVIDIA Rubin снижает стоимость токенов ИИ в 10 раз, но требует полной замены инфраструктуры

Платформа Rubin требует полной замены дата-центров, так как старые серверы не раскроют заявленное десятикратное снижение стоимости генерации токенов. Отказ от модернизации инфраструктуры превратит владение ИИ-решениями в убыточный актив из-за скрытых издержек на неэффективную сеть и память.

На выставке CES 2026 NVIDIA представила платформу Rubin, которая официально перешла в стадию полного производства. Это первое в истории компании решение с экстремальным совместным проектированием из шести чипов, созданное для снижения стоимости генерации токенов искусственного интеллекта в 10 раз по сравнению с предыдущим поколением. Параллельно компания анонсировала открытую модель Alpamayo для автономного вождения, а также расширила линейку продуктов для персональных компьютеров и робототехники, стремясь внедрить ИИ в каждое устройство.

Архитектура нового поколения: платформа Rubin

Основой обновления стала платформа Rubin, названная в честь астронома Веры Рубин. Она пришла на смену архитектуре Blackwell и представляет собой не просто набор компонентов, а единый оптимизированный стек. Ключевая особенность — экстремальное совместное проектирование (extreme codesign), когда все элементы создаются синхронно для устранения узких мест в передаче данных и вычислений.

Платформа включает следующие компоненты:

  • Rubin GPUs: обеспечивают производительность 50 петафлопс в режиме инференса с точностью NVFP4.
  • Vera CPUs: процессоры, спроектированные специально для управления потоками данных и агентской обработки.
  • NVLink 6: технология масштабирования внутри сервера (scale-up).
  • Spectrum-X Ethernet: решение для масштабирования между серверами (scale-out) с использованием фотоники.
  • ConnectX-9 SuperNICs и BlueField-4 DPUs: сетевые и вычислительные ускорители.

Дополнительно была представлена система хранения данных NVIDIA Inference Context Memory Storage Platform. Это специализированный уровень кэша для контекста (KV-cache), который ускоряет работу с длинными контекстами. Заявленные показатели эффективности:

  • В 5 раз больше токенов в секунду.
  • В 5 раз выше производительность на доллар совокупной стоимости владения (TCO).
  • В 5 раз выше энергоэффективность.

Важный нюанс: Переход к экстремальному совместному проектированию означает, что компании больше не могут просто заменить один чип в сервере. Для получения заявленной производительности требуется полная замена инфраструктуры: от чипов до стоек и сетевого оборудования.

Открытые модели и физический интеллект

NVIDIA смещает фокус с закрытых решений на открытые модели, обученные на собственных суперкомпьютерах. Это создает глобальную экосистему, где разработчики могут создавать, оценивать и развертывать модели. Портфель охватывает шесть ключевых направлений:

  • Clara: здравоохранение.
  • Earth-2: климатическая наука.
  • Nemotron: логическое мышление и мультимодальный ИИ.
  • Cosmos: робототехника и симуляция.
  • GR00T: воплощенный интеллект (embodied intelligence).
  • Alpamayo: автономное вождение.

Особое внимание уделено модели Alpamayo — семейству открытых моделей, объединяющих зрение, язык и действия (VLA). Она включает Alpamayo R1 (первая открытая модель с логическим мышлением для автономного вождения) и AlpaSim (полностью открытый сценарий симуляции для тестирования).

Первый серийный автомобиль с этой технологией — Mercedes-Benz CLA. Машина построена на базе платформы NVIDIA DRIVE и получит возможность автономного вождения уровня 4 в США в текущем году. Также набирает обороты платформа DRIVE Hyperion, модульное решение уровня 4, которое уже используют ведущие автопроизводители и поставщики роботакси.

Стоит учесть: Открытость моделей Alpamayo и Cosmos позволяет обучать роботов и авто в виртуальных мирах на синтетических данных. Это снижает необходимость в сборе миллионов часов реальных дорожных испытаний, что критически ускоряет вывод технологий на рынок.

ИИ на рабочем столе и в играх

Компания демонстрирует, что мощные ИИ-агенты теперь могут работать локально. На примере персонального суперкомпьютера DGX Spark был показан агент, управляющий роботом Reachy Mini с использованием моделей Hugging Face. DGX Spark обеспечивает ускорение работы крупных моделей в 2,6 раза и поддерживает новые модели генерации изображений Lightricks LTX-2 и FLUX.

В игровом сегменте представлен DLSS 4.5 с функцией динамической генерации нескольких кадров (Dynamic Multi Frame Generation) и режимом 6X. Технология уже поддерживается более чем в 250 играх и приложениях, включая новинки 007 First Light, Phantom Blade Zero, PRAGMATA и Resident Evil Requiem.

Дополнительные обновления для геймеров и создателей:

  • RTX Remix Logic: позволяет моддерам привязывать графические эффекты к событиям в реальном времени.
  • NVIDIA ACE: технология, добавляющая долгосрочную память и эволюционирующий интеллект NPC (например, в PUBG: BATTLEGROUNDS).
  • G-SYNC Pulsar: мониторы с эффективной частотой обновления более 1000 Гц и адаптивной подсветкой.
  • Поддержка GeForce NOW на Linux и устройствах Amazon Fire TV.

Операционные последствия и скрытые риски

На основе представленных данных можно выделить несколько практических аспектов для бизнеса и разработчиков:

  • Зависимость от полного стека: Внедрение платформы Rubin потребует полной модернизации дата-центров. Попытка использовать новые GPU в старой инфраструктуре не даст заявленного снижения стоимости токенов в 10 раз, так как узкими местами станут сеть и память.
  • Снижение порога входа для автономного вождения: Открытость моделей Alpamayo и симуляторов AlpaSim позволяет средним автопроизводителям и стартапам создавать решения уровня 4 без необходимости строить собственные гигантские симуляционные фермы с нуля.
  • Энергоэффективность как драйвер: Увеличение энергоэффективности в 5 раз делает развертывание ИИ экономически оправданным в регионах с высокой стоимостью электроэнергии или жесткими квотами на потребление.
  • Локализация вычислений: Появление мощных персональных решений (DGX Spark) смещает часть инференса из облака на устройство пользователя, что может снизить затраты на передачу данных и повысить конфиденциальность, но требует пересмотра архитектуры приложений.

На фоне этого: Успех стратегии NVIDIA теперь зависит не только от продаж чипов, но и от скорости, с которой разработчики смогут адаптировать свои приложения под новую архитектуру Rubin и открытые модели. Те, кто отложит переход, рискуют столкнуться с резким ростом стоимости владения ИИ-решениями по сравнению с конкурентами.

Коротко о главном

Почему внедрение Rubin требует полной замены инфраструктуры дата-центров?

Архитектура Rubin построена на синхронном создании чипов, памяти и сетевого оборудования, поэтому замена только графических процессоров не позволит достичь заявленной производительности. Для реализации потенциала системы необходимо обновить всё оборудование, от серверных стоек до коммутаторов, иначе возникнут критические ограничения в скорости передачи данных.

Какие показатели эффективности демонстрирует новая система хранения контекста?

Специализированная платформа NVIDIA Inference Context Memory Storage Platform обеспечивает ускорение обработки длинных контекстов в 5 раз за счет оптимизации кэша KV-cache. Это решение также повышает производительность на доллар совокупной стоимости владения и энергоэффективность в 5 раз, делая работу с большими объемами данных экономически выгодной.

Как модель Alpamayo ускоряет вывод автономных автомобилей на рынок?

Открытая модель Alpamayo объединяет зрение, язык и действия, позволяя обучать системы автономного вождения в виртуальных симуляторах на синтетических данных. Это исключает необходимость сбора миллионов часов реальных дорожных испытаний, что критически сокращает сроки разработки и позволяет Mercedes-Benz CLA получить уровень автономности 4 уже в текущем году.

Какие возможности предоставляет персональный суперкомпьютер DGX Spark для локального ИИ?

Устройство DGX Spark ускоряет работу крупных моделей в 2,6 раза, позволяя запускать мощных ИИ-агентов и управлять роботами непосредственно на устройстве пользователя. Локализация вычислений снижает затраты на передачу данных в облако и повышает конфиденциальность, но требует адаптации архитектуры приложений под новые требования.

Сколько игр уже поддерживают новую технологию DLSS 4.5?

Технология DLSS 4.5 с функцией динамической генерации нескольких кадров уже интегрирована в более чем 250 игр и приложений, включая новинки вроде 007 First Light и Resident Evil Requiem. Обновление позволяет увеличить частоту кадров в режиме 6X, обеспечивая плавную картинку в требовательных проектах без потери качества.

Какие риски возникают для бизнеса при отказе от перехода на новую архитектуру?

Компании, отложившие модернизацию под платформу Rubin, столкнутся с резким ростом стоимости владения ИИ-решениями по сравнению с конкурентами, использующими полный стек оборудования. Успех стратегии NVIDIA зависит от скорости адаптации разработчиков, так как частичное внедрение не даст ожидаемого снижения операционных расходов.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Транспорт и логистика; Беспилотный транспорт; Передовые технологии

Материалы по теме