NVIDIA Vera Rubin NVL72: 10-кратный рост эффективности меняет экономику ИИ-фабрик
NVIDIA запустила массовое производство платформы Vera Rubin, которая повышает энергоэффективность вычислений в 10 раз. Это делает рентабельным запуск сложных ИИ-агентов, ранее сдерживаемых колоссальными затратами на электричество.
Компания NVIDIA перевела в серию новую платформу Vera Rubin, ориентированную на снижение стоимости генерации токенов и повышение энергоэффективности. Первые системы Vera Rubin NVL72 уже запущены у партнеров: CoreWeave, Google Cloud, Microsoft Azure и Oracle Cloud Infrastructure. Ключевое преимущество новой архитектуры — рост производительности на ватт энергии в 10 раз по сравнению с предыдущим поколением Grace Blackwell NVL72. Это позволяет запускать сложные агентные системы, потребляющие до 15 раз больше вычислительных ресурсов, без критического роста затрат на электричество.
Важный нюанс: Для ИИ-фабрик, ограниченных лимитами на энергопотребление, метрика «токенов на мегаватт» становится важнее чистой скорости вычислений. Новая платформа меняет экономику проектов, делая рентабельным запуск задач, которые ранее были слишком дороги в эксплуатации.
Архитектура «от чипа до сети» и отказ от кабельных систем
Платформа построена на принципе экстремального совместного проектирования семи чипов и пяти типов стоек. Все компоненты спроектированы как единая система, а не как набор стандартных деталей. В центре архитектуры находится процессор NVIDIA Vera CPU с ядром Olympus. Он обеспечивает в 2 раза более высокую производительность в однопоточных задачах и на 40% снижает задержки памяти по сравнению с конкурентными решениями. Это критично для работы агентных систем, требующих быстрой обработки сложных логических цепочек.
Сетевая подсистема использует шестое поколение NVLink для соединения внутри стойки и коммутаторы Spectrum-6 для масштабирования между стойками. Скорость передачи данных внутри системы выросла в 2 раза, а задержки снизились в 3 раза по сравнению с обычным Ethernet. Для связи между удаленными площадками применяется технология Spectrum-XGS, увеличивающая пропускную способность в 1,9 раза.
Конструкция стоек Vera Rubin NVL72 исключает использование кабелей, вентиляторов и шлангов внутри вычислительных лотков. Сборка одного лотка сократилась с часов до одной минуты. Система жидкостного охлаждения работает при температуре входа 45 градусов Цельсия, что позволяет использовать сухие охладители без чиллеров. Это снижает потребление воды на миллионы галлонов в год на каждый мегаватт мощности.
Стоит учесть: Отказ от кабельных соединений внутри стоек не только ускоряет монтаж, но и устраняет один из главных источников отказов в дата-центрах. Это упрощает обслуживание и повышает общую надежность инфраструктуры.
Партнерство с Microsoft и Mistral для европейского рынка
В Европе платформа станет основой для расширения сотрудничества между Microsoft и французской компанией Mistral. Стороны подписали соглашение на сумму в миллиарды долларов для развития инфраструктуры, соответствующей локальным требованиям к суверенитету данных. Mistral планирует развернуть тысячи чипов Vera Rubin для увеличения доступных вычислительных мощностей.
Решение позволяет запускать модели Mistral Medium 3.5 и OCR 4 в среде Microsoft Foundry и интегрировать их в Copilot Studio. Клиенты смогут использовать единые инструменты как в облаке, так и в изолированных частных средах (Azure Local). Это дает возможность государственным органам, банкам и медицинским учреждениям обрабатывать чувствительные данные внутри региона, соблюдая местные законы о защите информации.
На фоне этого: Европейские регуляторы получают техническую базу для реализации концепции «суверенного ИИ». Компании больше не вынуждены выбирать между инновациями, экономикой и контролем над данными.
Результаты тестирования у партнеров и новые возможности
Компания CoreWeave первой провела бенчмаркинг на реальном оборудовании. Тесты модели DeepSeek-R1 показали рост пропускной способности в 10 раз на мегаватт энергии. Архитектура MoE (смесь экспертов) этой модели требует интенсивного обмена данными между чипами, что полностью реализует потенциал новой сети NVLink с пропускной способностью 260 ТБ/с.
Google Cloud запустила инстансы A5X для стартапа Ineffable Intelligence. Компания разрабатывает системы «суперобучения», которые получают знания через взаимодействие с симулированной средой, а не через статические датасеты. Для таких задач критичны низкие задержки и высокая пропускная способность памяти. Инфраструктура A5X позволяет масштабировать кластеры до десятков тысяч чипов в одном месте и до миллиона в распределенных конфигурациях.
Платформа DeepInfra протестировала процессор Vera CPU в задачах оркестрации агентов. Результаты показали рост скорости управления в 2,2 раза и возможность обслуживать на 60% больше одновременных агентов при сохранении качества сервиса. Это подтверждает, что производительность центрального процессора становится узким местом для сложных агентных систем.
Операционные последствия, тренды и практические аспекты
- Снижение операционных расходов (OPEX): Рост эффективности в 10 раз на мегаватт позволяет компаниям либо увеличить объем вычислений при том же бюджете на электричество, либо сохранить текущую нагрузку при значительном снижении затрат. Это меняет модель окупаемости для крупных ИИ-проектов.
- Упрощение логистики и обслуживания: Конструкция без кабелей внутри стоек и возможность работы с высокотемпературным охлаждением снижают требования к инфраструктуре дата-центров. Это ускоряет развертывание новых мощностей и снижает риски, связанные с отказом систем охлаждения.
- Новые требования к сетевому оборудованию: Переход на специализированные коммутаторы Spectrum-6 и оптические модули требует обновления сетевой инфраструктуры. Стандартные решения Ethernet больше не обеспечивают необходимую производительность для масштабных ИИ-кластеров.
- Сдвиг фокуса на процессоры: Рост сложности агентных систем делает производительность CPU критическим фактором. Компании, использующие устаревшие процессоры, столкнутся с ограничением в количестве одновременно работающих агентов, даже при наличии мощных GPU.
Источник: blogs.nvidia.com