NVIDIA GB300 NVL72: в 20 раз больше агентов на мегаватт энергии
Новый бенчмарк AgentPerf показал, что традиционные метрики скорости ответа не учитывают экспоненциальный рост нагрузки при работе цепочек действий, делая старые расчеты эффективности дата-центров ошибочными. Платформа NVIDIA GB300 NVL72 обеспечивает в 20 раз больше агентов на мегаватт энергии, заставляя бизнес пересматривать экономику внедрения ИИ с фокусом на объем полезной работы вместо количества запросов.
Компания NVIDIA представила результаты первого отраслевого теста AgentPerf, созданного для оценки инфраструктуры агентного искусственного интеллекта. Новая платформа NVIDIA GB300 NVL72 на базе архитектуры Blackwell продемонстрировала преимущество в 20 раз по количеству одновременно работающих агентов на один мегаватт энергии по сравнению с предыдущим поколением Hopper. Это изменение критично, так как агентные системы работают не как одиночные запросы, а как цепочки из десятков действий, что требует принципиально иного подхода к расчету эффективности и энергопотребления дата-центров.
Разрыв в производительности: от спринта к эстафете
Традиционные тесты ИИ измеряли скорость ответа на один вопрос, что сравнимо со спринтом. Агентный ИИ работает иначе: он разбивает сложную задачу на множество шагов, вызывая модель десятки или сотни раз подряд, выполняя код, ища данные в базах и браузере. Каждый шаг увеличивает объем контекста и нагрузку на систему. Существующие метрики не учитывают эту накопительную сложность, которая растет не линейно, а экспоненциально.
Новый бенчмарк AgentPerf от компании Artificial Analysis моделирует реальные сценарии, например, работу программиста-агента, который читает файлы, пишет код, запускает его и исправляет ошибки. Тест проводился с использованием модели DeepSeek V4 Pro, представляющей класс передовых моделей с экспертной архитектурой (MoE).
Важный нюанс: В тесте вызовы инструментов не выполнялись физически, а симулировались, чтобы изолировать влияние вычислительной мощности ускорителей от скорости работы центрального процессора.
Технические детали и архитектура
Преимущество платформы NVIDIA GB300 NVL72 достигается за счет глубокой интеграции всех уровней стека. Система объединяет 72 графических процессора в единый шкаф, что позволяет эффективно распределять выполнение крупных моделей MoE.
Ключевые факторы роста эффективности:
- CUDA-ядра: Перекрывают время вычислений и передачи данных, скрывая задержки координации между экспертами модели.
- TensorRT LLM: Оптимизирует работу при масштабировании, разделяя обработку входящих данных и генерацию ответов для независимой настройки каждого этапа.
- Энергоэффективность: При целевых показателях 20 и 60 токенов в секунду на одного агента, новая платформа поддерживает значительно больше одновременных сессий на единицу потребляемой мощности.
Для бизнеса это означает, что инвестиции в инфраструктуру теперь можно оценивать не по количеству запросов в секунду, а по объему полезной работы, которую агенты выполняют на каждый ватт энергии и доллар затрат.
Реализация в реальных проектах
Партнеры экосистемы NVIDIA уже внедряют эти решения в производство. Платформа Blackwell используется для обслуживания агентных задач на передовых моделях.
Примеры внедрения:
- Cursor: Платформа для разработки кода использует Together AI для работы в реальном времени. Агенты на базе Blackwell отлаживают ошибки, создают новые функции и проводят рефакторинг кода, пока разработчики продолжают свою работу.
- Pam.ai: Платформа для автосалонов от DeepInfra полностью работает на Blackwell. Агенты здесь занимаются записью клиентов на сервис, обработкой звонков и проведением внешних продаж.
Стоит учесть: Производительность на агентных задачах будет расти по мере оптимизации программного обеспечения. Компания уже запустила в полном объеме производство следующего поколения архитектуры NVIDIA Vera Rubin, рассчитанного на удовлетворение растущего спроса.
Операционные последствия и скрытые риски
На основе представленных данных можно выделить несколько практических выводов для планирования инфраструктуры:
- Энергетический баланс: Переход на агентные системы требует пересмотра расчетов по энергопотреблению. Старые метрики могут занижать реальную нагрузку, так как не учитывают цепочки вызовов. Эффективность новой архитектуры позволяет снизить затраты на электричество при масштабировании.
- Зависимость от ПО: Высокая производительность железа (Blackwell) реализуется только в связке с оптимизированным софтом (TensorRT LLM, CUDA). Без соответствующей настройки программного стека преимущество в 20 раз может не проявиться.
- Масштабируемость задач: Возможность запускать сотни агентов одновременно меняет экономику внедрения ИИ. Компании могут автоматизировать не отдельные процессы, а целые бизнес-циклы, требующие последовательных действий.
- Симуляция vs Реальность: Текущие результаты получены на симуляции вызовов инструментов. В реальных условиях задержки могут зависеть от скорости внешних сервисов (баз данных, API), что потребует дополнительной настройки сети и балансировки нагрузки.
На фоне этого: Инфраструктура для агентного ИИ становится узким местом, где конкуренция смещается с чистой вычислительной мощности на эффективность управления цепочками сложных задач.
Источник: blogs.nvidia.com