Июнь 2026   |   В фокусе

NVIDIA GB300 NVL72: в 20 раз больше агентов на мегаватт энергии

Новый бенчмарк AgentPerf показал, что традиционные метрики скорости ответа не учитывают экспоненциальный рост нагрузки при работе цепочек действий, делая старые расчеты эффективности дата-центров ошибочными. Платформа NVIDIA GB300 NVL72 обеспечивает в 20 раз больше агентов на мегаватт энергии, заставляя бизнес пересматривать экономику внедрения ИИ с фокусом на объем полезной работы вместо количества запросов.

Компания NVIDIA представила результаты первого отраслевого теста AgentPerf, созданного для оценки инфраструктуры агентного искусственного интеллекта. Новая платформа NVIDIA GB300 NVL72 на базе архитектуры Blackwell продемонстрировала преимущество в 20 раз по количеству одновременно работающих агентов на один мегаватт энергии по сравнению с предыдущим поколением Hopper. Это изменение критично, так как агентные системы работают не как одиночные запросы, а как цепочки из десятков действий, что требует принципиально иного подхода к расчету эффективности и энергопотребления дата-центров.

Разрыв в производительности: от спринта к эстафете

Традиционные тесты ИИ измеряли скорость ответа на один вопрос, что сравнимо со спринтом. Агентный ИИ работает иначе: он разбивает сложную задачу на множество шагов, вызывая модель десятки или сотни раз подряд, выполняя код, ища данные в базах и браузере. Каждый шаг увеличивает объем контекста и нагрузку на систему. Существующие метрики не учитывают эту накопительную сложность, которая растет не линейно, а экспоненциально.

Новый бенчмарк AgentPerf от компании Artificial Analysis моделирует реальные сценарии, например, работу программиста-агента, который читает файлы, пишет код, запускает его и исправляет ошибки. Тест проводился с использованием модели DeepSeek V4 Pro, представляющей класс передовых моделей с экспертной архитектурой (MoE).

Важный нюанс: В тесте вызовы инструментов не выполнялись физически, а симулировались, чтобы изолировать влияние вычислительной мощности ускорителей от скорости работы центрального процессора.

Технические детали и архитектура

Преимущество платформы NVIDIA GB300 NVL72 достигается за счет глубокой интеграции всех уровней стека. Система объединяет 72 графических процессора в единый шкаф, что позволяет эффективно распределять выполнение крупных моделей MoE.

Ключевые факторы роста эффективности:

  • CUDA-ядра: Перекрывают время вычислений и передачи данных, скрывая задержки координации между экспертами модели.
  • TensorRT LLM: Оптимизирует работу при масштабировании, разделяя обработку входящих данных и генерацию ответов для независимой настройки каждого этапа.
  • Энергоэффективность: При целевых показателях 20 и 60 токенов в секунду на одного агента, новая платформа поддерживает значительно больше одновременных сессий на единицу потребляемой мощности.

Для бизнеса это означает, что инвестиции в инфраструктуру теперь можно оценивать не по количеству запросов в секунду, а по объему полезной работы, которую агенты выполняют на каждый ватт энергии и доллар затрат.

Реализация в реальных проектах

Партнеры экосистемы NVIDIA уже внедряют эти решения в производство. Платформа Blackwell используется для обслуживания агентных задач на передовых моделях.

Примеры внедрения:

  • Cursor: Платформа для разработки кода использует Together AI для работы в реальном времени. Агенты на базе Blackwell отлаживают ошибки, создают новые функции и проводят рефакторинг кода, пока разработчики продолжают свою работу.
  • Pam.ai: Платформа для автосалонов от DeepInfra полностью работает на Blackwell. Агенты здесь занимаются записью клиентов на сервис, обработкой звонков и проведением внешних продаж.

Стоит учесть: Производительность на агентных задачах будет расти по мере оптимизации программного обеспечения. Компания уже запустила в полном объеме производство следующего поколения архитектуры NVIDIA Vera Rubin, рассчитанного на удовлетворение растущего спроса.

Операционные последствия и скрытые риски

На основе представленных данных можно выделить несколько практических выводов для планирования инфраструктуры:

  • Энергетический баланс: Переход на агентные системы требует пересмотра расчетов по энергопотреблению. Старые метрики могут занижать реальную нагрузку, так как не учитывают цепочки вызовов. Эффективность новой архитектуры позволяет снизить затраты на электричество при масштабировании.
  • Зависимость от ПО: Высокая производительность железа (Blackwell) реализуется только в связке с оптимизированным софтом (TensorRT LLM, CUDA). Без соответствующей настройки программного стека преимущество в 20 раз может не проявиться.
  • Масштабируемость задач: Возможность запускать сотни агентов одновременно меняет экономику внедрения ИИ. Компании могут автоматизировать не отдельные процессы, а целые бизнес-циклы, требующие последовательных действий.
  • Симуляция vs Реальность: Текущие результаты получены на симуляции вызовов инструментов. В реальных условиях задержки могут зависеть от скорости внешних сервисов (баз данных, API), что потребует дополнительной настройки сети и балансировки нагрузки.

На фоне этого: Инфраструктура для агентного ИИ становится узким местом, где конкуренция смещается с чистой вычислительной мощности на эффективность управления цепочками сложных задач.

Коротко о главном

Как бенчмарк AgentPerf отличается от традиционных тестов производительности ИИ?

Новый тест моделирует реальные сценарии работы программиста-агента, который последовательно читает файлы, пишет код и исправляет ошибки, вместо измерения скорости ответа на один вопрос. Это позволяет оценить накопительную сложность задач, которая растет экспоненциально из-за увеличения объема контекста и количества вызовов модели, что не учитывалось в старых метриках.

Зачем в тестировании использовалась симуляция вызовов инструментов вместо их физического выполнения?

Симуляция была внедрена, чтобы изолировать влияние вычислительной мощности ускорителей от скорости работы центрального процессора и внешних сервисов. Это позволило точно оценить эффективность аппаратной части без искажения результатов задержками, зависящими от скорости баз данных или API.

Какую роль играют CUDA-ядра и TensorRT LLM в достижении высокой эффективности платформы?

CUDA-ядра скрывают задержки координации между экспертами модели, перекрывая время вычислений и передачи данных, а TensorRT LLM разделяет обработку входящих данных и генерацию ответов для независимой настройки каждого этапа. Совместная работа этих компонентов позволяет системе поддерживать целевые показатели в 20 и 60 токенов в секунду на одного агента при масштабировании.

Как меняется подход к оценке инвестиций в инфраструктуру ИИ для бизнеса?

Компании теперь могут оценивать затраты не по количеству запросов в секунду, а по объему полезной работы, которую агенты выполняют на каждый ватт энергии и доллар затрат. Это изменение обусловлено тем, что агентные системы автоматизируют целые бизнес-циклы с последовательными действиями, а не отдельные процессы.

Какие примеры реального внедрения платформы Blackwell уже существуют?

Платформа Cursor использует Blackwell через Together AI для автоматического отладки кода и создания функций, а сервис Pam.ai от DeepInfra полностью работает на этой архитектуре для записи клиентов и обработки звонков в автосалонах. Эти решения демонстрируют способность инфраструктуры обслуживать сложные агентные задачи в реальном времени.

Почему переход на агентные системы требует пересмотра расчетов энергопотребления дата-центров?

Старые метрики занижают реальную нагрузку, так как не учитывают цепочки вызовов, характерные для работы агентов, что приводит к ошибкам в планировании энергетического баланса. Новая архитектура позволяет снизить затраты на электричество при масштабировании, но только при условии использования оптимизированного программного стека.

Какие риски связаны с зависимостью производительности от программного обеспечения?

Высокая эффективность железа архитектуры Blackwell реализуется только в связке с оптимизированным софтом, таким как TensorRT LLM и CUDA, без которого заявленное преимущество в 20 раз может не проявиться. Это означает, что простое обновление оборудования без настройки программного стека не гарантирует достижения целевых показателей.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Бизнес; Передовые технологии

Материалы по теме