Июнь 2026   |   В фокусе

NVIDIA Blackwell GB300 NVL72 ускорил обучение ИИ в 1,6 раза на кластере из 8192 GPU

Кластер из 8192 графических процессоров обучает гигантские модели в 1,6 раза быстрее, делая устаревшие дата-центры экономически неэффективными. Переход на новую архитектуру требует полной замены сетевого оборудования и систем охлаждения, иначе пиковая скорость чипов упрется в узкие места инфраструктуры.

NVIDIA доминировала в тестировании MLPerf Training 6.0, показав лучшие результаты во всех семи категориях бенчмарка. Платформа Blackwell продемонстрировала рекордную скорость обучения и масштабировалась до кластера из 8192 графических процессоров, что стало новым максимумом для этой серии. Ключевым фактором успеха стала архитектура NVL72, объединяющая 72 чипа в единый вычислительный блок, а также внедрение метода обучения с низкой точностью NVFP4. Эти данные подтверждают, что инфраструктура NVIDIA сейчас задает стандарты скорости и надежности для разработки моделей искусственного интеллекта.

Рекорды скорости и масштабирования

В шестой версии бенчмарка MLPerf Training появились две новые задачи для обучения моделей с архитектурой «смесь экспертов» (MoE): DeepSeek-V3 671B и GPT-OSS-20B. NVIDIA стала единственной компанией, представившей результаты по всем семи тестам, и выиграла в каждом из них по времени обучения.

Техническое превосходство обеспечили системы GB200 NVL72 и более новые GB300 NVL72. Внутри этих стоек пятое поколение коммутаторов NVLink связывает все графические процессоры в единую пул памяти и вычислений. Это позволяет системе работать как один гигантский чип, что критически важно для задач, где данные должны быстро перемещаться между узлами.

Важный нюанс: Архитектура NVL72 устраняет узкие места в передаче данных, позволяя моделям типа MoE обучаться без задержек на маршрутизацию токенов между подсетями экспертов.

Сравнение поколений показывает значительный прирост производительности:

  • Система GB300 NVL72 обучает модели в 1,6 раза быстрее, чем GB200 NVL72 при том же масштабе.
  • Увеличение плотности вычислений, расширение объема памяти и более высокий лимит энергопотребления позволяют чипам удерживать пиковую производительность дольше.
  • Метод NVFP4 (обучение с низкой точностью) позволяет ускорять процесс без потери качества, что уже применялось для обучения модели Nemotron 3 Ultra на 550 миллиардов параметров.

Инфраструктура и надежность в промышленных масштабах

Для поддержки распределенного обучения NVIDIA предлагает два варианта сетевого оборудования: Quantum InfiniBand и Spectrum-X Ethernet. Это дает заказчикам гибкость при построении дата-центров под свои нужды.

В ходе тестов были достигнуты следующие масштабы:

  • На модели DeepSeek-V3 671B кластер развернули на 8192 GPU с использованием систем GB200 NVL72.
  • На модели Llama 3.1 405B обучение масштабировалось до 5120 GPU.
  • Партнер Microsoft Azure обучил Llama 3.1 405B на 8192 GPU, достигнув целевого качества за 7,07 минуты.
  • Компания CoreWeave использовала системы GB300 NVL72 с сетью Spectrum-X Ethernet для обучения DeepSeek-V3 671B на 8192 GPU, завершив задачу за 2,02 минуты.

Надежность работы в промышленных условиях обеспечивается на двух уровнях. Во-первых, графические процессоры проходят более 30 этапов тестирования на производстве, чтобы исключить дефекты до установки. Во-вторых, встроенные механизмы самодиагностики и самовосстановления перенаправляют потоки данных в обход сбоев без остановки обучения. Сеть Spectrum-X Ethernet также способна перестраивать маршруты за миллисекунды.

Стоит учесть: В условиях обучения, длящегося неделями, способность системы автоматически восстанавливаться после сбоев и возобновлять работу с контрольной точки (чекпоинта) важнее, чем пиковая скорость отдельного чипа.

Реальные кейсы использования партнерами

Экосистема NVIDIA активно развивается: в тестировании приняли участие 19 организаций, включая ASUSTeK, Cisco, Dell Technologies, Google Cloud, Hewlett Packard Enterprise и другие. Партнеры уже используют эту инфраструктуру для реальных проектов:

  • CoreWeave: Развернула инфраструктуру на серверах Dell PowerEdge. Компания Cohere ускорила обучение своей платформы агентов в 3 раза на системах GB200 NVL72. Сервис Midjourney обучил модель генерации изображений v8 на кластере Blackwell и теперь масштабирует парк Blackwell Ultra для работы с видео.
  • Google Cloud: Лаборатория Thinking Machines Lab получила двукратное ускорение обучения и вывода моделей на GB300 NVL72 по сравнению с предыдущим поколением.
  • Nebius: Платформа Higgsfield сократила время обучения моделей на 30%, что позволило обслуживать 22 миллиона пользователей и генерировать более 6 миллионов единиц контента ежедневно.

Операционные последствия и скрытые риски

На основе представленных данных можно выделить несколько практических аспектов для бизнеса, внедряющего ИИ-инфраструктуру:

  • Стоимость владения: Ускорение обучения в 1,6 раза и выше напрямую снижает затраты на электроэнергию и аренду вычислительных мощностей. Быстрый запуск моделей позволяет компаниям раньше начать монетизацию продуктов.
  • Зависимость от архитектуры: Доминирование единой платформы NVIDIA в бенчмарках может создать ситуацию, где альтернативные решения пока не способны обеспечить сопоставимую скорость и масштабируемость для самых сложных моделей.
  • Требования к сети: Для реализации заявленной производительности критически важна не только мощность чипов, но и наличие специализированных сетей (InfiniBand или Spectrum-X), способных поддерживать синхронизацию тысяч GPU без потерь.
  • Сложность обслуживания: Высокая плотность вычислений и энергопотребление требуют пересмотра систем охлаждения и электроснабжения в дата-центрах.
  • Доступность технологий: Методы обучения с низкой точностью (NVFP4) требуют поддержки на уровне аппаратного обеспечения, что ограничивает возможность их использования на устаревшем оборудовании.

На фоне этого: Переход на новые стандарты обучения может потребовать значительных инвестиций не только в сами чипы, но и в модернизацию всей инфраструктуры дата-центра, включая сети и системы охлаждения.

Коротко о главном

Как система GB300 NVL72 превосходит предыдущее поколение GB200?

Новое поколение обеспечивает ускорение обучения моделей в 1,6 раза за счет увеличения плотности вычислений, расширения объема памяти и повышения лимита энергопотребления, что позволяет чипам дольше удерживать пиковую производительность.

Какую роль играет пятое поколение коммутаторов NVLink в архитектуре NVL72?

Эти коммутаторы связывают все графические процессоры в единую пул памяти и вычислений, устраняя узкие места в передаче данных и позволяя моделям типа «смесь экспертов» обучаться без задержек на маршрутизацию токенов.

Какие результаты обучения продемонстрировали партнеры NVIDIA на кластере из 8192 GPU?

Microsoft Azure обучила модель Llama 3.1 405B за 7,07 минуты, а CoreWeave с использованием систем GB300 NVL72 и сети Spectrum-X Ethernet сократила время обучения модели DeepSeek-V3 671B до 2,02 минуты.

Как обеспечивается надежность работы систем при длительном обучении?

Графические процессоры проходят более 30 этапов тестирования на производстве, а встроенные механизмы самодиагностики и самовосстановления автоматически перенаправляют потоки данных в обход сбоев, предотвращая остановку процесса.

Какое влияние оказала инфраструктура Blackwell на реальные проекты партнеров?

Компания Cohere ускорила обучение платформы агентов в 3 раза, а платформа Higgsfield сократила время обучения на 30%, что позволило ей обслуживать 22 миллиона пользователей и генерировать более 6 миллионов единиц контента ежедневно.

Почему внедрение новых технологий требует модернизации дата-центров?

Высокая плотность вычислений и энергопотребление новых чипов, а также необходимость использования специализированных сетей InfiniBand или Spectrum-X для синхронизации тысяч GPU, требуют пересмотра систем охлаждения и электроснабжения.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Бизнес; Цифровизация и технологии; Передовые технологии

Материалы по теме