NVIDIA Blackwell GB300 NVL72 ускорил обучение ИИ в 1,6 раза на кластере из 8192 GPU
Кластер из 8192 графических процессоров обучает гигантские модели в 1,6 раза быстрее, делая устаревшие дата-центры экономически неэффективными. Переход на новую архитектуру требует полной замены сетевого оборудования и систем охлаждения, иначе пиковая скорость чипов упрется в узкие места инфраструктуры.
NVIDIA доминировала в тестировании MLPerf Training 6.0, показав лучшие результаты во всех семи категориях бенчмарка. Платформа Blackwell продемонстрировала рекордную скорость обучения и масштабировалась до кластера из 8192 графических процессоров, что стало новым максимумом для этой серии. Ключевым фактором успеха стала архитектура NVL72, объединяющая 72 чипа в единый вычислительный блок, а также внедрение метода обучения с низкой точностью NVFP4. Эти данные подтверждают, что инфраструктура NVIDIA сейчас задает стандарты скорости и надежности для разработки моделей искусственного интеллекта.
Рекорды скорости и масштабирования
В шестой версии бенчмарка MLPerf Training появились две новые задачи для обучения моделей с архитектурой «смесь экспертов» (MoE): DeepSeek-V3 671B и GPT-OSS-20B. NVIDIA стала единственной компанией, представившей результаты по всем семи тестам, и выиграла в каждом из них по времени обучения.
Техническое превосходство обеспечили системы GB200 NVL72 и более новые GB300 NVL72. Внутри этих стоек пятое поколение коммутаторов NVLink связывает все графические процессоры в единую пул памяти и вычислений. Это позволяет системе работать как один гигантский чип, что критически важно для задач, где данные должны быстро перемещаться между узлами.
Важный нюанс: Архитектура NVL72 устраняет узкие места в передаче данных, позволяя моделям типа MoE обучаться без задержек на маршрутизацию токенов между подсетями экспертов.
Сравнение поколений показывает значительный прирост производительности:
- Система GB300 NVL72 обучает модели в 1,6 раза быстрее, чем GB200 NVL72 при том же масштабе.
- Увеличение плотности вычислений, расширение объема памяти и более высокий лимит энергопотребления позволяют чипам удерживать пиковую производительность дольше.
- Метод NVFP4 (обучение с низкой точностью) позволяет ускорять процесс без потери качества, что уже применялось для обучения модели Nemotron 3 Ultra на 550 миллиардов параметров.
Инфраструктура и надежность в промышленных масштабах
Для поддержки распределенного обучения NVIDIA предлагает два варианта сетевого оборудования: Quantum InfiniBand и Spectrum-X Ethernet. Это дает заказчикам гибкость при построении дата-центров под свои нужды.
В ходе тестов были достигнуты следующие масштабы:
- На модели DeepSeek-V3 671B кластер развернули на 8192 GPU с использованием систем GB200 NVL72.
- На модели Llama 3.1 405B обучение масштабировалось до 5120 GPU.
- Партнер Microsoft Azure обучил Llama 3.1 405B на 8192 GPU, достигнув целевого качества за 7,07 минуты.
- Компания CoreWeave использовала системы GB300 NVL72 с сетью Spectrum-X Ethernet для обучения DeepSeek-V3 671B на 8192 GPU, завершив задачу за 2,02 минуты.
Надежность работы в промышленных условиях обеспечивается на двух уровнях. Во-первых, графические процессоры проходят более 30 этапов тестирования на производстве, чтобы исключить дефекты до установки. Во-вторых, встроенные механизмы самодиагностики и самовосстановления перенаправляют потоки данных в обход сбоев без остановки обучения. Сеть Spectrum-X Ethernet также способна перестраивать маршруты за миллисекунды.
Стоит учесть: В условиях обучения, длящегося неделями, способность системы автоматически восстанавливаться после сбоев и возобновлять работу с контрольной точки (чекпоинта) важнее, чем пиковая скорость отдельного чипа.
Реальные кейсы использования партнерами
Экосистема NVIDIA активно развивается: в тестировании приняли участие 19 организаций, включая ASUSTeK, Cisco, Dell Technologies, Google Cloud, Hewlett Packard Enterprise и другие. Партнеры уже используют эту инфраструктуру для реальных проектов:
- CoreWeave: Развернула инфраструктуру на серверах Dell PowerEdge. Компания Cohere ускорила обучение своей платформы агентов в 3 раза на системах GB200 NVL72. Сервис Midjourney обучил модель генерации изображений v8 на кластере Blackwell и теперь масштабирует парк Blackwell Ultra для работы с видео.
- Google Cloud: Лаборатория Thinking Machines Lab получила двукратное ускорение обучения и вывода моделей на GB300 NVL72 по сравнению с предыдущим поколением.
- Nebius: Платформа Higgsfield сократила время обучения моделей на 30%, что позволило обслуживать 22 миллиона пользователей и генерировать более 6 миллионов единиц контента ежедневно.
Операционные последствия и скрытые риски
На основе представленных данных можно выделить несколько практических аспектов для бизнеса, внедряющего ИИ-инфраструктуру:
- Стоимость владения: Ускорение обучения в 1,6 раза и выше напрямую снижает затраты на электроэнергию и аренду вычислительных мощностей. Быстрый запуск моделей позволяет компаниям раньше начать монетизацию продуктов.
- Зависимость от архитектуры: Доминирование единой платформы NVIDIA в бенчмарках может создать ситуацию, где альтернативные решения пока не способны обеспечить сопоставимую скорость и масштабируемость для самых сложных моделей.
- Требования к сети: Для реализации заявленной производительности критически важна не только мощность чипов, но и наличие специализированных сетей (InfiniBand или Spectrum-X), способных поддерживать синхронизацию тысяч GPU без потерь.
- Сложность обслуживания: Высокая плотность вычислений и энергопотребление требуют пересмотра систем охлаждения и электроснабжения в дата-центрах.
- Доступность технологий: Методы обучения с низкой точностью (NVFP4) требуют поддержки на уровне аппаратного обеспечения, что ограничивает возможность их использования на устаревшем оборудовании.
На фоне этого: Переход на новые стандарты обучения может потребовать значительных инвестиций не только в сами чипы, но и в модернизацию всей инфраструктуры дата-центра, включая сети и системы охлаждения.
Источник: blogs.nvidia.com