Hugging Face подтвердила работу с AMD Instinct MI455X — память в 2,25 раза больше
Новая видеокарта AMD Instinct MI455X получила 432 ГБ памяти, что в 2,25 раза больше, чем у предшественника, и позволяет запускать крупные модели ИИ на меньшем количестве серверов. Это изменение снижает капитальные затраты на инфраструктуру и дает бизнесу реальную альтернативу экосистеме NVIDIA, меняя правила ценообразования на рынке оборудования.
Hugging Face протестировала новую видеокарту AMD Instinct MI455X и подтвердила её готовность к работе с библиотекой Transformers. Ключевое отличие новинки — 432 ГБ оперативной памяти на одном чипе, что в 2,25 раза больше, чем у предыдущей модели MI300. Это позволяет запускать крупные языковые модели и обрабатывать длинные тексты на меньшем количестве оборудования, снижая требования к серверной инфраструктуре.
Резерв памяти и пропускная способность
Основной упор в новой архитектуре сделан на увеличение объема памяти. Каждая карта оснащена 432 ГБ памяти стандарта HBM4 с пропускной способностью до 23,3 ТБ/с. Для сравнения: предыдущее поколение MI300 имело 192 ГБ. В тестовой конфигурации из четырех ускорителей система получила доступ к 1,7 ТБ быстрой памяти.
Такой запас дает конкретные преимущества для работы с искусственным интеллектом:
- Больше моделей на одном сервере: Крупные модели помещаются в памяти без необходимости дробления на несколько устройств.
- Длинный контекст: Увеличивается место для кэша ключ-значение (KV cache), что критично для обработки длинных документов или диалогов.
- Высокая нагрузка: Система может удерживать больше активных запросов одновременно, прежде чем память станет узким местом.
В ходе тестов с моделью Qwen3-32B (размер 64 ГБ в формате BF16) карта MI455X выдержала в 3 раза больше одновременных запросов, чем MI300, прежде чем исчерпала ресурсы памяти.
Важный нюанс: Рост объема памяти позволяет перенести акцент с закупки большего количества серверов на оптимизацию загрузки одного мощного узла, что меняет экономику развертывания больших моделей.
Совместимость и стабильность работы
Для интеграции нового железа в экосистему Hugging Face прошла серия тестов на 24 ключевых архитектурах моделей. В выборку вошли кодировщики, декодеры, модели для работы с изображением и звуком, а также современные большие языковые модели.
Результаты проверки показали высокий уровень совместимости:
- Успешность запуска на MI455X составила 99,5%.
- Для сравнения: на MI300 этот показатель равен 99,4%, а на NVIDIA A10 — 99,1%.
Достижение такого результата потребовало доработки программного стека. Совместно с командой AMD инженеры:
- Обеспечили стабильную работу алгоритма Flash Attention.
- Добавили поддержку torchcodec для обработки аудио и видео в мультимодальных моделях.
- Исправили расхождения в результатах вычислений, выявленные при тестировании.
Планы развития и доступность
Компания намерена включить MI455X в ежедневные циклы автоматического тестирования (CI) библиотеки Transformers. Также планируется расширение поддержки на процессоры Ryzen и видеокарты Radeon.
На уровне ядра продолжается сотрудничество с командой AITER для создания оптимизированных вычислительных ядер (кernels). Эти ядра будут доступны пользователям напрямую через Hugging Face Hub для использования в рабочих процессах.
Стоит учесть: Высокая совместимость на старте говорит о том, что переход на оборудование AMD для разработчиков ИИ становится технически менее рискованным, так как не требует глубокой переработки существующего кода.
Операционные последствия и тренды
- Снижение аппаратных требований: Увеличение объема памяти на чип позволяет бизнесу сократить количество серверов для развертывания одной и той же модели, что может снизить капитальные затраты на инфраструктуру.
- Поддержка длинного контекста: Доступ к большему объему кэша делает экономически целесообразным обработку длинных документов и сложных диалогов без потери производительности, что открывает новые сценарии использования для аналитики и поддержки клиентов.
- Расширение выбора поставщиков: Стабильная работа популярных библиотек на AMD создает реальную альтернативу экосистеме NVIDIA, что может повлиять на ценообразование и условия поставок оборудования на глобальном рынке.
- Необходимость обновления ПО: Для получения максимальной производительности потребуется использование новых оптимизированных ядер и поддержка библиотек, таких как torchcodec, что потребует обновления окружения разработки.
Источник: huggingface.co