AWS и NVIDIA ускорили ИИ-инференс в 4,6 раза и снизили стоимость поиска в 4 раза
Стоимость векторного поиска для ИИ упала в четыре раза, а время развертывания баз данных сократилось с месяцев до одного часа. Переход на GPU-ускорение превращает сложные проекты оптимизации в стандартную процедуру, заставляя компании пересматривать бюджетные ограничения для внедрения интеллектуальных систем.
Компании NVIDIA и Amazon Web Services (AWS) завершили интеграцию инфраструктуры, позволяющую бизнесу запускать системы искусственного интеллекта в промышленном масштабе без роста операционной сложности. Стороны объединили новые вычислительные мощности, библиотеки для ускоренного поиска и сертификацию оборудования, чтобы устранить барьеры между разработкой и внедрением ИИ. Ключевым результатом стало появление серверов с ускорением 4,6 раза для задач вывода моделей и сокращение стоимости векторного поиска до 25% от уровня CPU-решений.
Важный нюанс: Переход на GPU-ускорение векторного поиска превращает создание баз данных для ИИ из многомесячного проекта оптимизации в стандартную процедуру, занимающую менее часа.
Вычислительный прорыв: новые инстансы EC2 G7
AWS запустила инстансы EC2 G7, оснащенные графическими процессорами NVIDIA RTX PRO 4500 Blackwell Server Edition. Это решение ориентировано на задачи, требующие высокой производительности без необходимости самостоятельного управления GPU-инфраструктурой. По сравнению с предыдущим поколением G6, новые серверы демонстрируют значительный прирост в ключевых метриках:
- AI-инференс: ускорение до 4,6 раза.
- Графические задачи: прирост производительности до 2,1 раза.
- Аналитика данных: существенное ускорение обработки в Amazon EMR благодаря библиотеке NVIDIA cuDF для Apache Spark.
Конфигурация позволяет гибко масштабировать ресурсы под конкретные задачи. Инстансы доступны в вариантах с 1, 2, 4 и 8 видеокартами, включая конфигурации bare metal. Технические характеристики включают до 256 ГБ видеопамяти, сеть 700 Гбит/с (EFA) и локальное хранилище NVMe SSD объемом до 7,6 ТБ.
Такая архитектура позволяет командам не закупать избыточные ресурсы «на вырост», а точно подбирать мощность под нагрузку. Это актуально для сфер от рендеринга видео и пространственных вычислений до виртуальных рабочих столов и аналитики больших данных. Доступ к G7 уже открыт через образы Deep Learning AMI, контейнеры Deep Learning Containers и платформы EKS и ECS. В ближайшее время поддержка появится в сервисе Amazon SageMaker AI.
Ускорение поиска данных и векторных баз
В сервисе Amazon OpenSearch Serverless библиотека NVIDIA cuVS стала стандартным инструментом для векторного индексирования. Ранее ускорение через GPU требовало отдельной настройки и являлось сложной оптимизацией. Теперь это базовая функция для всех коллекций векторов.
Изменение критично для систем генерации с дополнением извлечения (RAG), семантического поиска и агентов ИИ. Технические показатели новой конфигурации:
- Скорость индексации: ускорение до 10 раз по сравнению с CPU.
- Стоимость: снижение затрат в 4 раза относительно CPU-решений.
- Масштаб: возможность построения баз данных с миллиардами векторов менее чем за 1 час.
Серверная архитектура автоматически масштабируется, снижая операционные расходы в периоды низкой нагрузки. Это устраняет необходимость в постоянном управлении инфраструктурой для динамичных рабочих нагрузок.
Стоит учесть: Снижение стоимости векторного поиска в четыре раза делает экономически целесообразным внедрение сложных ИИ-систем даже для проектов с ограниченным бюджетом, где ранее такие решения были недоступны.
Сертификация для обучения моделей
AWS получила статус NVIDIA Exemplar Cloud для ускорителей NVIDIA GB300. Это подтверждение означает, что облачная инфраструктура AWS прошла строгие тесты производительности, установленные NVIDIA для эталонной архитектуры.
Статус присвоен после совместной инженерной работы команд обеих компаний. Для бизнеса это сигнал о гарантированной производительности при обучении крупных моделей. Использование сертифицированной инфраструктуры позволяет:
- Снизить общую стоимость владения (TCO) за счет оптимизации ресурсов.
- Ускорить переход проектов из стадии планирования в промышленную эксплуатацию.
- Упростить выбор провайдера, опираясь на единый стандарт качества.
Операционные последствия и скрытые нюансы
На основе представленных данных можно выделить несколько практических аспектов для принятия решений:
- Оптимизация затрат на инфраструктуру: Переход на инстансы G7 позволяет избежать перепроvisionирования (закупки избыточных мощностей). Гибкая конфигурация от 1 до 8 GPU дает возможность платить только за фактически используемые ресурсы.
- Скорость развертывания: Интеграция cuVS в OpenSearch сокращает время подготовки данных для ИИ-агентов с недель или месяцев до часов. Это критично для компаний, работающих в условиях быстро меняющихся рыночных данных.
- Зависимость от экосистемы: Максимальная производительность достигается только при использовании связки оборудования NVIDIA и сервисов AWS. Перенос таких решений на другие облачные платформы или локальные серверы может потребовать значительной перенастройки и привести к потере заявленных показателей ускорения.
- Доступность технологий: Появление bare metal конфигураций и интеграция с SageMaker упрощают доступ к передовым технологиям для команд, не обладающих глубокими навыками управления низкоуровневой инфраструктурой.
На фоне этого: Стандартизация GPU-ускорения в облачных сервисах смещает фокус конкуренции с «кто может запустить модель» на «кто быстрее и дешевле внедрит её в бизнес-процессы».
Источник: blogs.nvidia.com