Июль 2026   |   В фокусе

Microsoft Foundry и Hugging Face: развертывание тысяч моделей в Azure за один клик

Юридические риски и уязвимости в коде открытых моделей перекладываются с бизнеса на платформу, устраняя барьеры для промышленного внедрения. Развертывание тысяч проверенных моделей в защищенной среде Azure за один клик превращает экспериментальные наработки в готовые к работе корпоративные агенты без затрат на настройку инфраструктуры.

На конференции Microsoft Build 2026 анонсирован запуск платформы Foundry Managed Compute с интеграцией каталога моделей от Hugging Face. Компании создали операционный слой, позволяющий бизнесу развертывать тысячи открытых моделей (open-weight) в облаке Azure за один клик. В отличие от самостоятельного использования Hugging Face, где компании сами решают вопросы безопасности и инфраструктуры, новое решение предлагает готовые, проверенные образы с предустановленными весами и настроенными средами выполнения.

Важный нюанс: Интеграция снимает с разработчиков задачу по проверке лицензий и безопасности кода, перенося эти функции на уровень платформы Microsoft.

Единая платформа для управления моделями и агентами

Платформа Microsoft Foundry позиционируется как среда для создания и эксплуатации агентов искусственного интеллекта. Она объединяет модели от различных поставщиков — Microsoft, OpenAI, Anthropic, Meta⋆, Mistral, DeepSeek и Hugging Face — в единый интерфейс с общим набором инструментов разработки (SDK) для Python, C#, JavaScript и Java.

Ключевые возможности платформы включают:

  • Foundry Agent Service: Оркестрация мультиагентных систем с встроенной памятью и доступом к корпоративным данным через Foundry IQ.
  • Наблюдаемость: Отслеживание работы агентов в реальном времени, непрерывная оценка качества и оптимизация промптов на основе результатов тестов.
  • Безопасность: Встроенные фильтры контента, механизмы контроля выполнения задач, агент для тестирования на устойчивость к атакам (Red Teaming) и управление доступом (RBAC).
  • Интеграция: Модели из каталога Hugging Face работают в той же среде, что и проприетарные решения, позволяя комбинировать их в одном агенте без дополнительных настроек.

Для развертывания доступны три варианта: оплата за токен, выделенная пропускная способность и Managed Compute — управляемая платформа как услуга (PaaS) для GPU, ориентированная на открытые и кастомные модели.

Как работает каталог моделей Hugging Face на Foundry

Коллекция Hugging Face Models on Foundry представляет собой отфильтрованный набор моделей, обновляемый еженедельно. В него входят текстовые, визуальные, аудио- и мультимодальные модели, включая системы для генерации изображений, распознавания речи и создания эмбеддингов.

Процесс подготовки моделей к промышленному использованию включает несколько этапов:

  1. Отбор: Выбор трендовых моделей на основе сигналов сообщества и запросов клиентов.
  2. Проверка безопасности: Анализ лицензий и кода. Модели, требующие выполнения стороннего Python-кода при загрузке, либо исправляются, либо исключаются. Все модели распространяются в безопасном формате SafeTensors.
  3. Сборка и сканирование: Microsoft создает образы контейнеров для инференса, сканирует их на наличие уязвимостей (CVE) и подписывает их.
  4. Размещение: Веса моделей загружаются в защищенное хранилище Azure в регионах развертывания.
  5. Валидация: Тестирование совместимости API и производительности (задержка, пропускная способность) перед публикацией в каталог.

Благодаря предварительному размещению весов в Azure, развертывание не требует внешнего доступа к Hugging Face Hub, что позволяет запускать модели внутри приватных сетей предприятия.

Выбор среды выполнения и аппаратного обеспечения

Платформа автоматически подбирает оптимальную среду выполнения (runtime) под архитектуру модели. Обновления и патчи применяются автоматически без необходимости повторного развертывания.

Среда выполненияНазначениеОсобенности
vLLMОсновной движок для LLMВысокая пропускная способность, поддержка моделей из библиотеки Transformers.
SGLangЯзыковые и мультимодальные моделиПоддержка структурированных выходов (JSON, regex), важно для агентов.
TEIЭмбеддинги и классификацияОптимизирован для задач RAG и семантического поиска.
llama.cppCPU и малые GPUРабота с квантованными моделями (GGUF), снижение затрат.
TensorRT-LLM / NIMАппаратура NVIDIAМаксимальная скорость для специфических семейств моделей.
hf-serveСпециализированные задачиОбработка видео, аудио и сегментации изображений.

Поддерживаются ускорители NVIDIA A100, NVIDIA H100 и AMD MI300X. Квоты привязаны к семействам ускорителей, что обеспечивает совместимость при переходе на новое оборудование.

Стоит учесть: Разработчики могут выбирать шаблоны развертывания, которые уже содержат настроенные параметры (контекст, квантование, тип ускорителя), что исключает необходимость ручного подбора конфигурации под конкретную модель.

Операционные последствия и практические аспекты

Условия внедрения и зависимости

  • Безопасность сети: Развертывание моделей внутри приватной сети возможно только благодаря предварительному размещению весов в Azure. Это критично для предприятий с жесткими требованиями к изоляции данных.
  • Лицензионная чистота: Автоматическая проверка лицензий и кода снижает юридические риски при использовании открытых моделей в коммерческих продуктах.
  • Аппаратная гибкость: Возможность выбора между глобальным развертыванием (максимальная мощность) и развертыванием в Data Zone (соблюдение суверенитета данных) позволяет адаптировать инфраструктуру под регуляторные требования разных стран.

Влияние на операционные расходы

  • Оптимизация затрат: Оплата за час использования ускорителя и возможность масштабирования до нуля (scale to zero) в периоды простоя делают решение выгодным для задач с переменной нагрузкой, где оплата за токен может быть менее предсказуемой.
  • Снижение нагрузки на ИТ: Автоматическое обновление контейнеров и патчи безопасности избавляют команды от рутинного обслуживания инфраструктуры, позволяя сосредоточиться на логике приложений.

Тренды и прогнозы

  • Сближение открытых и закрытых моделей: Доступность передовых открытых моделей с той же степенью поддержки, что и проприетарные решения, ускоряет переход бизнеса на гибридные архитектуры.
  • Упрощение управления версиями: Возможность фиксации конкретной версии модели, ее оценки и отката при необходимости создает предсказуемый цикл релизов для ИИ-приложений.

На фоне этого: Интеграция превращает Hugging Face из платформы для экспериментов в надежный источник промышленных моделей, где Microsoft берет на себя всю операционную сложность.

Текущий статус и планы развития

На данный момент коллекция Hugging Face доступна в режиме предварительного просмотра (preview). В каталоге уже представлены тысячи моделей, развертываемые на ускорителях NVIDIA и AMD с поддержкой тестового режима (Playground), метрик Azure Monitor и автоматического обновления безопасности.

В планах развития:

  • Расширение охвата экосистемы Hugging Face.
  • Добавление новых семейств ускорителей.
  • Функция Bring Your Own Weights для развертывания собственных дообученных и проприетарных моделей с использованием тех же шаблонов и политик управления.

Платформа Microsoft Foundry и Hugging Face создают мост между сообществом разработчиков открытых моделей и корпоративными требованиями к безопасности и надежности, позволяя бизнесу использовать достижения open-source без компромиссов в управлении рисками.

Коротко о главном

Какие модели объединены в едином интерфейсе Microsoft Foundry?

Платформа интегрирует решения от Microsoft, OpenAI, Anthropic, Meta⋆, Mistral, DeepSeek и Hugging Face, предоставляя общий набор инструментов разработки для языков Python, C#, JavaScript и Java.

Как обеспечивается безопасность моделей перед размещением в каталоге?

Microsoft проводит еженедельную проверку лицензий и кода, исключая или исправляя модели с рисками, и распространяет их только в безопасном формате SafeTensors после сканирования на уязвимости.

Почему развертывание моделей возможно внутри приватных сетей предприятий?

Веса моделей предварительно загружаются в защищенное хранилище Azure, что устраняет необходимость во внешнем доступе к Hugging Face Hub и позволяет запускать системы в изолированных средах.

Какие среды выполнения автоматически подбираются под архитектуру модели?

Платформа автоматически выбирает движки, такие как vLLM для LLM, SGLang для агентов с JSON-выводом или llama.cpp для работы на CPU, чтобы оптимизировать производительность без ручных настроек.

Какое аппаратное обеспечение поддерживается для ускорения вычислений?

Для развертывания доступны ускорители NVIDIA A100, NVIDIA H100 и AMD MI300X, при этом квоты привязаны к семействам устройств для обеспечения совместимости при модернизации.

Какие финансовые преимущества дает модель оплаты за час использования ускорителя?

Возможность масштабирования до нуля в периоды простоя и оплата за час работы вместо токенов позволяют оптимизировать расходы для задач с переменной нагрузкой.

Какие функции запланированы для будущего развития платформы?

В планах — расширение экосистемы Hugging Face, добавление новых семейств ускорителей и внедрение функции Bring Your Own Weights для развертывания собственных проприетарных моделей.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Облачные технологии

Материалы по теме

⋆ Данная организация или продукт включены в список экстремистских в соответствии с решением суда, вступившим в законную силу. Деятельность запрещена на территории Российской Федерации на основании Федерального закона от 25.07.2002 № 114-ФЗ «О противодействии экстремистской деятельности».