Обзор по теме: Энергия, а не мощность чипов, стала главным барьером для развития ИИ
Энергия, а не мощность чипов, стала главным ограничителем развития ИИ: дата-центры упираются в лимиты сетей, заставляя бизнес переходить от покупки «железа» к управлению нагрузкой.
Энергия, а не мощность чипов, стала главным ограничителем развития ИИ. Пока производители гонятся за ростом производительности в разы, физика диктует свои правила: дата-центры упираются в лимиты энергосетей. Решение этой проблемы смещается с уровня «покупки более быстрых процессоров» на уровень управления нагрузкой и оптимизации архитектуры моделей.
Почему железо больше не решает всё?
До недавнего времени логика была простой: нужен более быстрый ИИ — купи более мощный сервер. NVIDIA демонстрировала этот подход на примере платформы GB200 NVL72, представленной в декабре 2025 года. Система из 72 чипов с 30 ТБ памяти обещала производительность в 10 раз выше предыдущего поколения Hopper при работе с моделями MoE (Mixture of Experts). Однако за этой цифрой стоит огромная нагрузка на электросеть.
Противоречие стало очевидным: чем мощнее железо, тем сложнее его питать. В сентябре 2026 года NVIDIA представила платформу DSX, которая меняет парадигму. Вместо того чтобы просто наращивать пиковую мощность, система начинает динамически управлять потреблением. В Калифорнии уже протестировали сценарий, где по сигналу поставщика энергии мощная ИИ-фабрика автоматически снизила потребление с 4 МВт до 3 МВт, не останавливая критические задачи. Это превращает дата-центр из пассивного потребителя в активный элемент балансировки энергосистемы.
Эффективность современных ИИ-фабрик определяется не их максимальной скоростью, а способностью динамически гасить пики нагрузки через системы вроде DSX, превращая дата-центр из потребителя энергии в активный элемент балансировки сети.
Как MoE меняет экономику вычислений?
Архитектура MoE стала ключевым инструментом для снижения затрат без потери качества. Суть проста: модель содержит десятки миллиардов параметров, но для каждого конкретного запроса активируются только те «эксперты», которые нужны в данный момент. Это позволяет избежать лишних вычислений.
Alibaba пошла еще дальше, представив Qwen3-Coder-Next в феврале 2026 года. Модель имеет архитектуру на 80 млрд параметров, но активирует лишь 3 млрд при работе. По заявлению компании, это снижает стоимость вычислений на 90–95% по сравнению с аналогами полного размера. Подобный подход используют и другие игроки: DeepSeek в декабре 2025 года представила V3.2, использующую механизм разреженного внимания для работы с длинным контекстом на доступном оборудовании, а Mistral AI анонсировала открытые модели Mistral 3, оптимизированные для работы даже на одном графическом процессоре.
Что делать бизнесу и инженерам?
Для компаний, планирующих инфраструктуру под ИИ, фокус должен сместиться с метрики FLOPS (операций в секунду) на метрику «токенов на ватт» и возможности гибкого снижения нагрузки.
- Инфраструктура: При выборе поставщика облачных услуг или построении собственных ЦОД критически важна поддержка динамического управления энергией. Если провайдер не может гарантировать снижение пиковой нагрузки по требованию сети, риски сбоев и штрафов за превышение лимитов возрастают.
- Выбор моделей: Для задач инференса (генерации ответов) стоит отдавать предпочтение моделям MoE или оптимизированным форматам данных. Плотные модели (dense) остаются актуальны для обучения, но для повседневных операций они слишком дороги в эксплуатации.
- Форматы данных: Переход на 4-битные форматы, такие как NVFP4 от NVIDIA, уже показал себя: эксперименты с моделью 12B параметров продемонстрировали потерю качества менее 1.5% при значительной экономии памяти и вычислений. Это сигнал к тому, что оптимизация пайплайнов обработки данных становится таким же важным этапом, как и выбор самой модели.
Контекст и нишевые решения
Помимо промышленных масштабов, эффективность растёт и на уровне локальных устройств и алгоритмов:
- NVIDIA DGX Spark: Обновление ПО в январе 2026 года повысило производительность компактного устройства в 2.5 раза за счет оптимизации компонентов (TensorRT LLM, PyTorch). Это расширяет возможности edge-вычислений для разработчиков.
- VK Research: На конференции KDD 2026 компания представила метод планирования для рекомендательных систем, позволяющий классическим алгоритмам учитывать долгосрочные эффекты без перехода на тяжелые нейросети. Это снижает нагрузку на существующую инфраструктуру.
- Atom2.7m: Модель весом всего 2,7 млн параметров достигла точности 69% в арифметических задачах за счет смены формата подачи чисел. Это узкоспециализированное решение, показывающее, что для точных наук важна инженерия данных, а не масштаб параметров.
Прогноз
Если доля вычислений, управляемых динамическими системами балансировки нагрузки (аналог DSX), превысит 50% в новых крупных дата-центрах к концу 2027 года, то средневзвешенная стоимость инференса для LLM снизится на 30–40%. Это произойдет не за счет удешевления чипов, а за счет повышения коэффициента использования энергии (PUE). Вероятно, что управление энергией станет стандартным компонентом стека ИИ-инфраструктуры, сравнимым по значимости с оркестраторами контейнеров.
🤖 Сводка сформирована на основе фактов из Календаря и обновляется при поступлении новых данных.
📅 Последнее обновление сводки: 23 сентября 2026.