Август 2026   |   В фокусе

xAI обновила Imagine Video 1.5 — бизнес зафиксировал лицо и голос бренда в роликах

Компания xAI научила ИИ создавать видео в разрешении 1080p с сохранением лица и голоса персонажа на протяжении всего ролика. Это позволяет бизнесу делать полноценную рекламу без штата монтажеров, но требует от компаний подготовки идеальных исходных материалов для генерации.

Компания xAI представила обновление модели Imagine Video 1.5, добавив возможность использовать изображения и голоса в качестве референсов для создания роликов. Новая версия поддерживает нативное разрешение 1080p и позволяет генерировать видео исключительно по текстовому описанию без стартовой картинки. Функция сохранения голоса персонажа уже доступна в США для подписчиков тарифов SuperGrok Heavy и SuperGrok Plus через веб-интерфейс и iOS, а в ближайшие дни выйдет для всех пользователей.

Важный нюанс: Возможность привязки до семи референсов одновременно меняет подход к созданию контента, позволяя бизнесу сохранять визуальный стиль бренда или лицо спикера в разных сценах без необходимости ручной постобработки.

Новые возможности генерации

Обновление закрывает ключевые ограничения предыдущих версий, касающиеся качества и гибкости управления кадрами. Теперь система умеет комбинировать текстовые подсказки с визуальными и аудиальными образцами.

  • Текст в видео: Пользователи могут описывать кадр словами, и модель сгенерирует ролик с нуля, используя связку генерации изображений и их анимации.
  • Разрешение 1080p: Поддержка высокого разрешения теперь работает как для видео из текста, так и для видео из изображений.
  • Доступность: Функции доступны на платформе grok.com/imagine, а также в мобильных приложениях для iOS и Android.

Работа с персонажами и сценами

Главное техническое достижение — сохранение консистентности (единообразия) объектов и звуков на протяжении всего ролика. Это решает проблему «плавающих» лиц и меняющихся голосов, характерную для ранних версий ИИ-видео.

  • Голос и лицо: При загрузке изображения персонажа и аудиофайла его голоса модель сохраняет эти параметры во всех сценах.
  • Мульти-референсы: Система позволяет использовать до семи опорных изображений за один запрос. Каждое из них фиксирует конкретный элемент: лицо героя, продукт, локацию или одежду.
  • Гибкость сценария: Можно менять сцену, оставляя персонажа неизменным, или менять героя в одной и той же локации, контролируя только действия.

Интеграция для разработчиков

Функционал уже интегрирован в xAI API под именем модели grok-imagine-video-1.5. Разработчики могут сразу использовать генерацию по тексту, работу с изображениями-референсами и высокое разрешение. Поддержка голосовых референсов в API доступна по запросу.

Для подключения требуется стандартный ключ доступа. Пример запроса показывает возможность настройки длительности (например, 6 секунд), соотношения сторон (16:9) и разрешения (в примере указано 720p, но поддерживается и 1080p).

Стоит учесть: Ограничение в семь референсов может стать барьером для сценариев с массовыми сценами, где нужно контролировать множество уникальных объектов одновременно, но для большинства маркетинговых задач и короткометражек этого лимита достаточно.

Операционные последствия и тренды

  • Снижение порога входа: Возможность создания видео только по тексту упрощает производство контента для компаний без штата видеомонтажеров, сокращая время от идеи до готового ролика.
  • Рост требований к данным: Для использования функции сохранения голоса и лица бизнесу потребуется подготовить качественные исходные материалы (четкие фото и чистые аудиофайлы), так как качество генерации напрямую зависит от референсов.
  • Изменение цепочки поставок контента: Появление нативного 1080p и стабильных персонажей смещает фокус с простой генерации «заглушек» на создание полноценных рекламных роликов, что может снизить спрос на бюджетные стоковые видеоматериалы.
  • Зависимость от инфраструктуры: Работа с высокими разрешениями и сложными референсами потребует от пользователей стабильного интернет-соединения и мощных устройств при локальном рендеринге, если такие возможности будут предложены в будущем.

Коротко о главном

Сколько референсов можно использовать одновременно в одном запросе?

Система позволяет привязывать до семи опорных изображений за раз, чтобы фиксировать конкретные элементы, такие как лицо героя, продукт или локация, обеспечивая их единообразие во всех сценах.

Для каких тарифов уже доступна функция сохранения голоса персонажа?

Возможность сохранения голоса работает в США для подписчиков тарифов SuperGrok Heavy и SuperGrok Plus через веб-интерфейс и iOS, что позволяет бизнесу сохранять интонацию спикера без ручной дубляжа.

Как обновление решает проблему нестабильности персонажей?

Модель теперь сохраняет параметры лица и голоса на протяжении всего ролика при загрузке соответствующих файлов, устраняя проблему «плавающих» лиц и меняющихся голосов, характерную для ранних версий ИИ-видео.

Какие новые способы генерации видео появились в версии 1.5?

Пользователи могут создавать ролики исключительно по текстовому описанию без стартовой картинки, используя связку генерации изображений и их последующей анимации.

Как обновленный функционал интегрирован для разработчиков?

Все новые возможности, включая работу с изображениями-референсами и высокое разрешение, доступны в xAI API под именем grok-imagine-video-1.5, что позволяет сразу внедрять их в собственные приложения.

Какие требования к исходным материалам возникли для бизнеса?

Для корректной работы функций сохранения лица и голоса компаниям необходимо подготовить четкие фотографии и чистые аудиофайлы, так как итоговое качество генерации напрямую зависит от качества этих референсов.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Бизнес; Маркетинг и продажи; Передовые технологии

Материалы по теме