xAI обновила Imagine Video 1.5 — бизнес зафиксировал лицо и голос бренда в роликах
Компания xAI научила ИИ создавать видео в разрешении 1080p с сохранением лица и голоса персонажа на протяжении всего ролика. Это позволяет бизнесу делать полноценную рекламу без штата монтажеров, но требует от компаний подготовки идеальных исходных материалов для генерации.
Компания xAI представила обновление модели Imagine Video 1.5, добавив возможность использовать изображения и голоса в качестве референсов для создания роликов. Новая версия поддерживает нативное разрешение 1080p и позволяет генерировать видео исключительно по текстовому описанию без стартовой картинки. Функция сохранения голоса персонажа уже доступна в США для подписчиков тарифов SuperGrok Heavy и SuperGrok Plus через веб-интерфейс и iOS, а в ближайшие дни выйдет для всех пользователей.
Важный нюанс: Возможность привязки до семи референсов одновременно меняет подход к созданию контента, позволяя бизнесу сохранять визуальный стиль бренда или лицо спикера в разных сценах без необходимости ручной постобработки.
Новые возможности генерации
Обновление закрывает ключевые ограничения предыдущих версий, касающиеся качества и гибкости управления кадрами. Теперь система умеет комбинировать текстовые подсказки с визуальными и аудиальными образцами.
- Текст в видео: Пользователи могут описывать кадр словами, и модель сгенерирует ролик с нуля, используя связку генерации изображений и их анимации.
- Разрешение 1080p: Поддержка высокого разрешения теперь работает как для видео из текста, так и для видео из изображений.
- Доступность: Функции доступны на платформе grok.com/imagine, а также в мобильных приложениях для iOS и Android.
Работа с персонажами и сценами
Главное техническое достижение — сохранение консистентности (единообразия) объектов и звуков на протяжении всего ролика. Это решает проблему «плавающих» лиц и меняющихся голосов, характерную для ранних версий ИИ-видео.
- Голос и лицо: При загрузке изображения персонажа и аудиофайла его голоса модель сохраняет эти параметры во всех сценах.
- Мульти-референсы: Система позволяет использовать до семи опорных изображений за один запрос. Каждое из них фиксирует конкретный элемент: лицо героя, продукт, локацию или одежду.
- Гибкость сценария: Можно менять сцену, оставляя персонажа неизменным, или менять героя в одной и той же локации, контролируя только действия.
Интеграция для разработчиков
Функционал уже интегрирован в xAI API под именем модели grok-imagine-video-1.5. Разработчики могут сразу использовать генерацию по тексту, работу с изображениями-референсами и высокое разрешение. Поддержка голосовых референсов в API доступна по запросу.
Для подключения требуется стандартный ключ доступа. Пример запроса показывает возможность настройки длительности (например, 6 секунд), соотношения сторон (16:9) и разрешения (в примере указано 720p, но поддерживается и 1080p).
Стоит учесть: Ограничение в семь референсов может стать барьером для сценариев с массовыми сценами, где нужно контролировать множество уникальных объектов одновременно, но для большинства маркетинговых задач и короткометражек этого лимита достаточно.
Операционные последствия и тренды
- Снижение порога входа: Возможность создания видео только по тексту упрощает производство контента для компаний без штата видеомонтажеров, сокращая время от идеи до готового ролика.
- Рост требований к данным: Для использования функции сохранения голоса и лица бизнесу потребуется подготовить качественные исходные материалы (четкие фото и чистые аудиофайлы), так как качество генерации напрямую зависит от референсов.
- Изменение цепочки поставок контента: Появление нативного 1080p и стабильных персонажей смещает фокус с простой генерации «заглушек» на создание полноценных рекламных роликов, что может снизить спрос на бюджетные стоковые видеоматериалы.
- Зависимость от инфраструктуры: Работа с высокими разрешениями и сложными референсами потребует от пользователей стабильного интернет-соединения и мощных устройств при локальном рендеринге, если такие возможности будут предложены в будущем.
Источник: x.ai