Июль 2026   |   В фокусе

FLUX 3 от Black Forest Labs: роботы учатся физике мира и исправляют ошибки без перепрограммирования

Модель FLUX 3 от Black Forest Labs учится понимать физику мира, а не просто подбирать пиксели, что позволило роботам повысить успешность задач на 29 процентных пунктов. Теперь машины способны самостоятельно корректировать движения при работе с мягкими материалами, что меняет правила для автоматизации сложных производственных процессов.

Компания Black Forest Labs 23 июля 2026 года запустила ранний доступ к модели FLUX 3. Это не просто генератор изображений, а универсальная система, способная создавать видео со звуком, редактировать картинки и предсказывать физические действия роботов. Ключевое отличие от предыдущих версий — обучение на 95% видео-данных, что заставляет алгоритм «понимать» физику мира: вес объектов, инерцию и причинно-следственные связи. В тестах модель показала преимущество над конкурентами: пользователи выбрали её в 93% случаев против Luma Ray 3.2 и в 77% против Runway Gen-4.5.

Важный нюанс: Модель учится не просто подбирать пиксели, а строить внутреннюю модель физики. Звук удара должен соответствовать массе падающего предмета, а движение — инерции. Это позволяет роботам исправлять ошибки без прямого программирования.

Архитектура и метод обучения Self-Flow

Разработчики отказались от раздельного обучения для разных типов контента. Вместо этого используется единая архитектура Diffusion Transformer (DiT), которая обрабатывает изображения, видео, аудио и действия как проекции одной реальности. Основа обучения — фреймворк Self-Flow, созданный совместно с исследователями из MIT.

Традиционные модели часто генерируют идеальную картинку, не понимая законов физики. Self-Flow решает эту проблему, одновременно оптимизируя два параметра:

  • Качество генерации (стандартная задача).
  • Качество внутренних представлений (модель учится выделять понятные концепции, например, гравитацию).

Результат применения этого подхода:

  • Успешность выполнения задач манипуляции роботами выросла с 42% до 71%.
  • Эффективность обучения увеличилась в 2 раза по сравнению со стандартными методами.

Стоит учесть: Видео является доминирующим сигналом для обучения. Звук занимает менее 0,5% от объема данных, но после того, как модель научилась видеть физику движения, сопоставление звука с действием происходит автоматически и с высокой точностью.

Возможности генерации и работы с роботами

FLUX 3 поддерживает создание видео длительностью до 20 секунд в разрешении 720p с синхронизированным звуком. Доступны различные режимы работы:

  • Text-to-Video: Создание ролика со звуком по текстовому описанию.
  • Image-to-Video: Анимация статичного изображения.
  • Video-to-Video: Трансформация исходного клипа с сохранением ключевых элементов (например, персонажей).
  • Generative Continuation: Прогнозирование продолжения видео и звука.
  • Agentic Chaining: Связывание отдельных клипов в длинные последовательности.

В сфере робототехники модель интегрирована с платформой mimic (проект FLUX-mimic). Совместно с компанией Audi система уже тестируется для задач, ранее считавшихся сложными:

  • Работа с мягкими материалами (уплотнители, кабели).
  • Сборка и вставка деталей.
  • Самовосстановление: если робот промахивается при захвате объекта, он корректирует движение на основе «понимания» физики, без явного перепрограммирования.

Скорость реакции системы составляет 101 мс (включая работу сенсоров и приводов) на базе видеокарты RTX 5090.

Сравнение с конкурентами и планы выпуска

На этапе предварительных тестов FLUX 3 продемонстрировала высокие показатели в тестах предпочтения пользователей. Сравнение проводилось на клипах длительностью 10 секунд в разрешении 720p:

КонкурентДоля предпочтения FLUX 3
Luma Ray 3.293%
Runway Gen-4.577%
Grok Imagine Video69%
Kling v3 Pro60%
Happy Horse v159%
Happy Horse 1.157%
Seedance 2.052%
Gemini Omni Flash52%

Особые сильные стороны модели:

  • Точная передача мимики и эмоций.
  • Синхронизация звука с визуальными событиями.
  • Поддержка многоязычных диалогов.
  • Генерация текста на изображениях.

План доступности:

  • FLUX 3 Video: Доступен сейчас через API и частные веса (Early Access).
  • FLUX 3 Image: Запуск в ближайшие недели.
  • FLUX-mimic: Активно используется партнерами (например, Audi).
  • FLUX 3 Dev: Открытые веса для сообщества будут выпущены позже.

На фоне этого: Отсутствие открытых весов и лицензии пока ограничивает независимую проверку качества. Сообщество сможет проводить собственные эксперименты и тонкую настройку только после релиза версии Dev.

Операционные последствия и технические ограничения

  • Требования к инфраструктуре: Генерация видео длительностью 20 секунд в разрешении 720p потребляет значительные вычислительные ресурсы. Точные требования к памяти видеокарт (VRAM) и пропускной способности серверов пока не опубликованы, но ожидается необходимость мощного оборудования для локального развертывания.
  • Риски лицензирования: Условия использования (лицензия) для FLUX 3 еще не утверждены. Предыдущие версии имели разные условия (Apache 2.0 для Klein, некоммерческая для dev), что создает неопределенность для коммерческого внедрения до официального анонса.
  • Ограничение по длительности: Максимальная длина генерируемого клипа — 20 секунд. Это прогресс по сравнению с открытыми моделями, но уступает проприетарным системам, способным создавать видео длительностью в несколько минут.
  • Прозрачность данных: Состав обучающей выборки раскрыт лишь частично (десятки миллионов часов общего видео и сотни тысяч часов видео с манипуляциями). Методы фильтрации и источники данных не детализированы, что может затруднить воспроизведение результатов исследователями.

Коротко о главном

Почему модель FLUX 3 выиграла у конкурентов в тестах предпочтения пользователей?

Благодаря способности строить внутреннюю модель физики и синхронизировать звук с визуальными событиями, пользователи выбрали её в 93% случаев против Luma Ray 3.2 и в 77% против Runway Gen-4.5.

Как фреймворк Self-Flow повлиял на эффективность работы роботов?

Совместная разработка с исследователями MIT позволила одновременно оптимизировать качество генерации и понимание концепций (например, гравитации), что увеличило успешность задач манипуляции с 42% до 71%.

Какие результаты показала система FLUX-mimic при тестировании с Audi?

Интеграция модели с платформой mimic позволила роботам самостоятельно корректировать движения при работе с мягкими материалами и сборке деталей без явного перепрограммирования, используя «понимание» физики для исправления ошибок захвата.

Какова скорость реакции системы FLUX 3 на базе видеокарты RTX 5090?

Система демонстрирует время отклика в 101 мс, включая обработку данных сенсоров и работу приводов, что обеспечивает оперативное управление роботами в реальном времени.

Каковы текущие ограничения по длительности генерируемого контента?

Модель поддерживает создание видео длительностью до 20 секунд в разрешении 720p, что является прогрессом для открытых моделей, но уступает проприетарным системам, способным генерировать ролики в несколько минут.

Почему независимая проверка качества модели пока невозможна для сообщества?

Отсутствие открытых весов и утвержденной лицензии ограничивает доступ к модели, поэтому исследователи смогут проводить собственные эксперименты только после планируемого релиза версии FLUX 3 Dev.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Передовые технологии; Робототехника

Материалы по теме