FLUX 3 от Black Forest Labs: роботы учатся физике мира и исправляют ошибки без перепрограммирования
Модель FLUX 3 от Black Forest Labs учится понимать физику мира, а не просто подбирать пиксели, что позволило роботам повысить успешность задач на 29 процентных пунктов. Теперь машины способны самостоятельно корректировать движения при работе с мягкими материалами, что меняет правила для автоматизации сложных производственных процессов.
Компания Black Forest Labs 23 июля 2026 года запустила ранний доступ к модели FLUX 3. Это не просто генератор изображений, а универсальная система, способная создавать видео со звуком, редактировать картинки и предсказывать физические действия роботов. Ключевое отличие от предыдущих версий — обучение на 95% видео-данных, что заставляет алгоритм «понимать» физику мира: вес объектов, инерцию и причинно-следственные связи. В тестах модель показала преимущество над конкурентами: пользователи выбрали её в 93% случаев против Luma Ray 3.2 и в 77% против Runway Gen-4.5.
Важный нюанс: Модель учится не просто подбирать пиксели, а строить внутреннюю модель физики. Звук удара должен соответствовать массе падающего предмета, а движение — инерции. Это позволяет роботам исправлять ошибки без прямого программирования.
Архитектура и метод обучения Self-Flow
Разработчики отказались от раздельного обучения для разных типов контента. Вместо этого используется единая архитектура Diffusion Transformer (DiT), которая обрабатывает изображения, видео, аудио и действия как проекции одной реальности. Основа обучения — фреймворк Self-Flow, созданный совместно с исследователями из MIT.
Традиционные модели часто генерируют идеальную картинку, не понимая законов физики. Self-Flow решает эту проблему, одновременно оптимизируя два параметра:
- Качество генерации (стандартная задача).
- Качество внутренних представлений (модель учится выделять понятные концепции, например, гравитацию).
Результат применения этого подхода:
- Успешность выполнения задач манипуляции роботами выросла с 42% до 71%.
- Эффективность обучения увеличилась в 2 раза по сравнению со стандартными методами.
Стоит учесть: Видео является доминирующим сигналом для обучения. Звук занимает менее 0,5% от объема данных, но после того, как модель научилась видеть физику движения, сопоставление звука с действием происходит автоматически и с высокой точностью.
Возможности генерации и работы с роботами
FLUX 3 поддерживает создание видео длительностью до 20 секунд в разрешении 720p с синхронизированным звуком. Доступны различные режимы работы:
- Text-to-Video: Создание ролика со звуком по текстовому описанию.
- Image-to-Video: Анимация статичного изображения.
- Video-to-Video: Трансформация исходного клипа с сохранением ключевых элементов (например, персонажей).
- Generative Continuation: Прогнозирование продолжения видео и звука.
- Agentic Chaining: Связывание отдельных клипов в длинные последовательности.
В сфере робототехники модель интегрирована с платформой mimic (проект FLUX-mimic). Совместно с компанией Audi система уже тестируется для задач, ранее считавшихся сложными:
- Работа с мягкими материалами (уплотнители, кабели).
- Сборка и вставка деталей.
- Самовосстановление: если робот промахивается при захвате объекта, он корректирует движение на основе «понимания» физики, без явного перепрограммирования.
Скорость реакции системы составляет 101 мс (включая работу сенсоров и приводов) на базе видеокарты RTX 5090.
Сравнение с конкурентами и планы выпуска
На этапе предварительных тестов FLUX 3 продемонстрировала высокие показатели в тестах предпочтения пользователей. Сравнение проводилось на клипах длительностью 10 секунд в разрешении 720p:
| Конкурент | Доля предпочтения FLUX 3 |
|---|---|
| Luma Ray 3.2 | 93% |
| Runway Gen-4.5 | 77% |
| Grok Imagine Video | 69% |
| Kling v3 Pro | 60% |
| Happy Horse v1 | 59% |
| Happy Horse 1.1 | 57% |
| Seedance 2.0 | 52% |
| Gemini Omni Flash | 52% |
Особые сильные стороны модели:
- Точная передача мимики и эмоций.
- Синхронизация звука с визуальными событиями.
- Поддержка многоязычных диалогов.
- Генерация текста на изображениях.
План доступности:
- FLUX 3 Video: Доступен сейчас через API и частные веса (Early Access).
- FLUX 3 Image: Запуск в ближайшие недели.
- FLUX-mimic: Активно используется партнерами (например, Audi).
- FLUX 3 Dev: Открытые веса для сообщества будут выпущены позже.
На фоне этого: Отсутствие открытых весов и лицензии пока ограничивает независимую проверку качества. Сообщество сможет проводить собственные эксперименты и тонкую настройку только после релиза версии Dev.
Операционные последствия и технические ограничения
- Требования к инфраструктуре: Генерация видео длительностью 20 секунд в разрешении 720p потребляет значительные вычислительные ресурсы. Точные требования к памяти видеокарт (VRAM) и пропускной способности серверов пока не опубликованы, но ожидается необходимость мощного оборудования для локального развертывания.
- Риски лицензирования: Условия использования (лицензия) для FLUX 3 еще не утверждены. Предыдущие версии имели разные условия (Apache 2.0 для Klein, некоммерческая для dev), что создает неопределенность для коммерческого внедрения до официального анонса.
- Ограничение по длительности: Максимальная длина генерируемого клипа — 20 секунд. Это прогресс по сравнению с открытыми моделями, но уступает проприетарным системам, способным создавать видео длительностью в несколько минут.
- Прозрачность данных: Состав обучающей выборки раскрыт лишь частично (десятки миллионов часов общего видео и сотни тысяч часов видео с манипуляциями). Методы фильтрации и источники данных не детализированы, что может затруднить воспроизведение результатов исследователями.
Источник: huggingface.co