FLUX 3 теперь доступна в рамках раннего доступа.
FLUX 3 — это наша новая мультимодальная фундаментальная модель. Она совместно обучается на изображениях, видео и аудио в рамках единой архитектуры, поскольку для обучения ей требуется не какой-то один из этих элементов в отдельности. Вместо этого модель должна сформировать представление о мире: как объекты взаимодействуют друг с другом, как движутся вещи и как звучат события.
Ни одна модальность не дает полного описания. Каждая из них является проекцией одной и той же базовой реальности, зафиксированной разными датчиками, каждый из которых теряет часть информации в процессе. Изображения фиксируют пространственные структуры и отношения в конкретный момент времени. Видео восстанавливают измерение времени и раскрывают временную динамику и физические законы. Аудио раскрывает причинно-следственные связи между механическими явлениями и акустикой, которые зрение само по себе обнаружить не может. Язык связывает эти восприятия с целями, абстракциями и инструкциями.
Обучаясь на чем-то одном, вы получаете хорошую модель этой проекции. Обучаясь на всем сразу, вы получаете больше информации благодаря их взаимным ограничениям: звук должен соответствовать удару, движение должно подчиняться массе, будущее должно следовать из прошлого. Модальности перестают быть разрозненными и становятся свидетельствами одной базовой реальности.
FLUX 3 — это наша первая модель, построенная полностью на этом принципе, и важный этап на пути к развитию визуального интеллекта реального мира: моделей, которые воспринимают, предсказывают и действуют в физической и цифровой средах. Первые результаты в области создания контента и физического ИИ подтверждают, что это верный путь.
FLUX 3: одна модель, множество возможностей.
FLUX 3 основана на Self-Flow, нашем подходе к эффективному согласованию мультимодальной генерации и понимания в рамках одной и той же базовой архитектуры. На основе этого подхода мы значительно увеличили вычислительные ресурсы и объемы данных для одновременного обучения FLUX 3 на видео, изображениях и аудио.
Self-Flow против Flow Matching (FM). Слева: ошибка генерации (расстояние Фреше) по модальностям, каждая нормализована к FM = 100 (чем ниже, тем лучше). Справа: коэффициент успешности выполнения задач манипуляции, усредненный по четырем группам задач после дообучения (чем выше, тем лучше).
Возможности и предварительные оценки
В результате FLUX 3 способна смешивать модальности и генерировать изображения, а также видео и аудио совместно; как на основе текстовых запросов, так и при предоставлении входных данных, таких как изображения и видео. Ниже мы выделяем несколько ключевых возможностей модели.
Видео
FLUX 3 может создавать очень разнообразные видео с аудио длительностью до 20 секунд за одну генерацию.
Ее основные возможности включают следующее (все результаты сопровождаются нативной генерацией аудио):
- Генерация видео по тексту.
- Генерация видео по изображению, либо как продолжение начального кадра («анимация»), либо с использованием изображений в качестве визуальных ориентиров.
- Генерация видео по видео на основе исходного клипа, переносящая центральные элементы исходного видео — например, того же персонажа — в новую сцену или контекст.
- Генеративное продолжение видео и аудио на основе входных видео и аудио.
- Генерация видео по ключевым кадрам для контролируемых переходов между заданными моментами.
- Многоязычный диалог.
- Широкий спектр визуальных стилей и соотношений сторон, выходящий далеко за рамки обычного кинематографического контента.
- Агентная связка отдельных клипов в более длинные последовательности из нескольких кадров.
- Высокое стилистическое разнообразие — FLUX 3 Video легко справляется с диапазоном стилей от любительской съемки до анимации и кино.
- Мощная генерация типографики и анимированных дизайнов.
Для предварительного анализа ниже мы сгенерировали 10-секундные видеоклипы по тексту в разрешении 720p со звуком.
Оценки являются предварительными, и мы ожидаем дальнейших улучшений
Поскольку модель и сопутствующие инструменты все еще находятся в разработке, эти результаты являются предварительными, и мы ожидаем дальнейших улучшений в период раннего доступа. Согласно ранним оценкам, FLUX 3 предпочли Grok Imagine Video в 69% сравнений, Kling v3 Pro — в 60%, Happy Horse v1 — в 59%, Happy Horse 1.1 — в 57%, Seedance 2.0 и Gemini Omni Flash — в 52%. FLUX 3 предпочли Runway Gen-4.5 в 77% сравнений и Luma Ray 3.2 — в 93% сравнений.
Несмотря на то, что FLUX 3 Video все еще находится в разработке, она уже особенно сильна в передаче выражений человеческого лица, связывании звуков с физическими событиями и многоязычных возможностях. Кроме того, эти возможности можно комбинировать для создания последовательностей длительностью в несколько минут, где визуальные ориентиры помогают обеспечить согласованность персонажей во всех сценах.
FLUX 3 Video теперь доступна в рамках раннего доступа здесь
Изображение
FLUX 3 может синтезировать и редактировать изображения в широком разнообразии стилей, соотношений сторон и разрешений. В предварительных оценках, проведенных в ходе обучения, FLUX 3 уже показывает значительное улучшение по сравнению с предыдущими версиями FLUX: ее способность обрабатывать сложные запросы и генерировать текст значительно улучшилась. Модель создает широкий спектр стилей вывода (см. следующие примеры) и способна отрисовывать высокоточный текст на нескольких языках.
Как и в случае с оценками видео, это предварительные результаты, и мы ожидаем дальнейших улучшений перед выпуском. Мы откроем этап раннего доступа для FLUX 3 Image в ближайшие недели.
Действие
Понимание мира моделью FLUX 3 распространяется на предсказание действий. Мы выбрали два пути для этого: прямая интеграция нативного предсказания действий в FLUX 3, масштабируя нашу первоначальную работу в Self-Flow; и использование предобученного видео-бэкбона в качестве динамически-ориентированной основы, на базе которой специализированные модели действий могут быть дообучены с использованием ограниченных данных по конкретным задачам.
Для второго пути компания mimic robotics стала одним из первых партнеров, получивших ранний доступ к FLUX 3. Вместе мы разработали FLUX-mimic, модель видео-действий, объединяющую бэкбон FLUX 3 с опытом mimic в обучении роботов ловким манипуляциям и развертыванию в производстве. Прочитайте наш тезис о том, почему физический ИИ и создание контента работают на одной основе и как это тестируется на реальных производственных задачах в Audi.
План запуска
В течение следующих нескольких недель и месяцев мы сделаем доступными следующие возможности, каждая из которых будет открыта после этапа раннего доступа для обеспечения плавного внедрения, сбора отзывов и тщательного тестирования безопасности. Все возможности построены на одной и той же базовой мультимодальной модели потокового соответствия. Эти возможности и модели включают:
- Генерация и редактирование видео и аудио через API и доступ к закрытым весам. («FLUX 3 Video»)
- Предсказание действий через избранных исследовательских и коммерческих партнеров, начиная с mimic robotics («FLUX-mimic и FLUX 3 Action»)
- Синтез и редактирование изображений через API и доступ к закрытым весам. («FLUX 3 Image»)
- Доступ к открытым весам мультимодального бэкбона для создания контента (видео, аудио и изображения) и предсказания действий. («FLUX 3 Dev»)
Мы также опубликуем более подробную техническую информацию о базовом подходе.
Запросить ранний доступ здесь
Что дальше?
Мы только начинаем раскрывать потенциал универсальных, функциональных и единых мультимодальных моделей и того, что они позволят реализовать. От интерактивного редактирования изображений и видео, моделирования до использования компьютера и физического ИИ — перед нами открыты широкие горизонты. Пока мы постепенно внедряем эти новые возможности, мы уже работаем над моделями следующего поколения. Наша цель — объединить прогнозирование восприятия, действий и языка в рамках одной унифицированной модели.
Если вам интересно изучать FLUX 3 и создавать на его основе свои проекты, свяжитесь с нами здесь. Если вы хотите внести свой вклад в нашу миссию, присоединяйтесь к нам! Мы открыты для найма сотрудников в Германии и США.