Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Flux 3 x mimic sleduyuschee pokolenie modeley video deystvie
Dev48

© 2026 · All rights reserved.

FLUX 3 x mimic: следующее поколение моделей «видео-действие»

Источник: Black Forest Labs

FLUX 3 x mimic: следующее поколение моделей «видео-действие»

Источник: Black Forest Labs

FLUX 3 управляет роботами. Созданная с использованием mimic и внедренная в Audi, модель FLUX-mimic показывает, что создание контента и физический ИИ имеют общую основу: модель, которая понимает мир.

25 сентября 2026 г.

Ранняя версия FLUX 3, нашей новой мультимодальной базовой модели, теперь управляет роботами. Мы предоставили компании mimic robotics ранний доступ к FLUX.3. Их опыт в обучении и развертывании роботов в сочетании со знаниями модели о мире и экспертизой BFL в области базовых моделей позволили создать FLUX-mimic: следующее поколение моделей «видео-действие».

FLUX

FLUX 1 и FLUX 2 генерируют изображения. FLUX 3 расширяет возможности до мультимодальности и генерирует аудиовизуальный контент совместно, а также служит основой для FLUX-mimic: модели «видео-действие», разработанной в сотрудничестве с mimic, которая управляет роботами, протестированными и внедренными в Audi.

На первый взгляд, создание убедительного визуального контента и управление роботами имеют мало общего. Одно требует генерации пикселей, другое — понимания того, как физический мир реагирует на прикосновения и манипуляции. Если одна модель делает и то, и другое, значит, она никогда не была просто моделью для создания контента. Это модель того, как ведет себя мир, а создание контента — лишь одна из возможностей ее применения.

Именно этим и является FLUX 3.

Видео — это сложная часть

FLUX 3 — это единая модель, совместно обученная на изображениях, видео и аудио с самого начала. Самая требовательная часть этого обучения, на которую приходится более 95% общих вычислительных затрат, — это прогнозирование видео. Чтобы генерировать реалистичные видео, у модели нет иного выбора, кроме как изучить контакт, движение, вес, причину и следствие; любая ошибка в этих аспектах будет выглядеть неестественно. Обучение точному рендерингу мира означает обучение тому, как этот мир функционирует.

Относительно говоря, аудио — это простая модальность. Имея низкую размерность и будучи гораздо менее детализированным, чем видео, аудио составляет менее 0,5% токенов в видео 720p со звуком. Как только модель выполняет сложную работу по пониманию видео, она усваивает причинно-следственную связь между видео и аудио, чтобы предсказывать речь, синхронизированную с движением губ, и звуковые эффекты, синхронизированные с физическими событиями, которые их вызывают.

Действия следуют той же логике: это низкоразмерное представление состояния робота, тесно связанное с визуальными наблюдениями. Действия, аудио и видеокадры — все это частичные представления единой физической реальности. После того как модель изучила физические процессы, стоящие за видео и аудио, прогнозирование действий не является чем-то новым — это еще один взгляд на реальность, которую она уже моделирует.

Единая архитектура

Если эта концепция верна, обучение FLUX 3 прогнозированию действий не должно повлечь за собой долгосрочных издержек: мы ожидаем короткую фазу «возмущения», пока модель изучает структуру пространства действий и адаптирует к нему свое внутреннее представление мира, прежде чем вернуться к полной производительности. Именно это мы и наблюдаем.

В ходе масштабного обучения мы добавили прогнозирование действий в учебную программу и наблюдали эффект для качества генерации видео. Оценки людей для задач «текст-в-видео» и «изображение-в-видео» поначалу снизились на 10%, так как модель начала включать новую модальность действий. Через 3500 шагов модель восстановила свое прежнее качество генерации видео, при этом научившись прогнозировать действия.

Каждая серия нормализована по собственному качеству до добавления прогнозирования действий. Чем выше, тем лучше.

Модели пришлось интегрировать действия в свои входные и выходные данные, но это не привело к постоянной потере вычислительной мощности. Ей просто нужно было понять, как эта новая модальность соотносится с существующей моделью мира. Как только это было выяснено, штраф к производительности существующих возможностей исчез. Генерации видео и прогнозированию действий не нужны отдельные основы. Один и тот же фундамент поддерживает и то, и другое.

Это делает физический ИИ естественным продолжением нашей дорожной карты в Black Forest Labs, а не сменой направления. Создание контента — это то, что наш мультимодальный фундамент FLUX 3 делает с изображениями, видео и аудио. Физический ИИ — это то, что он делает с действиями. Одна базовая модель с визуальным интеллектом в основе, обеспечивающая два семейства приложений. Мы не создавали отдельную базовую модель. Мы сосредоточились на сложном: создании модели, которая понимает мир. Действия в нем — это то, что делает возможным такое понимание.

От лаборатории к реальности: FLUX-mimic

Что произойдет, если мы направим фундамент FLUX 3 на реальные задачи автоматизации на реальных производственных линиях?

Это вопрос, на который mimic и BFL создали FLUX-mimic, чтобы ответить. mimic строит своих собственных роботов и обладает опытом в обучении роботов, ловких манипуляциях и внедрении в производство; BFL создает визуальные базовые модели и обладает опытом в мультимодальном обучении и моделировании. Вместе мы создали модель следующего поколения для манипуляций общего назначения, адаптированную к промышленным требованиям и интегрированную в систему развертывания полного цикла mimic. FLUX-mimic — это модель «видео-действие», построенная на фундаменте FLUX 3.

Декодирование изученной модели мира

Наш тезис заключается в том, что FLUX 3 должна изучить внутреннее представление мира, чтобы иметь возможность генерировать видео. FLUX-mimic следует этому тезису и декодирует действия из изученного представления мира фундамента FLUX. Этот подход, впервые примененный в mimic-video, обучает легкий декодер действий поверх промежуточных признаков, извлеченных из пути прогнозирования видео FLUX.

Обзор архитектуры: как FLUX-mimic построен поверх FLUX 3

Успех этого подхода зависит от двух связанных, но разных аспектов: качества модели мира, изученной FLUX, и качества представления признаков этой модели мира. Качество модели мира напрямую связано с качеством генерации: если модель не понимает, как ведет себя мир, она не может его симулировать. Однако даже лучшая модель мира не поможет декодеру действий, если она недоступна: если пространство признаков сохраняет причинно-следственные связи между модальностями в нелинейно запутанном виде, понимание этих связей из представления признаков остается таким же сложным, как и из необработанных входных данных — качество представления имеет значение.

Качество генерации и качество представления долгое время изучались и рассматривались изолированно друг от друга. Генеративные подходы приводят к созданию высококачественных моделей мира, которые позволяют проводить симуляции, и они демонстрируют законы масштабирования для предсказуемой отдачи от инвестиций в вычисления. Однако по сравнению с более специализированными подходами к обучению представлений они создают менее разделенные представления, что ограничивает их полезность для задач, требующих понимания мира.

Поскольку генеративные модели сами опираются на собственные признаки, такое расхождение в качестве их представлений кажется контринтуитивным. Улучшение представлений внутри генеративных моделей должно повысить качество их модели мира и сделать их более пригодными для решения прикладных задач. В нашей работе Self-Flow мы продемонстрировали, как объединить генерацию и обучение представлений в единую структуру, и наблюдали именно это взаимное улучшение: модель мира стала лучше — судя по качеству генерации видео, изображений и аудио, — а качество её представлений повысилось, что подтверждается показателем успешности выполнения задач управления роботами в симуляции.

Self-Flow против Flow Matching (FM). Слева: ошибка генерации (расстояние Фреше) для каждой модальности, нормализованная до FM = 100 (чем меньше, тем лучше). Справа: показатель успешности выполнения манипуляционных задач, усредненный по четырем группам задач после дообучения (чем выше, тем лучше).

Масштабирование модели мира

Законы масштабирования остаются верными для Self-Flow, и FLUX 3 является тому подтверждением: это масштабируемая версия Self-Flow. Она обучена на десятках миллионов часов общего видеоконтента, чтобы с самого начала максимально широко изучить динамику мира, а также на сотнях тысяч часов видеоконтента, посвященного задачам манипуляции людьми и роботами, чтобы стать основой для визуального интеллекта. Именно это масштабирование переносит успех Self-Flow из лаборатории в реальность. mimic развернула FLUX-mimic в реальных производственных сценариях, охватывающих повседневную реальность работы производства и логистики: комплектация деталей в структурированные лотки, вставка электронных блоков управления в плотно прилегающие крепления, сборка компонентов и работа с мягкими, гибкими материалами, такими как уплотнители и кабели, с которыми традиционная автоматизация никогда не могла справиться.

Бенчмарки показывают, что декодер действий превосходит предыдущие модели «зрение-язык-действие», даже с полностью замороженной основой FLUX — в условиях, когда предыдущие модели «зрение-язык-действие» не справляются. Это подчеркивает, как масштабирование дает нашей основе глубокое знание мира и того, как в нем действовать, и как Self-Flow делает эти знания легко извлекаемыми из признаковых представлений основы. При дообучении основы вместе с декодером действий FLUX-mimic достигает современных показателей успешности.

Пунктирная линия отмечает медианный показатель успешности каждой модели по результатам 20 автономных испытаний. Чем выше, тем лучше.

От знаний о мире к выполнению задачи

Основа, раскрывающая знания о мире в декодируемых представлениях, меняет подход к обучению робота новой задаче. Если физика уже заложена в представлении и легко доступна, адаптация к задаче больше не требует обучения модели тому, как устроен мир — ей нужно лишь научиться тому, как эта конкретная задача соотносится с тем, что она уже знает. Самая трудоемкая часть выполняется до того, как робот вообще начнет двигаться.

Это напрямую отражается на том, сколько демонстрационных данных требуется для новой задачи. В наших экспериментах с Self-Flow предсказание действий достигало заданного уровня успешности за вдвое меньшее количество шагов обучения по сравнению с видеомоделью без Self-Flow — лучшие представления облегчают извлечение знаний о мире, поэтому для достижения того же уровня возможностей требуется меньше данных. В статье о mimic-video сообщается о повышении эффективности использования выборки до 10 раз для видео-экшен моделей по сравнению с моделями «зрение-язык-действие»; FLUX-mimic объединяет оба этих эффекта.

Та же выгода проявляется и в поведении. FLUX-mimic естественным образом восстанавливается после сбоев: робот, который промахнулся при захвате, исправляет ошибку, захватывает снова и завершает задачу. Ни один набор демонстраций не может охватить все возможные способы, которыми задача может пойти не так. Восстановление, которое никогда не демонстрировалось, должно исходить из другого источника — от модели, которая уже знает, как ведет себя мир.

Предсказанное основой будущее (вверху) вместе с выполнением, которое робот произвел на основе декодированных действий (внизу).

Достаточно быстро для действий

Реальное развертывание накладывает жесткое ограничение: модель должна действовать так же быстро, как меняется мир. Основные вычислительные затраты для FLUX-mimic приходятся на основу. Это самый крупный компонент модели, и в оптимизированном стеке развертывания mimic его задержка фактически устанавливает потолок для всей системы.

Именно здесь наша методология окупается во второй раз. Лучшие представления означают больше возможностей на параметр: модели, которая изучила хорошо структурированную модель мира, требуется меньше мощностей для достижения заданного уровня производительности, чем той, которая этого не сделала. Для развертывания это напрямую означает возможность запуска меньшей основы, а меньшая основа — это более быстрая основа.

Оценка CLIP на 1,0 млн шагов обучения; чем выше, тем лучше. Глубина основы является основным фактором задержки развертывания, поэтому меньшее количество слоев означает более быструю модель.

В результате основу FLUX-mimic можно оптимизировать для выполнения пути от входных данных до представления мира менее чем за 80 мс на одном графическом процессоре NVIDIA RTX 5090, что сопоставимо по порядку величины со временем визуальной реакции человека.

Реальное развертывание требует дополнительных оптимизаций всего стека, чтобы избежать добавления каких-либо дополнительных задержек: оптимизации mimic варьируются от декодера действий до сокращения межпроцессной задержки между датчиками, моделью и приводами, а также до разбиения на части в реальном времени, чтобы предсказание и выполнение перекрывались, обеспечивая плавную работу роботов без дрожания. Конечным результатом является автономная робототехническая система со временем реакции 101 мс.

На заводском цеху

Все это возвращает нас к месту, где автоматизация имеет значение: завод. Audi управляет одной из самых автоматизированных производственных сетей в автомобильной промышленности, что дает ей точное представление о том, где традиционная автоматизация все еще останавливается. Несмотря на десятилетия инвестиций в робототехнику, задачи с гибкими деталями и тонкой манипуляцией остаются ручными, в основном по экономическим причинам: разнообразие вариантов премиального производства делает традиционно запрограммированные роботизированные ячейки слишком дорогими для перепроектирования под каждый случай. Системы на основе обучения меняют эту математику.

«В партнерстве с mimic компания Audi тестирует и внедряет FLUX-mimic. Мы видели, как эти роботы решают сложные задачи по манипулированию мягкими телами, что было бы просто невозможно с традиционной робототехникой. Это может оказать значительное влияние на помощь нашим сотрудникам, повышение эффективности и расширение гибкой автоматизации в производственных и логистических операциях. Для нас партнерство с такими новаторскими компаниями, как mimic и Black Forest Labs, имеет важное значение для продвижения границ физического ИИ и проверки этих инноваций в реальных производственных условиях». — Кристоф Шнайдер, Audi Production Lab

Заключение

FLUX-mimic — это специализированная робототехническая модель и доказательство того, что нас ждет в будущем. Ее эффективность использования выборки и надежность обусловлены основой FLUX 3 и качеством представлений, которые она раскрывает, а не инженерными решениями, специфичными для конкретной задачи. Именно это позволяет подходу переноситься между задачами, отраслями и оборудованием. Узнайте больше через mimic.

Единая модель, в основе которой лежит визуальный интеллект, способная генерировать изображения, видео и аудио, а также управлять роботами на производственной линии. Создание контента и физический ИИ — это два направления применения одной и той же фундаментальной технологии.

← Все статьи