Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Flux 3 action 7b model deystviy v mire dlya upravleniya robotami
Dev48

© 2026 · All rights reserved.

FLUX 3 Action: 7B-модель действий в мире для управления роботами

Источник: Black Forest Labs

FLUX 3 Action: 7B-модель действий в мире для управления роботами

Источник: Black Forest Labs

7B-модель действий в мире с открытыми весами. Превратите визуальный интеллект FLUX в действия для вашего робота, симулятора или игры.

29 сентября 2026 г.•Обновлено: 29 сентября 2026 г.

Изображения, видео и аудио представляют собой различные аспекты лежащей в их основе реальности. Обучение на этих модальностях позволяет нам опираться на гораздо более широкий источник данных, чем только демонстрации действий, что приводит к лучшей обобщающей способности. Затем мы адаптируем эту фундаментальную модель посредством совместного обучения на видео и действиях, а также дообучения для целевого воплощения и соответствующего ему пространства действий.

В робототехнике рецепт дообучения так же важен, как и веса модели. Мы публикуем этот отчет вместе с весами, чтобы сделать данный процесс прозрачным: от этапов предварительного обучения и промежуточного обучения до дообучения и оптимизации вывода для прогнозирования действий, где эффективность, в частности, является критически важной и необходимой возможностью для локального развертывания. Кроме того, мы анализируем гибридные системы, которые сочетают быстрое прогнозирование действий с возможностями планирования передовых моделей рассуждения, и обнаруживаем, что быстрое управление делает воплощенное рассуждение более экономичным и эффективным по времени — до 53,64% больше успешных результатов на доллар.

Основное внимание в этом отчете уделяется прогнозированию действий применительно к робототехнике, но прогнозирование действий распространяется и на цифровые среды. Мы исследуем игры как испытательный стенд для навигации, предвосхищая использование компьютеров и других агентов, чувствительных к задержкам, а также возможности планирования, основанные на визуальной информации.

Политики действий

Открытые политики действий в настоящее время заставляют делать выбор: модели мирового действия (World Action Models, WAMs), которые прогнозируют будущие действия совместно с видео, лидируют в бенчмарках, таких как RoboLab⁠. Cosmos 3 Nano успешно справляется с 36,8% задач, в то время как Pi0.5, самая мощная открытая модель Vision Language Action (VLA), достигает успеха в 28,0%. Но прогнозирование видео вместе с действиями делает WAMs дорогостоящими. На графическом процессоре B200 модель Cosmos 3 Nano в формате FP8 требует примерно в 4,7 раза больше времени обработки на секунду движения робота, чем Pi0.5 в формате BF16. Выбирая WAM, вы платите задержками и затратами на оборудование; выбирая VLA, вы отказываетесь почти от четверти успешных выполнений.

Совместное выполнение прогнозов по видео и действиям позволяет WAMs переносить свое понимание мира, полученное в ходе крупномасштабного предварительного обучения на видео, на прогнозирование действий с ограниченным дополнительным контролем данных о действиях. Но это также приводит к большой длине последовательностей, что увеличивает вычислительные затраты. Кроме того, они часто полагаются на методы наведения (guidance), удваивающие стоимость каждого прямого прохода, и работают на архитектурах с большим количеством параметров (например, у Cosmos 3 в 4,85 раза больше параметров по сравнению с Pi0.5). Существующие решения пытаются ограничить взаимодействие между видео и действиями, но при этом фундаментально меняют архитектуру и возможности WAMs. Другие подходы полагаются на распараллеливание наведения, но это ведет к увеличению затрат на оборудование и даже в этом случае не достигает скорости VLA из-за вычислительных затрат их более крупных архитектур.

FLUX 3 Action (F3A) упрощает этот выбор. Наша одношаговая контрольная точка 7B превосходит любую другую открытую политику в RoboLab с показателем 38,3% ± 0,38 по сравнению с 36,8% у Cosmos 3 Nano, при этом обеспечивая увеличение скорости от 1,34 до 2,28 раза на секунду движения робота по сравнению с Pi0.5 на рабочих станциях и графических процессорах центров обработки данных, несмотря на то, что она по-прежнему прогнозирует видео и действия совместно. Обратите внимание, что это преимущество в скорости относится к коэффициенту реального времени, а не к задержке на вызов: как WAM, она может прогнозировать более длительный горизонт движения в 2,13 с по сравнению с 1,0 с для Pi0.5. Когда задержка менее важна, наша контрольная точка, дистиллированная с помощью наведения, повышает современный уровень успешности в RoboLab до 42,2% ± 0,36. Наши базовые и дистиллированные контрольные точки в формате FP8 обеспечивают ускорение от 1,52 до 3,95 раза по сравнению с Cosmos 3 Nano в FP8 на потребительских, рабочих и серверных графических процессорах.

К этим результатам привели два основных изменения: во-первых, архитектура, размер которой менее половины размера Cosmos 3 Nano, стала возможной благодаря нашему мультимодальному предварительному обучению Self-Flow, которое дает сильные представления. Во-вторых, дистилляция, которая устраняет необходимость в проходе наведения и сокращает количество шагов выборки до одного, не отделяя видео от действия.

Хотя это сдвигает границу Парето политик действий по скорости и точности, все еще существуют задачи, которые все политики, включая нашу, не могут решить самостоятельно. GPT 6 Astra, с другой стороны, может решить все задачи в бенчмарке Su et al. (2026) при использовании максимальных усилий рассуждения. Но один вызов рассуждения добавляет около 35,77 секунды на секунду движения робота, и каждый успех стоит в среднем $13,47 и занимает 16 минут. Напротив, F3A сама по себе тратит 21,08 миллисекунды на секунду движения робота, и каждый успех стоит $0,09 и занимает в среднем менее двух минут при работе на графическом процессоре H200 за $3 в час. Большую часть этих двух минут F3A простаивает, ожидая, пока робот движется. В этой ситуации F3A могла бы обслуживать еще 47 других выполнений одновременно без дополнительных затрат. Главный нюанс заключается в том, что она не может решить каждую отдельную задачу.

Многообещающее решение состоит в том, чтобы позволить системе рассуждения, GPT 6 Astra, делегировать управление эффективной политике, такой как F3A или Pi0.5, и вмешиваться только при необходимости. В условиях Su et al. (2026) такая гибридная политика едва улучшает ситуацию при использовании Pi0.5. Лучший гибрид стоит $12,28 за успех против $13,47 для чистого рассуждения и занимает 13,5 минут вместо 14.

Однако с F3A в качестве политики эта стратегия делегирования окупается. Гибридная политика по-прежнему решает 90% всех эпизодов, включая сложные задачи, которые ни одна чистая политика действий не может решить самостоятельно, и снижает затраты до $8,77 и 8 минут на успех, что делает ее на 29% дешевле и на 40% быстрее, чем лучшая альтернативная конфигурация. Чистое рассуждение с максимальными усилиями по-прежнему достигает наивысшей точности, поэтому компромисс между надежностью и стоимостью сохраняется, но улучшенные политики, такие как F3A, меняют положение этого компромисса.

Чем лучше быстрая политика, тем меньше системе приходится рассуждать. Эти исследования — лишь первый взгляд на более глубокую интеграцию систем рассуждения и быстрого прогнозирования действий, и мы ожидаем, что есть много возможностей для улучшения в направлении использования такого количества рассуждений, которое необходимо, и как можно меньшего их количества. Далее мы описываем разработку FLUX 3 Action и наши выводы, сделанные в процессе работы.

От прогнозирования видео к прогнозированию действий

Идея использования прогностических моделей будущих наблюдений для принятия решений имеет долгую историю, включая ранние демонстрации управления роботами, которые сочетали прогнозирование видео, обусловленное действиями, с управлением на основе моделей. UniPi вместо этого генерирует видео выполнения задачи с помощью генератора видео, обусловленного текстом, и восстанавливает исполняемые действия из сгенерированных кадров с помощью модели обратной динамики (IDM). Ключевым аргументом UniPi было то, что предварительное обучение видеомодели на крупномасштабных нероботизированных данных переносится на политику робота и улучшает обобщение на невидимые задачи.

В последующих работах сохранилось использование крупномасштабного предварительного обучения на видео, но прогнозирование видео и действий было связано более тесно, чем в двухэтапном конвейере, состоящем из генерации видео с последующим использованием IDM. Совместное прогнозирование будущих кадров и действий в рамках единой генеративной модели было исследовано в GR-1, GR-2, WorldVLA, Cosmos Policy и LingBot-VA; в DreamZero был введен термин «World Action Model» (WAM) для этого подхода, который впоследствии переняли такие системы, как GigaWorld-Policy и варианты политики Cosmos 3. В свою очередь, mimic-video сохраняет модель обратной динамики, но обусловливает ее латентными признаками видеомодели, а не декодированными кадрами, что позволяет избежать полной генерации видео при выводе и получить то, что авторы называют «Video-Action Model» (VAM). Еще одно направление рассматривает прогнозирование видео как вспомогательную задачу совместного обучения и полностью пропускает генерацию видео на этапе вывода.

Ранее мы исследовали производительность FLUX 3 в качестве VAM с отдельным декодером действий в нашем исследовании дизайна FLUX-mimic. См. также mimic’s continued study on the data efficiency of flux-mimic⁠. Здесь мы изучаем производительность FLUX 3 в качестве WAM с совместным прогнозированием видео и действий, как показано на Рисунке 3.

Попробуйте цикл управления

Получив инструкцию, например «положи красный кубик в левый контейнер», модель использует изображения с камеры и положения суставов для совместного прогнозирования команд двигателей и их визуальных результатов. Робот выполняет заданное количество этих действий, затем снова «смотрит» и планирует дальнейшие шаги на основе свежих наблюдений.

Начните миссию, уроните кубик и посмотрите, как манипулятор восстановится. Измените частоту повторного осмотра, чтобы увидеть, как это влияет на реакцию.

Результаты

Предварительное обучение и промежуточное обучение

Предварительное обучение следовало за FLUX 3 и использовало смесь данных изображений, видео и аудио, причем на видео приходилось более 95% обучающих токенов. Чтобы оценить возможности прогнозирования действий контрольных точек предварительного обучения, мы следуем протоколу, аналогичному Cosmos 3: мы добавляем случайно инициализированные «головы» действий, а затем проводим дообучение (finetuning) на DROID. Полученная контрольная точка оценивается на RoboLab.

Для результатов на Рисунке 4 мы использовали предварительные настройки с небольшим размером пакета (batch size) и скоростью обучения. Таким образом, они не представляют собой максимальную производительность, достижимую для контрольной точки. Но поскольку во всех запусках использовались сопоставимые настройки, это все равно позволяет нам сравнить их относительные возможности в прогнозировании действий.

Обратите внимание, что без предварительного обучения производительность остается ниже 1%. С предварительным обучением этот показатель возрастает до 11,6% и продолжает медленно, но неуклонно расти до 12,4%. Низкая производительность контрольной точки без предварительного обучения указывает на то, что обучение действиям исключительно на DROID сильно ограничено данными, и показывает, что мультимодальное предварительное обучение с большим объемом видео действительно может преодолеть это ограничение.

Далее мы рассматриваем фазу промежуточного обучения, сфокусированную на действиях, где мы продолжаем обучение на смеси наших данных предварительного обучения вместе с недавно введенными данными о действиях. Мы распределяем 36,95% обучающих выборок на видео с аудио из наших данных предварительного обучения, а оставшиеся 63,05% — на видеоданные, сопровождаемые согласованными действиями. Из всех обучающих выборок 19,55% взяты из записей игр, 13,54% — из эгоцентрических видео с аннотациями поз рук, 14,03% — с ручных захватов и 15,93% — из телеуправления с использованием 14 различных воплощений (embodiments). Соответствующие коэффициенты токенов немного различаются из-за разного разрешения и длительности; см. Таблицу 2.

Игровые действия представлены 64 измерениями. Первые два кодируют движение мыши по осям x и y, следующие два кодируют левую и правую кнопки мыши, а оставшиеся 60 кодируют кнопки клавиатуры. Двоичные каналы кнопок деквантуются во время обучения.

Большинство наборов данных, основанных на эгоцентрических позах, ручных захватах и телеуправлении, используют 50-мерное пространство действий, EE50. Первые 25 измерений используются для левого или основного эффектора, а последние 25 — для правого или вторичного эффектора. В пределах этих 25 измерений первые три кодируют трансляцию, а следующие шесть кодируют вращение, как в работе Zhou et al. 2019, но с использованием первых двух строк вместо первых двух столбцов матрицы вращения. Оставшиеся 16 измерений кодируют либо углы позы руки, либо состояние захвата, где 0 представляет закрытый захват, а 1 — открытый. Измерения, не используемые для конкретного воплощения, дополняются нулями.

Обратите внимание, что некоторые наборы данных роботов полагаются на отдельное 14-мерное пространство действий, разделенное на 7 измерений для левой/основной и 7 измерений для правой/вторичной рук. Здесь мы обучаемся непосредственно на 6 состояниях суставов и одном состоянии захвата, так как у нас нет моделей прямой динамики воплощения. Во всех наборах данных действий частота действий варьируется от 5 Гц до 30 Гц.

Для пространства действий EE50 поза конечного эффектора представлена относительно опорного кадра, который является последним кадром обусловливания. Мы выбираем состояние действия, наиболее близкое к этому опорному кадру, в качестве опорного состояния и представляем все остальные позы конечного эффектора относительно этого состояния. Артикуляция рук и значения захвата остаются абсолютными. Наконец, мы нормализуем каждое измерение EE50, используя специфические для воплощения z-оценки, как в работе Punamiya et al. 2025, индексированные по знаковому смещению положения относительно опорного состояния.

С «головой» действий EE50 мы теперь можем оценивать производительность контрольных точек промежуточного обучения на RoboLab напрямую, без дополнительного дообучения. Результаты этих оценок показаны штриховыми линиями на Рисунке 4. Первоначально мы наблюдаем, что производительность EE50 быстро возрастает с 0% через 7,2% до 14,7% со скромным приростом для результатов, полученных при совместном дообучении (Joint finetuning), которое улучшается лишь на 2,3% по сравнению с производительностью на последней контрольной точке предварительного обучения. К более поздним этапам мы видим постоянные улучшения как для EE50, достигающего 17,3%, так и для производительности совместного дообучения, достигающего 18,6%. Мы еще не наблюдали насыщения производительности в процессе промежуточного обучения.

Переход от шума к сигналу для видео и действий

Диффузионные и потоковые модели учатся обращать индексированный по времени прямой процесс zt = (1−t)x₀ + tε, который смешивает данные x₀ с шумом ε ∼ N(0,1). В зависимости от масштаба и структуры данных область t, где этот прямой процесс переходит от шума к сигналу, может быть разной. Во время обучения t выбирается из распределения временных шагов, и его выбор может существенно повлиять на производительность моделей.

При совместном прогнозировании двух модальностей, таких как видео и действия, мы также должны учитывать взаимодействие между ними. Чтобы получить представление об областях перехода от сигнала к шуму для обеих модальностей, мы вычисляем потерю реконструкции x₀ отдельно для каждой из них. Мы делаем это для нескольких контрольных точек, обученных с различными распределениями временных шагов, а затем берем поточечный минимум по контрольным точкам, чтобы получить минимальную огибающую потерь x₀ в качестве аппроксимации профиля «сигнал-шум» для видео и действий. Мы строим эти огибающие, нормализованные до максимальной потери 1, на Рисунке 5.

Мы наблюдаем S-образный профиль с переходом около σ(t) = 3.3 или t ≃ 0.964. Предполагая, что емкость модели лучше всего расходуется в областях с высоким переходом сигнала, разумным подходом будет использование распределения временных шагов, функция плотности вероятности (pdf) которого пропорциональна производной S-образного профиля. В зависимости от функции, используемой для аппроксимации S-образной кривой, мы получаем различные распределения временных шагов. При использовании сигмоидальной функции для аппроксимации, как показано на Рисунке 5, мы получаем логистическое распределение в логит-пространстве, т.е. логит-логистические распределения, показанные на Рисунке 6. Аналогично, при использовании функции распределения Гаусса мы получаем гауссовское распределение в логит-пространстве или логит-нормальное распределение.

Мы используем эти оценки в качестве ориентиров для выбора распределений временных шагов при поиске по сетке. Помимо логит-нормального и логит-логистического распределений, мы также включаем распределение временных шагов «mode-sampler» или «Waver», поскольку оно является выбором в NVIDIA et al. 2026. Мы формулируем параметр местоположения для всех трех кандидатных распределений через центрированное на нуле базовое распределение с последующим применением функции сдвига t ↦ αt / (1 + (α−1)t) с параметром α. Для логит-нормального и логит-логистического распределений это приводит к сдвигу их моды к logit(t) = log α. Мы выбираем α ∈ {24, 33, 42}, что соответствует модам оценок видео и действий на Рисунке 6, а также одному промежуточному значению. Мы используем единичную дисперсию для логит-нормального распределения и рассматриваем логит-логистические распределения с масштабом 0.5 и 0.75. Для распределения Waver мы следуем NVIDIA et al. 2026 и используем сдвиг α = 5, а также перебираем одно более высокое (10) и одно более низкое (2.5) значение.

Помимо самого распределения временных шагов, мы рассматриваем один дополнительный параметр: масштаб представления действий (не путать с масштабом распределения временных шагов). Умножая действия на s, но не видео, мы сдвигаем относительный переход сигнал-шум на Рисунке 5 между ними. Когда s > 1, требуется больше шума для разрушения сигнала, и кривая действий сдвигается вправо. Это позволяет нам контролировать, как различные модальности моделируются по отношению друг к другу. Рассмотрим две модальности m₁, m₂. Предполагая, что их профили сигнал-шум примерно совпадают, модель для m₁, s·m₂ с s ≫ 1 эффективно аппроксимировала бы факторизацию вида p(m₁, s·m₂) = p(m₁ | s·m₂) p(s·m₂) в рамках модели совместного потокового сопоставления (joint flow matching), поскольку во время перехода s·m₂ от шума к сигналу m₁ все еще оставалась бы преимущественно шумом, но когда мы достигаем точки перехода для m₁, s·m₂ уже является преимущественно сигналом. Аналогично, s ≪ 1 позволило бы достичь аппроксимации p(m₁, s·m₂) = p(s·m₂ | m₁) p(m₁). Чтобы исследовать влияние этого, мы рассматриваем коэффициенты масштабирования s ∈ {1, 2} для модальности действий. Чтобы контролировать влияние на взвешивание функции потерь, мы перевзвешиваем потери для модальности действий на 1/s².

Мы обучаем различные варианты и сообщаем результаты по нескольким случайным начальным значениям (seeds) на простом наборе задач RoboLab на Рисунке 7. В целом, нам не удалось выявить четкую тенденцию в этих результатах, но мы последовательно наблюдаем высокую производительность для логит-логистических распределений с масштабированием действий s = 2 и высокими сдвигами α = 42. Среди двух масштабов логит-логистического распределения более широкий, с масштабом 0.75, показывает наилучшие результаты, и мы продолжаем использовать эту настройку.

Рецепт DROID

При дообучении на DROID мы добавляем случайно инициализированные «головы» действий к нашему чекпоинту середины обучения (midtrain). Таким образом, дообучение начнется с очень зашумленного градиентного сигнала, что может негативно повлиять на модель. Чтобы гарантировать, что веса середины обучения не деградируют во время этой начальной фазы адаптации, мы оставляем их замороженными на первые 1000 шагов, а затем линейно увеличиваем их скорость обучения (learning rate) с 0 до 2e-4 в течение 2000 шагов. Скорость обучения для самих «голов» действий линейно возрастает с 0 до 1e-3 в течение первых 1000 шагов. Мы сравниваем эту стратегию с запуском, где мы дообучаем DROID с позами конечного эффектора, адаптированными к нашему пространству действий EE50 (см. Предварительное обучение и Обучение в середине). Для этого варианта «головы» действий уже инициализированы из середины обучения, и мы используем простое увеличение скорости обучения с 0 до 2e-4 в течение первых 1000 шагов для всех параметров. Мы обучаем обе конфигурации с двумя размерами батча, 512 и 2048, в течение 20 000 шагов.

Для конфигурации с малым размером батча производительность EE50 остается выше производительности совместного дообучения (Joint finetuning). Производительность хорошо масштабируется с размером батча, при этом наблюдаются лишь небольшие затраты при сравнении при сопоставимых FLOPs: производительность запусков EE50 и Joint с размером батча, увеличенным в 4 раза, на шаге 5000 снижается лишь на 2.25 п.п. и 4.25 п.п. соответственно по сравнению с запуском с меньшим размером батча после 20 000 шагов. Однако после 10 000 шагов с большим размером батча совместное дообучение превосходит дообучение EE50 с итоговой производительностью 40.13% против 37.88%. Мы продолжаем использовать запуск совместного дообучения, но отмечаем, что дообучение EE50 может быть привлекательным вариантом при очень малом количестве данных или шагов обучения — особенно учитывая, что распределение временных шагов было выбрано исходя из его производительности для совместного дообучения.

Чтобы понять, достигнуто ли насыщение производительности, мы использовали следующий протокол для выбора лучшего чекпоинта: мы продолжаем обучение совместного запуска в общей сложности до 30 000 шагов и используем линейное снижение скорости обучения на последних 5000 шагах. Затем мы оцениваем модель каждые 1000 шагов во время снижения и выбираем чекпоинт с наилучшей производительностью.

Хотя функция потерь при обучении показывает постоянные улучшения, особенно во время фазы снижения скорости обучения, мы не наблюдаем дополнительных улучшений после 20 000 шагов дообучения. Лучший результат из фазы снижения достигает 40% на 26 000 шагов.

При более высоких значениях скорости обучения, в районе базового LR 2e-4 и выше, мы наблюдали спорадические скачки потерь. Как показано на Рисунке 10, обучение, затронутое скачком потерь, имеет более низкие показатели успеха в RoboLab по сравнению с возобновлением обучения с предыдущего чистого чекпоинта. Несмотря на то, что показатели успеха в конечном итоге восстанавливались, мы наблюдали случаи, когда запускам требовалось гораздо больше времени для восстановления, что приводило к неоптимальной производительности в рамках горизонта обучения. Следовательно, мы всегда откатывались назад после наблюдения скачков потерь, чтобы поддерживать сопоставимые чекпоинты и избегать негативного влияния на итоговую производительность.

Раздельное руководство (Split Guidance) для видео и действий

Учитывая, что вывод фрагмента действий предсказывает как будущее видео, так и будущие действия, мы можем независимо применять руководство без классификатора (classifier-free guidance) к каждой модальности. Мы анализируем поведение CFG, выполняя поиск по сетке гиперпараметров {Video CFG, Action CFG} и оценивая показатели успеха на полном наборе из 120 задач.

Мы наблюдаем градиентную тенденцию, которая отдает предпочтение более высокому Video CFG и более низкому Action CFG, при этом Video CFG = 4.0 и Action CFG = 1.0 показывают наилучший результат с оценкой 42.00%. Мы выбираем эту настройку в качестве предпочтительной для производственной среды.

Анализ EMA

Мы установили, что EMA имеет решающее значение как для производительности, так и для надежного сравнения результатов абляционных исследований. Поэтому мы решили отслеживать как традиционную EMA, так и Power EMA (σrel = 0,05 и 0,10).

Для традиционной EMA шаг обновления выглядит так:

θˆβ(t)=βθˆβ(t−1)+(1−β)θ(t),θˆβ(0)=θ(0),

(1)

где θ(t) — необработанные параметры на шаге обучения t.

В наших экспериментах мы выбрали β = 0,9990. Поскольку мы сохраняем контрольные точки каждые K = 1000 шагов, мы также оценили «офлайн» варианты EMA для других значений β. Среднее значение берется по конечному окну сохраненных снимков и нормализуется по весу, фактически накопленному в нем,

α=βK,θˆβoff(N)=∑n=1N(1−α)αN−nθ(nK)1−αN,

(2)

где n индексирует N сохраненных контрольных точек. Возведение β в степень K позволяет рекурсии для каждой контрольной точки соответствовать профилю каждого шага из уравнения 1, за исключением потери детализации внутри интервала, а знаменатель устраняет смещение запуска конечного окна.

Для Power EMA шаг обновления выглядит так:

θˆγ(t)=∫0tτγθ(τ)dτ∫0tτγdτ=γ+1tγ+1∫0tτγθ(τ)dτ,

(3)

который вычисляется инкрементально как

θˆγ(t)=βγ(t)θˆγ(t−1)+(1−βγ(t))θ(t),βγ(t)=(1−1t)γ+1.

(4)

где t — порядковый номер обновления, начинающийся с единицы. Следуя Karras et al. (2024), мы параметризуем профиль его относительной шириной σrel = (γ+1)(γ+2)(γ+3).

Во время обучения мы отслеживаем два варианта: один с σrel = 0,05, а другой с σrel = 0,10 (что эквивалентно γ = 16,9722 и γ = 6,9372). С помощью этих двух профилей мы можем выполнить более точную апостериорную реконструкцию для новых значений σrel,

𝐱˜=arg min𝐱∫0tN(∑i,nxi,npγi,tn(τ)−pγ⋆,tN(τ))2dτ,

(5)

(6)

θˆγ⋆≈∑i,nxi,nθˆγi(tn),

(7)

где pγ,t(τ) обозначает профиль взвешивания, который уравнение 3 присваивает θ(τ) при усреднении до момента времени t. Базис состоит из обоих отслеживаемых профилей для каждой сохраненной контрольной точки, т.е. из 2N сохраненных снимков {θ̂γᵢ(tn)}. Аппроксимация не ограничена, поэтому коэффициенты могут быть отрицательными, а x̃ нормализуется так, чтобы их сумма была равна единице, что делает реконструкцию аффинной комбинацией снимков.

Результаты для различных настроек EMA обобщены на рисунке 12. Традиционная онлайн-EMA и обе модели Power EMA значительно превосходят необработанную модель, что демонстрирует важность EMA. Мы также наблюдаем, что Power EMA немного превосходит традиционную EMA.

Для апостериорных кандидатов Power EMA и офлайн-EMA мы наблюдаем колоколообразную тенденцию, при этом показатели успеха достигают пика при σrel = 0,150 и β = 0,9997 соответственно. Однако в обоих случаях онлайн-усреднение, при котором обновления происходят на каждом шаге, оказывается сильнее, чем апостериорная аппроксимация.

Рассматривая общую картину, мы видим, что онлайн-Power EMA с σrel = 0,10 стабильно показывает наилучшие результаты, и мы выбираем ее в качестве рекомендуемой настройки EMA для рецепта DROID.

Эффективность вывода

WAM показали многообещающие результаты в плане эффективности данных и производительности. Однако прогнозирование не только действий, но и видео делает их сравнительно медленными из-за большей длины последовательностей по сравнению с VLA. Это ограничивает их применение в ситуациях, критичных к задержкам, или при работе в условиях аппаратных ограничений, таких как локальное развертывание. Предыдущие подходы в основном опирались на оптимизацию на уровне системы или разделение действий и видео с помощью отдельных декодеров или маскирования внимания. Здесь мы рассматриваем ортогональное направление и исследуем, насколько близко мы можем подойти к эффективности VLA с помощью дистилляции, сохраняя при этом совместное прогнозирование действий и видео.

GPU

Оценка на реальных роботах

Гибридные политики

Перспективы

Список литературы

  • Cen, Jun, Chaohui Yu, Hangjie Yuan, et al. 2025. WorldVLA: Towards Autoregressive Action World Model. arxiv.org/abs/2506.21539
  • Cheang, Chi-Lam, Guangzeng Chen, Ya Jing, et al. 2024. GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation. arxiv.org/abs/2410.06158
← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
OpenAI спровоцировала борьбу за Hugging Face ранним предложением об инвестициях в преддверии сделки Nvidia на 13 млрд долларовПресса
OpenAI

OpenAI спровоцировала борьбу за Hugging Face ранним предложением об инвестициях в преддверии сделки Nvidia на 13 млрд долларов

OpenAI по-прежнему не до конца контролирует всю активность своих ИИ-агентов с непредсказуемым поведениемПресса
OpenAI

OpenAI по-прежнему не до конца контролирует всю активность своих ИИ-агентов с непредсказуемым поведением

Новая модель речи v4 от ElevenLabs поддерживает больше контроля выражения и 90 языковПресса
ElevenLabs

Новая модель речи v4 от ElevenLabs поддерживает больше контроля выражения и 90 языков

Meta, Google, Amazon, Microsoft вызывают вопросы сенатора Уоррен о налоговых субсидиях на ИИПресса
Amazon

Meta, Google, Amazon, Microsoft вызывают вопросы сенатора Уоррен о налоговых субсидиях на ИИ

Кастомные приложения LangSmith: создавайте собственные интерфейсы для данных ваших агентов
LangChain

Кастомные приложения LangSmith: создавайте собственные интерфейсы для данных ваших агентов

Новое в LangSmith: Engine v2, управляемые Deep Agents, тонкая настройка и многое другое
LangChain

Новое в LangSmith: Engine v2, управляемые Deep Agents, тонкая настройка и многое другое