Изображения, видео и аудио представляют собой различные аспекты лежащей в основе реальности. Обучение на этих модальностях позволяет нам опираться на гораздо более широкий источник данных, чем только демонстрации действий, что приводит к лучшей обобщающей способности. Затем мы адаптируем эту основу посредством совместного обучения на видео и действиях, а также дообучения (fine-tuning) для целевого воплощения и соответствующего ему пространства действий.
В робототехнике рецепт дообучения так же важен, как и сами веса. Мы публикуем этот отчет вместе с весами, чтобы сделать процесс прозрачным: от этапов предварительного обучения и промежуточного обучения до дообучения и оптимизации вывода для прогнозирования действий, где эффективность, в частности, является критически важной и необходимой возможностью для локального развертывания. Кроме того, мы анализируем гибридные системы, которые сочетают быстрое прогнозирование действий с возможностями планирования моделей рассуждения передового уровня, и обнаруживаем, что быстрое управление делает воплощенное рассуждение более экономичным и эффективным по времени — до 53,64% больше успешных результатов на доллар.
Основное внимание в этом отчете уделяется прогнозированию действий применительно к робототехнике, но прогнозирование действий распространяется и на цифровые среды. Мы исследуем игры как испытательный стенд для навигации, предвосхищая использование компьютеров и других чувствительных к задержкам агентов, а также возможности планирования, основанные на визуальной информации.
Политики действий
Открытые политики действий в настоящее время заставляют вас делать выбор: World Action Models (WAMs), которые прогнозируют будущие действия совместно с видео, лидируют в бенчмарках, таких как RoboLab. Cosmos 3 Nano справляется с 36,8% задач, в то время как Pi0.5, сильнейшая открытая модель Vision Language Action (VLA), справляется с 28,0%. Но прогнозирование видео вместе с действиями делает WAMs дорогими. На графическом процессоре B200 модель Cosmos 3 Nano в формате FP8 требует примерно в 4,7 раза больше времени обработки на секунду движения робота, чем Pi0.5 в формате BF16. Выбирая WAM, вы платите задержками и затратами на оборудование; выбирая VLA, вы отказываетесь почти от четверти успешных запусков.
Совместное выполнение прогнозов по видео и действиям позволяет WAMs переносить свое понимание мира, полученное в ходе масштабного предварительного обучения на видео, на прогнозирование действий с ограниченным дополнительным контролем данных о действиях. Но это также приводит к большой длине последовательностей, что увеличивает вычислительные затраты. Кроме того, они часто полагаются на методы наведения (guidance), удваивающие стоимость каждого прямого прохода, и работают на архитектурах с большим количеством параметров, например, Cosmos 3 имеет в 4,85 раза больше параметров по сравнению с Pi0.5. Существующие решения пытаются ограничить взаимодействие между видео и действиями, но при этом фундаментально меняют архитектуру и возможности WAMs. Другие подходы полагаются на распараллеливание наведения, но это приводит к увеличению затрат на оборудование и даже в этом случае не достигает той же скорости, что и VLA, из-за вычислительных затрат их более крупных архитектур.
FLUX 3 Action (F3A) упрощает этот выбор. Наш одношаговый чекпоинт на 7B превосходит любую другую открытую политику в RoboLab с показателем 38,3% ± 0,38 по сравнению с 36,8% у Cosmos 3 Nano, при этом обеспечивая улучшение скорости от 1,34x до 2,28x на секунду движения робота по сравнению с Pi0.5 на рабочих станциях и серверных GPU, несмотря на то, что по-прежнему прогнозирует видео и действия совместно. Обратите внимание, что это преимущество в скорости относится к коэффициенту реального времени, а не к задержке на вызов: как WAM, модель может прогнозировать более длительный горизонт движения в 2,13 с по сравнению с 1,0 с у Pi0.5. Когда задержка менее важна, наш чекпоинт, дистиллированный с помощью наведения, повышает уровень успеха в RoboLab до 42,2% ± 0,36. Наши базовые и дистиллированные чекпоинты в FP8 обеспечивают ускорение от 1,52x до 3,95x по сравнению с Cosmos 3 Nano в FP8 на потребительских, рабочих и серверных GPU.
К этим результатам привели два основных изменения: во-первых, архитектура, размер которой менее половины размера Cosmos 3 Nano, что стало возможным благодаря нашему мультимодальному предварительному обучению Self-Flow, которое дает сильные представления. Во-вторых, дистилляция, которая устраняет необходимость в проходе наведения и сокращает количество шагов выборки до одного, без отделения видео от действия.
Хотя это сдвигает границу Парето политик действий по скорости и точности, все еще существуют задачи, которые все политики, включая нашу, не могут решить самостоятельно. GPT 6 Astra, с другой стороны, может решить все задачи в бенчмарке Su et al. (2026) при использовании максимальных усилий рассуждения. Но один вызов рассуждения добавляет около 35,77 секунд на секунду движения робота, и каждый успех стоит в среднем $13,47 и занимает 16 минут. Напротив, F3A сама по себе тратит 21,08 миллисекунды на секунду движения робота, и каждый успех стоит $0,09 и занимает менее двух минут в среднем при работе на GPU H200 за $3 в час. Большую часть этих двух минут F3A простаивает, ожидая, пока робот движется. В этой ситуации F3A могла бы даже обслуживать 47 других запусков одновременно без дополнительных затрат. Главное предостережение заключается в том, что она не может решить каждую отдельную задачу.
Многообещающее решение состоит в том, чтобы позволить системе рассуждения, GPT 6 Astra, делегировать управление эффективной политике, такой как F3A или Pi0.5, и вмешиваться только при необходимости. В условиях Su et al. (2026) такая гибридная политика едва улучшает ситуацию при использовании Pi0.5. Лучший гибрид стоит $12,28 за успех против $13,47 для чистого рассуждения и занимает 13,5 минут вместо 14.
Однако с F3A в качестве политики эта стратегия делегирования окупается. Гибридная политика по-прежнему решает 90% всех эпизодов, включая сложные задачи, которые ни одна чистая политика действий не может решить самостоятельно, и снижает затраты до $8,77 и 8 минут на успех, что делает ее на 29% дешевле и на 40% быстрее, чем лучшая альтернативная конфигурация. Чистое рассуждение с максимальными усилиями по-прежнему достигает наивысшей точности, поэтому компромисс между надежностью и стоимостью сохраняется, но улучшенные политики, такие как F3A, меняют положение этого компромисса.
Чем лучше быстрая политика, тем меньше системе приходится рассуждать. Эти исследования — лишь первый взгляд на более глубокую интеграцию систем рассуждения и быстрого прогнозирования действий, и мы ожидаем, что есть много возможностей для улучшения в направлении использования такого количества рассуждений, которое необходимо, и как можно меньшего их количества. Далее мы описываем разработку FLUX 3 Action и наши выводы, сделанные в процессе работы.
От прогнозирования видео к прогнозированию действий
Идея использования прогнозных моделей будущих наблюдений для принятия решений имеет долгую историю, включая ранние демонстрации управления роботами, которые объединяли прогнозирование видео с обусловленными действиями и управление с прогнозирующими моделями. UniPi, напротив, генерирует видео выполнения задачи с помощью генератора видео, обусловленного текстом, и восстанавливает исполняемые действия из сгенерированных кадров с помощью модели обратной динамики (IDM). Ключевой аргумент UniPi заключался в том, что предварительное обучение видеомодели на крупномасштабных нероботизированных данных переносится на политику робота и улучшает обобщение на ранее не встречавшиеся задачи.
В последующих работах сохранилось использование крупномасштабного предварительного обучения на видео, но прогнозирование видео и действий было связано более тесно, чем в двухэтапном конвейере, состоящем из генерации видео с последующим использованием IDM. Совместное прогнозирование будущих кадров и действий в рамках единой генеративной модели было исследовано в GR-1, GR-2, WorldVLA, Cosmos Policy и LingBot-VA4; в DreamZero был введен термин «World Action Model» (WAM) для этого подхода, который впоследствии переняли такие системы, как GigaWorld-Policy и варианты политики Cosmos 3. В свою очередь, mimic-video сохраняет модель обратной динамики, но обусловливает ее латентными признаками видеомодели, а не декодированными кадрами, что позволяет избежать полной генерации видео при выводе и дает то, что авторы называют «Video-Action Model» (VAM). Еще одно направление рассматривает прогнозирование видео как вспомогательную задачу совместного обучения и полностью пропускает генерацию видео при выводе.
Ранее мы исследовали производительность FLUX 3 в качестве VAM с отдельным декодером действий в нашем исследовании дизайна FLUX-mimic. См. также продолжение исследования mimic по эффективности данных для flux-mimic. Здесь мы изучаем производительность FLUX 3 в качестве WAM с совместным прогнозированием видео и действий, как показано на Рисунке 3.
Попробуйте цикл управления
Получив инструкцию, например «положи красный кубик в левый контейнер», модель использует изображения с камеры и положения суставов для совместного прогнозирования команд двигателя и их визуальных результатов. Робот выполняет заданное количество этих действий, затем снова «смотрит» и планирует дальнейшие шаги на основе свежих наблюдений.
Начните миссию, уроните кубик и посмотрите, как манипулятор восстановится. Измените частоту повторного осмотра, чтобы увидеть, как это влияет на реакцию.
Результаты
Предварительное обучение и промежуточное обучение
Предварительное обучение следовало модели FLUX 3 и использовало смесь данных изображений, видео и аудио, причем на видео приходилось более 95% обучающих токенов. Чтобы оценить возможности прогнозирования действий контрольных точек предварительного обучения, мы следуем протоколу, аналогичному Cosmos 3: мы добавляем случайно инициализированные «головы» действий, а затем проводим дообучение (finetuning) на DROID. Полученная контрольная точка оценивается на RoboLab.
Для результатов на Рисунке 4 мы использовали предварительные настройки с небольшим размером пакета и скоростью обучения. Таким образом, они не отражают максимальную производительность, достижимую контрольной точкой. Но поскольку во всех запусках использовались сопоставимые настройки, это все равно позволяет нам сравнивать их относительные возможности для прогнозирования действий.
Обратите внимание, что без предварительного обучения производительность остается ниже 1%. С предварительным обучением этот показатель подскакивает до 11,6% и продолжает медленно, но неуклонно расти до 12,4%. Низкая производительность контрольной точки без предварительного обучения указывает на то, что чистое обучение действиям на DROID сильно ограничено данными, и показывает, что мультимодальное предварительное обучение с большим объемом видео действительно может преодолеть это ограничение.
Далее мы рассматриваем фазу промежуточного обучения, ориентированную на действия, где мы продолжаем обучение на смеси наших данных предварительного обучения вместе с недавно введенными данными о действиях. Мы распределяем 36,95% обучающих выборок на видео с аудио из наших данных предварительного обучения, а остальные 63,05% — на видеоданные, сопровождаемые согласованными действиями. Из всех обучающих выборок 19,55% поступают из записей игр, 13,54% — из эгоцентрических видео с аннотациями позы рук, 14,03% — с ручных захватов и 15,93% — из телеуправления с использованием 14 воплощений. Соответствующие коэффициенты токенов немного различаются из-за разного разрешения и длительности; см. Таблицу 2.
Игровые действия представлены 64 измерениями. Первые два кодируют движение мыши по осям x и y, следующие два — левую и правую кнопки мыши, а остальные 60 — кнопки клавиатуры. Бинарные каналы кнопок деквантуются во время обучения.
Большинство наборов данных эгоцентрических, ручных и телеуправляемых действий на основе поз используют 50-мерное пространство действий, EE50. Первые 25 измерений используются для левого или первичного эффектора, а последние 25 — для правого или вторичного эффектора. В пределах этих 25 измерений первые три кодируют трансляцию, а следующие шесть — вращение, как в работе Zhou et al. 2019, но с использованием первых двух строк вместо первых двух столбцов матрицы вращения. Оставшиеся 16 измерений кодируют либо углы позы руки, либо состояние захвата, где 0 представляет закрытые захваты, а 1 — открытые. Измерения, которые не используются для воплощения, дополняются нулями.
Обратите внимание, что некоторые наборы данных роботов полагаются на отдельное 14-мерное пространство действий, разделенное на 7 измерений для левой/первичной и 7 измерений для правой/вторичной рук. Здесь мы обучаемся непосредственно на 6 состояниях суставов и одном состоянии захвата, так как у нас нет моделей прямой динамики воплощения. Во всех наборах данных действий частота действий варьируется от 5 Гц до 30 Гц.
Для пространства действий EE50 поза конечного эффектора представлена относительно опорного кадра, который является последним кадром обусловливания. Мы выбираем состояние действия, наиболее близкое к этому опорному кадру, в качестве опорного состояния и представляем все остальные позы конечного эффектора относительно этого состояния. Артикуляция руки и значения захвата остаются абсолютными. Наконец, мы нормализуем каждое измерение EE50, используя специфичные для воплощения z-оценки, как в работе Punamiya et al. 2025, индексированные по знаковому смещению положения от опорного состояния.
С «головой» действий EE50 мы теперь можем также оценивать производительность RoboLab для контрольных точек промежуточного обучения напрямую без дополнительного дообучения. Результаты этих оценок показаны штриховыми линиями на Рисунке 4. Первоначально мы наблюдаем, что производительность EE50 быстро увеличивается с 0% через 7,2% до 14,7% со скромным приростом для результатов, полученных при совместном дообучении, которое улучшается всего на 2,3% по сравнению с производительностью на последней контрольной точке предварительного обучения. К более поздним этапам мы видим постоянные улучшения как для EE50, достигая 17,3%, так и для производительности совместного дообучения, достигая 18,6%. Мы еще не видели насыщения производительности в ходе промежуточного обучения.
Переход от шума к сигналу для видео и действий
Диффузионные и потоковые модели учатся обращать индексированный по времени прямой процесс zt = (1−t)x₀ + tε, который смешивает данные x₀ с шумом ε ∼ N(0,1). В зависимости от масштаба и структуры данных область t, где этот прямой процесс переходит от шума к сигналу, может быть разной. Во время обучения t выбирается из распределения временных шагов, и его выбор может существенно повлиять на производительность моделей.
При совместном прогнозировании двух модальностей, таких как видео и действия, мы также должны учитывать взаимодействие между ними. Чтобы получить представление об областях перехода от сигнала к шуму для двух модальностей, мы вычисляем потерю реконструкции x₀ отдельно для обеих. Мы делаем это для нескольких контрольных точек, обученных с различными распределениями временных шагов, а затем берем поточечный минимум по контрольным точкам, чтобы получить минимальную огибающую потери x₀ в качестве аппроксимации профиля сигнал-шум для видео и действий. Мы строим эти огибающие, нормализованные к максимальной потере 1, на Рисунке 5.
Мы наблюдаем S-образный профиль с переходом около σ(t) = 3.3 или t ≃ 0.964. Предполагая, что емкость модели лучше всего расходуется в областях с высоким переходом сигнала, разумным подходом будет использование распределения временных шагов, функция плотности вероятности (pdf) которого пропорциональна производной S-образного профиля. В зависимости от функции, используемой для аппроксимации S-образной кривой, мы получаем различные распределения временных шагов. При использовании сигмоидальной функции для аппроксимации, как показано на Рисунке 5, мы получаем логистическое распределение в логит-пространстве, т.е. логит-логистические распределения, показанные на Рисунке 6. Аналогично, при использовании функции распределения (CDF) Гаусса мы получаем гауссовское распределение в логит-пространстве или логит-нормальное распределение.
Мы используем эти оценки в качестве ориентиров для выбора распределений временных шагов при поиске по сетке. Помимо логит-нормальных и логит-логистических распределений, мы также включаем распределение временных шагов «mode-sampler» или «Waver», так как это выбор, сделанный в NVIDIA et al. 2026. Мы формулируем параметр местоположения для всех трех кандидатных распределений через центрированное на нуле базовое распределение с последующим применением функции сдвига t ↦ αt / (1 + (α−1)t) с параметром α. Для логит-нормальных и логит-логистических распределений это приводит к сдвигу их моды к logit(t) = log α. Мы выбираем α ∈ {24, 33, 42}, что соответствует модам оценок видео и действий на Рисунке 6, а также одному значению между ними. Мы используем единичную дисперсию для логит-нормального распределения и рассматриваем логит-логистические распределения с масштабом 0.5 и 0.75. Для распределения Waver мы следуем NVIDIA et al. 2026 и используем сдвиг α = 5, а также перебираем одно более высокое (10) и одно более низкое (2.5) значение.
Помимо самого распределения временных шагов, мы рассматриваем один дополнительный параметр: масштаб представления действия (не путать с масштабом распределения временных шагов). Умножая действия на s, но не видео, мы сдвигаем относительный переход сигнал-шум на Рисунке 5 между ними. Когда s > 1, требуется больше шума для разрушения сигнала, и кривая действия сдвигается вправо. Это позволяет нам контролировать, как различные модальности моделируются по отношению друг к другу. Рассмотрим две модальности m₁, m₂. Предполагая, что их профили сигнал-шум примерно совпадают, модель для m₁, s·m₂ с s ≫ 1 эффективно аппроксимировала бы факторизацию вида p(m₁, s·m₂) = p(m₁ | s·m₂) p(s·m₂) в рамках модели совместного сопоставления потоков (joint flow matching), потому что во время перехода s·m₂ от шума к сигналу m₁ все еще будет преимущественно шумом, но когда мы дойдем до точки перехода для m₁, s·m₂ уже будет преимущественно сигналом. Аналогично, s ≪ 1 позволило бы аппроксимировать p(m₁, s·m₂) = p(s·m₂ | m₁) p(m₁). Чтобы изучить этот эффект, мы рассматриваем масштабные коэффициенты s ∈ {1, 2} для модальности действия. Чтобы контролировать влияние на взвешивание функции потерь, мы перевзвешиваем потери для модальности действия на 1/s².
Мы обучаем различные варианты и представляем результаты по нескольким случайным начальным значениям (seeds) на простом наборе задач RoboLab на Рисунке 7. В целом, нам не удалось выявить четкую тенденцию в этих результатах, но мы последовательно наблюдаем высокую производительность для логит-логистических распределений с масштабированием действия s = 2 и высокими сдвигами α = 42. Среди двух масштабов логит-логистического распределения более широкий, с масштабом 0.75, показывает лучшие результаты, и мы продолжаем использовать эту настройку.
Рецепт DROID
При дообучении (finetuning) на DROID мы добавляем случайно инициализированные головы действий к нашему чекпоинту середины обучения. Таким образом, дообучение начнется с очень зашумленного градиентного сигнала, что может негативно повлиять на модель. Чтобы гарантировать, что веса середины обучения не деградируют во время этой начальной фазы адаптации, мы оставляем веса середины обучения замороженными на первые 1 тыс. шагов, а затем линейно увеличиваем их скорость обучения (learning rate) от 0 до 2e-4 в течение 2 тыс. шагов. Скорость обучения для самих голов действий линейно возрастает от 0 до 1e-3 в течение первых 1 тыс. шагов. Мы сравниваем эту стратегию с запуском, где мы дообучаем DROID с позами конечного эффектора, адаптированными к нашему пространству действий EE50 (см. «Предварительное обучение и обучение в середине»). Для этого варианта головы действий уже инициализированы из середины обучения, и мы используем простое увеличение скорости обучения от 0 до 2e-4 в течение первых 1 тыс. шагов для всех параметров. Мы обучаем обе конфигурации с двумя размерами батча, 512 и 2048, в течение 20 тыс. шагов.
Для конфигурации с малым размером батча производительность EE50 остается выше производительности совместного дообучения (Joint finetuning). Производительность хорошо масштабируется с размером батча, при этом наблюдаются лишь небольшие затраты при сравнении при сопоставимых FLOP: производительность запусков EE50 и Joint с размером батча в 4 раза больше на шаге 5 тыс. снижается всего на 2.25 п.п. и 4.25 п.п. соответственно по сравнению с запуском с меньшим размером батча после 20 тыс. шагов. Однако после 10 тыс. шагов с большим размером батча совместное дообучение превосходит дообучение EE50 с итоговой производительностью 40.13% против 37.88%. Мы продолжаем использовать запуск совместного дообучения, но отмечаем, что дообучение EE50 может быть привлекательным вариантом для дообучения с очень малым количеством данных или шагов обучения — особенно учитывая, что распределение временных шагов было выбрано исходя из его производительности для совместного дообучения.
Чтобы понять, достигнута ли насыщенность производительности, мы использовали следующий протокол для выбора лучшего чекпоинта: мы продолжаем обучение совместного запуска в общей сложности до 30 тыс. шагов и используем линейное снижение скорости обучения на последних 5 тыс. шагов. Затем мы оцениваем каждые 1 тыс. шагов во время снижения и выбираем чекпоинт с наилучшей производительностью.
Хотя функция потерь при обучении показывает постоянные улучшения, особенно во время фазы снижения скорости обучения, мы не наблюдаем дополнительных улучшений после 20 тыс. шагов дообучения. Лучший результат из фазы снижения достигает 40% на 26 тыс. шагов.
При более высоких значениях скорости обучения, в районе базовой скорости 2e-4 и выше, мы наблюдали спорадические скачки функции потерь. Как показано на Рисунке 10, обучение, затронутое скачком функции потерь, имеет более низкие показатели успеха в RoboLab по сравнению с возобновлением обучения из предыдущего чистого чекпоинта. Несмотря на то, что показатели успеха в конечном итоге восстанавливались, мы наблюдали случаи, когда запускам требовалось гораздо больше времени для восстановления, что приводило к посредственной производительности в рамках горизонта обучения. Поэтому мы всегда откатывались назад после наблюдения скачков функции потерь, чтобы поддерживать сопоставимые чекпоинты и избегать негативного влияния на итоговую производительность.
Раздельное руководство (Split Guidance) для видео и действий
Учитывая, что вывод фрагмента действия предсказывает как будущее видео, так и будущие действия, мы можем независимо применять руководство без классификатора (classifier-free guidance) к каждой модальности. Мы анализируем поведение CFG, запуская поиск по сетке гиперпараметров {Video CFG, Action CFG} и оценивая показатели успеха на полном наборе из 120 задач.
Мы наблюдаем градиентную тенденцию, которая отдает предпочтение более высокому значению Video CFG и более низкому значению Action CFG, при этом Video CFG = 4.0 и Action CFG = 1.0 показывают наилучший результат с оценкой 42.00%. Мы выбираем эту настройку в качестве предпочтительной для производственной среды.
Анализ EMA
Мы установили, что EMA имеет решающее значение как для производительности, так и для надежного сравнения результатов абляционных исследований. Поэтому мы решили отслеживать как традиционное EMA, так и Power EMA1 (σrel = 0.05 и 0.10).
Для традиционного EMA шаг обновления выглядит следующим образом:
θˆβ(t)=βθˆβ(t−1)+(1−β)θ(t),θˆβ(0)=θ(0),
(1)
где θ(t) — исходные параметры на шаге обучения t.
В наших экспериментах мы выбрали β = 0.9990. Поскольку мы сохраняем контрольные точки каждые K = 1000 шагов, мы также оценили «офлайн» варианты EMA для других значений β. Среднее значение берется по конечному окну сохраненных снимков и нормализуется по весу, фактически накопленному внутри него,
α=βK,θˆβoff(N)=∑n=1N(1−α)αN−nθ(nK)1−αN,
(2)
где n индексирует N сохраненных контрольных точек. Возведение β в степень K позволяет рекурсии для каждой контрольной точки соответствовать профилю шага из уравнения 1, за исключением потери детализации внутри интервала, а знаменатель устраняет смещение запуска конечного окна.
Для Power EMA шаг обновления выглядит так:
θˆγ(t)=∫0tτγθ(τ)dτ∫0tτγdτ=γ+1tγ+1∫0tτγθ(τ)dτ,
(3)
который вычисляется инкрементально как
θˆγ(t)=βγ(t)θˆγ(t−1)+(1−βγ(t))θ(t),βγ(t)=(1−1t)γ+1.
(4)
где t — порядковый номер обновления. Следуя Karras et al. (2024), мы параметризуем профиль через его относительную ширину σrel = (γ+1)1/2(γ+2)−1(γ+3)−1/2.
Во время обучения мы отслеживаем два варианта: один с σrel = 0.05, а другой с σrel = 0.10 (что эквивалентно γ = 16.9722 и γ = 6.9372). С помощью этих двух профилей мы можем выполнить более точную апостериорную реконструкцию для новых значений σrel,
𝐱˜=arg min𝐱∫0tN(∑i,nxi,npγi,tn(τ)−pγ⋆,tN(τ))2dτ,
(5)
𝐱=𝐱˜𝟏𝖳𝐱˜,
(6)
θˆγ⋆≈∑i,nxi,nθˆγi(tn),
(7)
где pγ,t(τ) обозначает профиль взвешивания, который уравнение 3 присваивает θ(τ) при усреднении до момента времени t. Базис состоит из обоих отслеживаемых профилей для каждой сохраненной контрольной точки, т.е. 2N сохраненных снимков {θ̂γᵢ(tn)}. Аппроксимация не ограничена, поэтому коэффициенты могут быть отрицательными, а x̃ нормализуется так, чтобы их сумма была равна единице, что делает реконструкцию аффинной комбинацией снимков.
Результаты для различных настроек EMA обобщены на рисунке 12. Традиционное онлайн-EMA и обе модели Power EMA значительно превосходят исходную модель, что демонстрирует важность EMA. Мы также наблюдаем, что Power EMA немного превосходит традиционное EMA.
Для апостериорного Power EMA и офлайн-кандидатов EMA мы наблюдаем колоколообразную тенденцию: показатели успеха достигают пика при σrel = 0.150 и β = 0.9997 соответственно. Однако в обоих случаях онлайн-усреднение, при котором обновления происходят на каждом шаге, оказывается сильнее, чем апостериорная аппроксимация.
Рассматривая общую картину, мы видим, что онлайн-Power EMA с σrel = 0.10 стабильно показывает лучшие результаты, и мы выбираем его в качестве рекомендуемой настройки EMA для рецепта DROID.
Эффективность вывода
WAM показали многообещающие результаты в плане эффективности данных и производительности. Однако прогнозирование не только действий, но и видео делает их относительно медленными из-за большей длины последовательностей по сравнению с VLA. Это ограничивает их применение в ситуациях, критичных к задержкам, или при работе в условиях аппаратных ограничений, таких как локальное развертывание. Предыдущие подходы в основном опирались на системную оптимизацию или разделение действий и видео с помощью отдельных декодеров или маскирования внимания. Здесь мы рассматриваем ортогональное направление и исследуем, насколько близко мы можем подойти к эффективности VLA с помощью дистилляции, сохраняя при этом совместное прогнозирование действий и видео.
GPU
Оценка на реальных роботах
Гибридные политики
Перспективы
Список литературы
- Cen, Jun, Chaohui Yu, Hangjie Yuan, et al. 2025. WorldVLA: Towards Autoregressive Action World Model. arxiv.org/abs/2506.21539
