Веса модели (Apache 2.0): RekaAI/Reka-Inverse-Dynamics-Model on Hugging Face
Интерактивные модели мира отличаются от обычных. Они визуально более реалистичны и способны моделировать более сложные явления, такие как складывание материалов или скручивание полотенец. Внедряя цифровые копии в эти динамические среды, роботы могут выполнять команды посредством прямого взаимодействия.
Однако здесь есть сложность. Истинная интерактивность требует, чтобы модель мира точно реагировала на низкоуровневые команды (например, движение влево или вправо). Чтобы решить эту задачу, мы представляем Reka Inverse Dynamics Model (RIDM), которая извлекает низкоуровневые команды непосредственно из видеоданных реального мира, чтобы использовать их в качестве «подписей», описывающих физические изменения в последовательных кадрах.
RIDM — это компактная и эффективная модель, которая обрабатывает короткие клипы и извлекает низкоуровневые команды управления, такие как движение вперед, вбок, поворот или наклон. Несмотря на то, что модель полностью обучена на видеоиграх, благодаря отделению визуальных эффектов от движения, её прогнозы переносятся на видео из реального мира.
Прогнозируемая вероятность клавиши
- Wвперед0.85
- Aдвижение влево0.34
- Sназад0.01
- Dдвижение вправо0.76
- Shiftходьба0.01
поворот (рыскание)16.9° влево
наклон (тангаж)1.4° вверх
Первое окно клипа
Данные
Мы записали игровой процесс в разрешении 1280 × 720 при 48 кадрах в секунду с 11 ключевыми командами, соответствующими действительности, движением мыши и точными углами камеры для каждого кадра. Аннотации предоставлены движком.
Модель
Наша модель отделяет визуальные эффекты от движения, проецируя входные данные в пространство оптического потока. Поскольку наша цель — использовать RIDM для автоматического аннотирования реальных видеозаписей, а не 3D-геймплея, метод должен переноситься с игр на реальный мир. Мы также сравниваем этот подход с прямым, работающим в пиксельном пространстве. Чтобы различать их, мы используем названия: модель на основе потока (flow-based) и модель на основе пикселей (pixel-based).
Обучение обеих моделей на случайных игровых записях также не сработает. Успешный подход требует фильтрации и передискретизации данных. Например, некоторые действия, такие как движение назад или стрейф вбок, встречаются гораздо реже, чем простое движение вперед. Соответствующая передискретизация помогает в изучении этих менее распространенных движений.
Обе модели компактны. Модель на основе потока имеет 2,8 млн (2 785 499) параметров; из них только 1,8 млн (1 795 337) обучаемых параметров и около 990 тыс. замороженных, что составляет RAFT-small. Модель на основе пикселей полностью обучаема и имеет около 9,8 млн (9 836 063) параметров.
Нажмите для просмотра · W A S D · Shift · стрелки
Пиксели · что видит камера
Оптический поток · что видит модель потока направление
Для этой интерактивной фигуры требуется WebGL, который отключен в этом браузере.
Метка · что записывает игра
WASDShift
Поворот0°/сНаклон0°/с
Движение вперед
Оценка
Мы протестировали обобщающую способность обоих подходов на видео, которые ни один из методов не видел во время обучения. Как и ожидалось, модель на основе потока работает лучше, при этом наибольший прирост достигается при переносе с игровых записей на видеоклипы из реального мира.
При оценке мы использовали три набора данных:
- Видео реального мира с метками углов камеры,
Видео реального мира с метками углов камеры,
- Реальные записи с GoPro,
Реальные записи с GoPro,
- Синтетические 3D-игровые записи.
Синтетические 3D-игровые записи.
Обратите внимание, что наборы данных реального мира содержат только действия «вперед» и «поворот».
Каждый набор данных предполагает два вопроса; всего шесть различных конфигураций. Камера двигалась вперед или поворачивала? Если она поворачивала, то в какую сторону?
- Модель на основе потока работает лучше в пяти из шести конфигураций,
Модель на основе потока работает лучше в пяти из шести конфигураций,
- На видео из реального мира разрыв наиболее велик. Модель на основе потока получает 86 %, в то время как модель на основе пикселей — только 31 %,
На видео из реального мира разрыв наиболее велик. Модель на основе потока получает 86 %, в то время как модель на основе пикселей — только 31 %,
- Пиксельная модель лучше предсказывает только направление поворота GoPro, и лишь на один клип.
Пиксельная модель лучше предсказывает только направление поворота GoPro, и лишь на один клип.
Таблица 1 — Сравнение двух моделей по шести различным конфигурациям оценки. Поскольку метки, полученные от датчиков, неточны в реальных наборах данных — «Реальное видео» и «GoPro» — мы вручную проверяли прогнозы для расчета точности. Для игровых записей мы используем доступные аннотации.
Данные оценки
Задача
Модель потока
Пиксельная модель
Реальное видео, 78 клипов
Вперед, поворот влево или вправо
85.9 %
30.8 %
Реальное видео, 47 клипов с поворотом
Поворот влево или вправо
91.5 %
51.1 %
GoPro, 72 клипа
Вперед, поворот влево или вправо
75.0 %
58.3 %
GoPro, 25 клипов с поворотом
Поворот влево или вправо
72.0 %
76.0 %
Игровые записи, 5216 пар потока и 5164 пиксельных пары
Вперед, поворот влево или вправо
84.5 %
77.5 %
Игровые записи, 3716 пар поворота потока и 3674 пиксельных пары
Направление поворота
84.9 %
70.9 %
Наша RIDM, конечно, иногда ошибается в некоторых ситуациях:
- сообщает о ложных поворотах на статических и темных кадрах,
сообщает о ложных поворотах на статических и темных кадрах,
- когда ей нужно разделить боковой шаг и противоположный поворот рыскания. Например, когда человек делает шаг вправо и одновременно поворачивает камеру влево,
когда ей нужно разделить боковой шаг и противоположный поворот рыскания. Например, когда человек делает шаг вправо и одновременно поворачивает камеру влево,
- сообщает о клавишах ходьбы для камеры, которая стоит на месте и приближает/удаляет изображение,
сообщает о клавишах ходьбы для камеры, которая стоит на месте и приближает/удаляет изображение,
- стабилизация камеры на записях с экшн-камер скрывает часть вращения.
стабилизация камеры на записях с экшн-камер скрывает часть вращения.
Мы считаем, что обучение на большем количестве данных, особенно на данных, содержащих эффекты камеры, такие как масштабирование или стабилизация, улучшило бы производительность модели в вышеуказанных случаях сбоев.
Визуализации
Мы показываем несколько эгоцентрических записей из реального мира вместе с прогнозами модели. Мы приводим как положительные прогнозы, так и сбои модели.
Прогнозируемая вероятность клавиши
- Wвперед0.98
- Aдвижение влево0.01
- Sназад0.00
- Dдвижение вправо0.78
- Shiftходьба0.00
поворот (рыскание)5.2° влево
наклон (тангаж)1.4° вверх
Первое окно клипа
Прогнозируемая вероятность клавиши
- Wвперед0.00
- Aдвижение влево0.03
- Sназад0.12
- Dдвижение вправо0.02
- Shiftходьба0.83
поворот (рыскание)2.8° вправо
наклон (тангаж)1.5° вниз
Первое окно клипа
Прогнозируемая вероятность клавиши
- Wвперед0.05
- Aдвижение влево0.10
- Sназад0.03
- Dдвижение вправо0.07
- Shiftходьба0.78
поворот (рыскание)3.5° влево
наклон (тангаж)1.7° вверх
Первое окно клипа
Прогнозируемая вероятность клавиши
- Wвперед0.02
- Aдвижение влево0.04
- Sназад0.01
- Dдвижение вправо0.01
- Shiftходьба0.91
поворот (рыскание)1.4° вправо
наклон (тангаж)10.7° вниз
Первое окно клипа
Прогнозируемая вероятность клавиши
- Wвперед0.98
- Aдвижение влево0.16
- Sназад0.00
- Dдвижение вправо0.12
- Shiftходьба0.00
поворот (рыскание)3.6° влево
наклон (тангаж)1.3° вверх
Первое окно клипа
Прогнозируемая вероятность клавиши
- Wвперед0.02
- Aдвижение влево0.33
- Sназад0.02
- Dдвижение вправо0.00
- Shiftходьба0.69
поворот (рыскание)5.3° вправо
наклон (тангаж)1.3° вниз
Первое окно клипа
Прогнозируемая вероятность клавиши
- Wвперед0.00
- Aдвижение влево0.01
- Sназад1.00
- Dдвижение вправо0.02
- Shiftходьба0.00
поворот (рыскание)1.1° влево
наклон (тангаж)1.1° вниз
Первое окно клипа
Прогнозируемая вероятность клавиши
- Wвперед0.42
- Aдвижение влево0.20
- Sназад0.02
- Dдвижение вправо0.23
- Shiftходьба0.43
поворот (рыскание)48.8° влево
наклон (тангаж)2.3° вниз
Первое окно клипа
Прогнозируемая вероятность клавиши
- Wвперед0.42
- Aдвижение влево0.05
- Sназад0.01
- Dдвижение вправо0.86
- Shiftходьба0.08
поворот (рыскание)19.3° вправо
наклон (тангаж) 1.5° вниз
Первое окно клипа
Прогнозируемая вероятность клавиши
- Wвперед0.09
- Aвлево0.13
- Sназад0.03
- Dвправо0.09
- Shiftходьба0.64
поворот (рыскание) 5.9° влево
наклон (тангаж) 1.5° вниз
Первое окно клипа
Прогнозируемая вероятность клавиши
- Wвперед0.01
- Aвлево0.12
- Sназад0.56
- Dвправо0.06
- Shiftходьба0.22
поворот (рыскание) 5.0° влево
наклон (тангаж) 1.5° вверх
Первое окно клипа
Прогнозируемая вероятность клавиши
- Wвперед0.06
- Aвлево0.23
- Sназад0.17
- Dвправо0.12
- Shiftходьба0.57
поворот (рыскание) 16.6° влево
наклон (тангаж) 1.7° вверх
Первое окно клипа
Дополнительно
Реальные видеоматериалы основаны на Wikimedia Commons, лицензированы CC BY 3.0.
Веса хранятся в формате safetensors и могут быть загружены по ссылке . Каждая папка также содержит config.json и inference.py.
- Модель потока: flow/model.safetensors (7 189 300 байт)
Модель потока: flow/model.safetensors (7 189 300 байт)
- Пиксельная модель: pixel/model.safetensors (39 353 324 байта)
Пиксельная модель: pixel/model.safetensors (39 353 324 байта)
Лицензия
Веса и код для вывода в этом репозитории выпущены под лицензией Apache License 2.0. Это относится только к весам модели Reka и коду. Пиксельная модель: автономна; веса сторонних моделей не требуются. Модель потока: требует оптического потока, вычисленного с помощью RAFT-small, который не включен в комплект и должен быть получен отдельно из Torchvision. Код Torchvision и RAFT распространяется по лицензии BSD-3-Clause. Предварительно обученные веса RAFT были обучены на наборах данных, которые подпадают под действие их собственных условий, что может ограничивать коммерческое использование. Вы несете ответственность за ознакомление с этими условиями и их соблюдение перед использованием модели потока в коммерческих целях. Мы не делаем никаких заявлений об их применимости. Эти модели предоставляются «как есть», без каких-либо гарантий.





