Обновление от 16 сентября 2026 г.: Оба уровня теперь полностью доступны. Объем «сырых» данных составил 10 865 часов, а обработанный и аннотированный уровень доступен впервые: 10 200 часов в 6 373 064 клипах, общим объемом 74,2 ТБ. Около 3000 часов «сырых» данных также включают данные датчиков IMU (ускорение, вращение и точная синхронизация кадров), записанные вместе с видео и помеченные в метаданных как has_imu.
Чтобы понимать и моделировать физический мир, омни-мировым моделям и моделям «зрение-язык-действие» нужно нечто большее, чем просто текст. Им нужны высококачественные визуальные данные с описанием происходящего, записанные непосредственно в хаотичных условиях, где протекает реальная жизнь.
Если искать видео о готовке, вы получите огромную библиотеку отредактированных, постановочных кадров, снятых со штатива и обрезанных так, чтобы оставить только самое интересное. То, что нужно машине для обучения физической задаче, — это полная противоположность: непрерывный вид от первого лица, где кто-то действительно выполняет действие, с той скоростью, с которой он это делает, в том беспорядке, в котором он живет. Никто не выкладывает такое, потому что никто не будет это смотреть.
Такие кадры должны быть заказаны специально. Данные, полученные путем телеуправления, точны, но их медленно производить, и они склонны наследовать аккуратность пространства, в котором были записаны. Синтетические сцены масштабируемы, но они сглаживают беспорядок реальных домов. Реальные записи от первого лица занимают промежуточное положение, и причина, по которой их не так много, заключается в том, что кто-то должен платить людям за их создание.
Представляем RekaDaily-10k
Чтобы удовлетворить наши собственные требования к масштабу и качеству, а также потребности более широкого промышленного сообщества, мы создали Claru, базовый движок данных Reka, который получает эгоцентрическое видео через глобальную сеть платных сборщиков.
Сегодня мы выпускаем RekaDaily-10k: нескриптованные записи повседневной домашней жизни от первого лица, сделанные в разных домах платными сборщиками, которые записывали свои собственные рутинные дела, причем значительная часть записей выполнена в 4K. Мы передаем этот набор данных исследовательскому сообществу в рамках нашей инициативы по открытой экосистеме под лицензией Apache 2.0. Как «сырые», так и обработанные с описаниями уровни теперь полностью доступны на Hugging Face: «сырой» уровень — 10 865 часов, а обработанный и аннотированный — 10 200 часов.
Набор данных поставляется в двух уровнях:
- «Сырой» уровень. Нефильтрованные, необработанные кадры, позволяющие командам внедрять свои собственные рабочие процессы обрезки, фильтрации и аннотирования. Он содержит 10 865 часов. Примерно 3000 часов «сырых» данных поставляются вместе с данными IMU: ускорение, вращение и точная синхронизация кадров, сэмплированные до 200 раз в секунду и синхронизированные с видеорядом. Клипы с этими данными помечены в метаданных «сырого» уровня как has_imu; остальные ~7800 часов — это только видео.
«Сырой» уровень. Нефильтрованные, необработанные кадры, позволяющие командам внедрять свои собственные рабочие процессы обрезки, фильтрации и аннотирования. Он содержит 10 865 часов. Примерно 3000 часов «сырых» данных поставляются вместе с данными IMU: ускорение, вращение и точная синхронизация кадров, сэмплированные до 200 раз в секунду и синхронизированные с видеорядом. Клипы с этими данными помечены в метаданных «сырого» уровня как has_imu; остальные ~7800 часов — это только видео.
- Обработанный и аннотированный уровень. Кадры, прошедшие через наш конвейер обработки, нарезанные на короткие клипы и снабженные описаниями, для команд, которым нужно языковое сопровождение «из коробки».
Обработанный и аннотированный уровень. Кадры, прошедшие через наш конвейер обработки, нарезанные на короткие клипы и снабженные описаниями, для команд, которым нужно языковое сопровождение «из коробки».
Лицензия Apache 2.0 распространяется на коммерческое использование и распространение. Каждый клип поставляется как видео с текстовым описанием.
Эгоцентрический ландшафт
Эгоцентрическая экосистема быстро растет, и этот релиз призван дополнить ее новыми видео, демонстрирующими эгоцентрическую деятельность. Ego4D установил модальность и остается эталонным корпусом для повседневной жизни. Egocentric-10K и последующие более крупные релизы показали, насколько масштабируемы данные от первого лица, и они охватывают промышленную работу в реальных производственных условиях. EPIC-KITCHENS по-прежнему является золотым стандартом эгоцентрических бенчмарков человеческой деятельности.
Что добавляет RekaDaily-10k: нескриптованная домашняя активность, записанная в реальных домах с подробными описаниями. Примерно 1670 часов записаны в нативном 4K, что является более высоким разрешением, чем у большинства крупных эгоцентрических корпусов. В совокупности это делает его идеальным дополнением для команд, создающих домашний ИИ, где важно языковое сопровождение.
Откуда берутся кадры
— это платная сеть сбора данных, состоящая из более чем 100 000 человек, записывающих физический мир. Сборщики присоединяются к проекту, проходят квалификационную оценку, затем записывают, отправляют и получают оплату за каждый принятый час. Работа охватывает домашнюю жизнь, коммерческие среды и квалифицированные профессии в нескольких регионах. Этот релиз основан на домашней части этой сети, записанной подмножеством этих сборщиков на телефоны, закрепленные на голове.
Разнообразие сред
Поскольку каждый сборщик записывает в своем собственном доме, количество различных сред растет вместе с количеством людей, которые вносят свой вклад, а не с количеством записанных часов. Разные кухни, модели бытовой техники, планировки шкафов, планы этажей, условия освещения и степени беспорядка. Разные розетки и выключатели, разная упаковка на полках, разные языки на вывесках, разная погода за окном. Такого рода вариативность трудно получить каким-либо другим способом.
Аутентичность и отсутствие сценария
Кадры не имеют сценария, они фиксируют грязь и шум реального мира, что делает набор данных ценным. Сборщики записывают реальную деятельность, а не выполняют список задач, поэтому сессии длятся долго, руки выходят из кадра, задачи откладываются и возобновляются позже, люди входят и прерывают процесс. Примерно так выглядит среда развертывания, и это та часть, которую трудно организовать намеренно.
Повседневная домашняя рутина
То, что записывали люди, — это в основном домашняя работа и рутина вокруг нее. Стирка от кучи до сложенной стопки. Уборка кухни, посуда, разгрузка продуктов, протирание поверхностей. Перестановка комнат, шкафов и ящиков. Подметание, вынос мусора, полив растений, уборка стола, распаковка чего-то нового, замена лампочки или батарейки. Короткие кропотливые задачи для двух рук здесь именно потому, что никто не стал бы заказывать для них сессию телеуправления, а они все еще есть в списке дел каждого человека.
Согласие и конфиденциальность
Согласие платного сборщика
Это кадры, записанные внутри домов людей, и их открытая публикация повышает ставки в отношении того, как они были получены. Сборщики — это платные подрядчики, которые дают свое согласие, и каждая сессия записывается с ведома и согласия того, кто носит камеру.
Посторонние
Тот, кто носит камеру, — не единственный человек, которого видит домашняя камера, поэтому с посторонними лицами работают отдельно. Сборщикам дано указание записывать только с согласия других присутствующих взрослых и не допускать попадания других людей в кадр, когда это невозможно, а кадры, на которых видны идентифицируемые лица, не участвующие в процессе, помечаются для проверки перед публикацией.
Проверка PII (персональных данных)
Лично идентифицируемую информацию нельзя свести к вопросу «да» или «нет». Запись реальной обстановки в таком объеме неизбежно приведет к тому, что ЛИИ попадет в объектив; важно уметь ее идентифицировать и решать, что с ней делать.
От загрузки материалов до видео с субтитрами
Сырой уровень данных состоит из 10 865 часов неотредактированных записей с телефонов. Обработанный уровень включает контроль качества, нарезку видео на более короткие клипы, удаление дубликатов и создание субтитров. Все это выполняется в больших масштабах.
Контроль качества проводится в первую очередь для каждой загрузки. Он был внедрен в процессе сбора данных, поэтому охватывает большую часть, но не весь набор данных, который мы выпускаем сейчас; все последующие материалы проходят через него. Проверки охватывают часто возникающие проблемы: руки не видны, освещение слишком плохое, чтобы что-то разобрать, застывшие или дублированные кадры, неправильная ориентация, однотонные вставки, слишком короткие для использования клипы, видео, не соответствующие заявленной активности. На втором этапе проверяется содержание, чтобы убедиться, что оно соответствует описанию: выявляются видео не от первого лица, постановочные или записанные с экрана ролики, а также искусственное затягивание времени, когда кто-то намеренно медлит, чтобы увеличить почасовую оплату. Каждое видео также получает перцептивный отпечаток, поскольку при таких объемах проблема почти полных дубликатов перестает быть гипотетической.
Пороговые значения качества были определены на основе данных, а не интуиции. Мы взяли большую выборку исторических загрузок, которые уже получили финальную оценку человека, и прогнали их через конвейер, чтобы сравнить автоматические пометки с решениями рецензентов. Там, где они расходились, мы сдвигали пороги в сторону рецензентов, а не в сторону цифр, которые выглядят строгими на бумаге. Один принцип заложен в код: ложный отказ — худший результат, поэтому сомнительные видео отправляются на проверку, а не в корзину, аномальные оценки вызывают предупреждение, а не отказ, и ни одна автоматическая проверка не может отклонить загрузку, не достигнув минимального порога уверенности.
Создание субтитров — это этап, на котором длительность записей становится главной проблемой. Субтитр должен отражать место действия в контексте всей сессии, а не то, что случайно попало в один выбранный кадр. Это важно, когда кто-то загружает стиральную машину, уходит, а через двадцать минут возвращается, чтобы ее разгрузить.
Субтитр должен описывать место действия в сессии, а не то, что попало в один выбранный кадр
ОДНА НЕПОСТАНОВОЧНАЯ СЕССИЯ · 42 МИН
загружает стиральную машину
в другой части дома
разгружает стиральную машину
складывает вещи
один выбранный кадр
0:00
42:00
ИЗ ВЫБРАННОГО КАДРА
«Человек идет по кухне».
Верно для этого момента, но бесполезно для контроля — ничто не говорит о том, что идет цикл стирки.
ИЗ ВСЕЙ СЕССИИ
«Загружает стиральную машину, уходит на двадцать минут, возвращается, чтобы разгрузить ее, и складывает белье».
Действие помещено в контекст сессии, с сохранением порядка и пауз.
Более подробную информацию о том, как подобные материалы подготавливаются для обучения мировых моделей, наша команда платформы данных описала в разделе World Model Data Pipeline.
Что можно обучать на этих данных
Две вещи, которые могут сделать этот корпус полезным.
Первое — это язык, привязанный к реальной деятельности. Субтитр к стоковому клипу описывает сцену. Субтитр к непрерывной сессии описывает, что человек делал и в каком порядке, включая паузы, ошибки и исправления. Это именно те инструкции, на которых обучаются модели, управляемые инструкциями, и самое интересное здесь не сами субтитры, а наличие десяти тысяч часов непостановочных записей от первого лица, которые стоит описывать.
Второе — это охват обычных домашних условий. Если вы обучаете домашнего робота, мировую модель или модель генерации видео, которая должна учитывать поведение объектов при взаимодействии с ними, расстояние между вашими обучающими данными и реальной кухней имеет значение. Это тысячи реальных кухонь в то время суток, когда люди действительно в них находятся.
Сырой уровень данных намеренно лишен предвзятости, и он существует потому, что наш выбор методов обработки не должен навязываться вам. Мы обрезаем, фильтруем и добавляем субтитры для нужд наших проектов, но любая команда со своим конвейером захочет использовать другие границы, другие пороги и свою схему аннотирования. Выпуск записей в исходном виде означает, что вы можете начать работу до принятия всех тех решений, которые приняли мы.
Поля набора данных
Каждый клип в обработанном и размеченном уровне поставляется со следующими полями.
Поле
Описание
clip_id
Уникальный идентификатор для этого конкретного клипа. Он объединяет ID исходного видео с суффиксом, указывающим, какой это сегмент, сцена и номер клипа внутри видео.
video_id
Уникальный ID исходного полноразмерного видео, из которого был вырезан клип. Несколько клипов могут иметь один и тот же video_id, если они были взяты из одной записи.
subset
Название коллекции, к которой относится клип в рамках набора данных, например «daily_activities».
width
Ширина видеокадра в пикселях.
height
Высота видеокадра в пикселях.
num_frames
Общее количество кадров в клипе.
fps
Частота кадров клипа в кадрах в секунду.
duration_s
Длительность клипа в секундах.
motion_class
Уровень движения в клипе. Одно из четырех значений: «minimal» (минимальный), «low» (низкий), «medium» (средний) или «high» (высокий).
quality_tier
Оценка от 1 до 20, основанная на техническом качестве видео (размытие, шум, артефакты сжатия), где 20 — наивысшее качество, а 1 — наинизшее.
text
Письменное описание происходящего в клипе, сгенерированное автоматически на основе видеоконтента.
text_quotes
Любой текст, видимый на экране в клипе, например вывески, этикетки или подписи, извлеченный автоматически с помощью распознавания текста. Если значимого текста на экране нет, поле остается пустым.
has_significant_text
Содержит ли клип значимый текст на экране. True означает, что text_quotes содержит данные; false означает, что поле пустое.
chats
Примеры диалогов «вопрос-ответ» о клипе, сгенерированные автоматически на основе видеоконтента, например, кто-то спрашивает, что происходит, и получает описание.
activities
Одно или несколько повседневных действий, показанных в клипе, например «уход за питомцем» или «стирка». Эти метки предоставлены человеком, который записывал видео.
activity_timeline
Распределение действий по всему исходному видео, каждое с указанием времени начала и окончания в секундах. Это время относится к исходному полноразмерному видео, а не только к данному клипу. Также размечено человеком, который записывал видео.
country
Двухбуквенный код страны, где была сделана запись, основанный на местоположении человека, который ее записывал.
Получить данные
Набор данных доступен на Hugging Face по лицензии Apache 2.0, без ограничений доступа.
После нашего июньского релиза RekaCS2-10k, 10 000 часов эгоцентрических записей Counter-Strike 2 с покадровыми аннотациями действий и сопровождающим его рендерером с открытым исходным кодом, мы выпускаем RekaDaily-10k, чтобы ускорить прогресс в области физического ИИ и способствовать развитию открытой исследовательской экосистемы.
Работайте с нами
Физический ИИ зависит от видеоматериалов, снятых в аутентичных условиях реального мира. Мы управляем глобальной сетью, насчитывающей более 100 000 сборщиков данных, и постоянно расширяем ее, что делает наш механизм обработки данных мощным и масштабируемым ресурсом для ваших проектов.
Если этот релиз соответствует вашим целям, но вам требуются другие условия, специфические действия, определенный регион или специализированная аннотация, мы готовы помочь. Мы обеспечиваем сбор данных по индивидуальному заказу, используя тот же проверенный конвейер. Ранее мы уже создавали специализированные наборы данных по техническим требованиям для передовых исследовательских лабораторий, выполняя проекты в течение нескольких недель.
Этот релиз — лишь малая часть того, что наша сеть производит ежедневно. Если у вас есть особые требования к данным, которых еще не существует, будь то для обучения или тестирования, свяжитесь с нами, и мы разработаем программу для их сбора.






