Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Predstavlyaem index sozdanie krupneyshego i samogo raznoobraznogo v mire nabora
Dev48

© 2026 · All rights reserved.

Представляем Index: создание крупнейшего и самого разнообразного в мире набора физических данных

Источник: FigureAI

Представляем Index: создание крупнейшего и самого разнообразного в мире набора физических данных

Источник: FigureAI

Сегодня мы выходим из режима скрытности с крупнейшим набором данных для обучения роботов, который когда-либо был создан. Данные, необходимые для масштабирования робототехники общего назначения, не существуют в интернете — они должны поступать из реального мира: это глобальная выборка физических процессов, зафиксированных в каждой среде на Земле.

25 сентября 2026 г.

Сегодня мы выходим из режима скрытности с самым разнообразным набором данных для обучения роботов, который когда-либо был создан. Данные, необходимые для масштабирования по-настоящему универсального робота, не существуют в интернете — они должны поступать из реального мира: это глобальная выборка физических процессов, зафиксированных в каждой среде на Земле.

Последние 4 месяца мы создавали эксклюзивный конвейер Figure для масштабирования сбора данных с более высокой пропускной способностью, широким разнообразием и строгими стандартами качества.

  • Находясь в режиме скрытности, мы преодолели отметку в 264 000 загрузок приложения в более чем 100 странах, с более чем 44 000 еженедельных активных пользователей.

Находясь в режиме скрытности, мы преодолели отметку в 264 000 загрузок приложения в более чем 100 странах, с более чем 44 000 еженедельных активных пользователей.

  • Наши создатели (Creators), сеть людей, формирующих эти данные, загрузили в наше приложение более 16 миллионов видео.

Наши создатели (Creators), сеть людей, формирующих эти данные, загрузили в наше приложение более 16 миллионов видео.

  • Приложение обрабатывает 30 минут видеозаписей каждую секунду; ежедневно загружается объем данных, эквивалентный 4,9 годам человеческого труда.

Приложение обрабатывает 30 минут видеозаписей каждую секунду; ежедневно загружается объем данных, эквивалентный 4,9 годам человеческого труда.

  • На сегодняшний день мы выплатили 15 миллионов долларов создателям, которые внесли свой вклад в наши данные.

На сегодняшний день мы выплатили 15 миллионов долларов создателям, которые внесли свой вклад в наши данные.

  • Сейчас мы на пути к стократному увеличению и намерены потратить более 1 миллиарда долларов в течение следующих 12 месяцев на данные и вычислительные мощности.

Сейчас мы на пути к стократному увеличению и намерены потратить более 1 миллиарда долларов в течение следующих 12 месяцев на данные и вычислительные мощности.

Обобщение — это проблема данных.

Наш стек ИИ, Helix, становится более способным так же, как и любая другая обучаемая система: с помощью данных. Это не новая идея в машинном обучении, это центральный вывод последнего десятилетия исследований в области ИИ, который стоит четко сформулировать для робототехники.

Результаты обобщения, которые мы видим внутри компании, уже подтверждают этот тезис, и вскоре мы поделимся подробностями.

Index

Index — это наш ответ на проблему данных: крупнейший в мире полезный набор данных для обучения роботов. Четыре месяца назад мы запустили приложение в режиме скрытности, чтобы проверить идею: можно ли собирать физические данные, необходимые Helix, напрямую от людей в больших масштабах? Сегодня мы проводим ребрендинг этого проекта в Index и запускаем его в Google Play и App Store.

До этого мы пытались покупать данные. Поставщики не могли обеспечить уровень пропускной способности, разнообразия или качества, требуемый Helix, поэтому мы создали конвейер сами: эксклюзивную систему Figure для получения физических данных из реального мира в больших масштабах.

Наши усилия привели к 264 000 загрузок в 108 странах, а более 44 000 еженедельных активных пользователей вносят свой вклад в данные. Приложение обрабатывает 30 минут видеозаписей каждую секунду. На каждые 1000 часов собранных данных Index содержит 373 уникальные задачи, 1146 уникальных объектов манипуляции и 116 уникальных сред. Данные наследуют свое разнообразие непосредственно от людей, которые их создают. Каждый новый создатель привносит невиданную ранее среду, незнакомые объекты и свой собственный уникальный способ выполнения задачи — то самое разнообразие «длинного хвоста», которое почти невозможно определить заранее.

На сегодняшний день создатели заработали 15 миллионов долларов. Мы собираем данные по всему спектру человеческих задач: приготовление пищи, уборка, стирка и другие домашние дела, а также работа внутри предприятий, таких как логистические центры, рестораны, фабрики и офисы. Мы видели такие необычные задачи, как уборка кошачьего туалета, замена масла, уборка столов в ресторане, и мы приветствуем такое разнообразие.

Любой желающий может стать создателем и начать записывать реальные задачи у себя дома или на рабочем месте: застилать постель, складывать белье, обслуживать гостей в местном кафе, пополнять полки в магазинах. Или вы можете заказать создателя через приложение, который придет к вам, чтобы помочь с повседневными делами и обязанностями. Мы даже можем отправить одного из них на ваше предприятие.

Использование человеческих данных для обучения Helix

Прием 30 минут видео каждую секунду от создателей со всего мира потребовал перестройки нашей инфраструктуры данных с учетом ограничений, более характерных для потребительских приложений: доступность 24/7, непрерывные масштабные вычисления для обработки и обратная связь с пользователями в реальном времени, помогающая улучшить будущие сборы.

Конвейер состоит из пяти этапов: фильтрация, проверка на мошенничество, дедупликация, перебалансировка и аннотирование. Автоматизированные фильтры сначала проверяют техническое, визуальное и семантическое качество. Затем аналитики-люди проверяют выборки на уровне пользователей на предмет преднамеренных попыток обхода системы. Чтобы сохранить разнообразие, мы встраиваем (эмбеддинг) каждый видеосегмент и отбрасываем те, которые превышают порог сходства с ранее принятыми данными. Мы перебалансируем оставшиеся данные, используя квоты на задачи — основываясь на том, насколько хорошо каждая заявка соответствует выбранной задаче — и кластеры на основе эмбеддингов, которые фиксируют вариации, выходящие за рамки меток задач. Наконец, мы генерируем иерархические текстовые описания для каждого эпизода.

Следующие шаги

Index закладывает основу для заказа роботов как услуги. Сегодня к вам приходят люди, чтобы помочь убраться в доме; со временем робот будет делать для вас всё.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Незащищенные агенты OpenAI опубликовали в интернете 53 изображения пользователей без ведома лабораторииПресса
OpenAI

Незащищенные агенты OpenAI опубликовали в интернете 53 изображения пользователей без ведома лаборатории

Создание производственных агентов с помощью Jev и LangGraph
LangChain

Создание производственных агентов с помощью Jev и LangGraph

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов
LangChain

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактовПресса
OpenAI

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактов

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержекПресса
Tesla

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержек

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое
LangChain

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое

Ещё от Figure

Figure и Nscale заключают стратегическое партнерство для развертывания до 100 000 графических процессоров на платформе NVIDIA Vera Rubin
Figure

Figure и Nscale заключают стратегическое партнерство для развертывания до 100 000 графических процессоров на платформе NVIDIA Vera Rubin

Представляем Figure 03
Figure

Представляем Figure 03

Helix 2.5: Zero-Shot обобщение для 30 домов
Figure

Helix 2.5: Zero-Shot обобщение для 30 домов