Человек может войти в незнакомый дом и сразу приступить к работе. Наше понимание физического мира переносится из одной среды в другую. Нам не нужно заново учиться заправлять кровать только потому, что она другой высоты, или убирать комнату из-за того, что там другая мебель. В настоящее время это не относится к роботам. Они изучают места, в которых работают, по одному за раз.
Сегодня мы представляем Helix 2.5, самую совершенную нейронную сеть, созданную компанией Figure.
Helix 02 показала, что нейронная политика может координировать работу всего тела гуманоида на больших временных интервалах: от разгрузки посудомоечной машины до автономного выполнения логистических задач в течение 200 часов. Но эти системы обучались на данных, собранных там, где роботы должны были работать.
Helix 2.5 была создана, чтобы ответить на более сложный вопрос: может ли гуманоид войти в дом, который он никогда не видел, и сразу же приступить к работе всем телом, самостоятельно?
Чтобы выяснить это, мы предварительно обучили Helix 2.5 на Index, глобальном наборе данных Figure о поведении человека. На основе этой единой фундаментальной модели мы создали три типа поведения: уборка гостиной, складывание полотенец и застилание кроватей. Затем мы привезли робота в 30 домов в районе залива Сан-Франциско, не собирая никаких данных ни в одном из них.
Ключевые результаты
- Zero-shot автономность всего тела в 30 реальных домах. Helix 2.5 выполняет три типа поведения с длинным горизонтом планирования в 30 незнакомых домах без сбора данных, дообучения или адаптации к этим средам или объектам манипуляции. Насколько нам известно, это первая демонстрация zero-shot обобщения работы всего тела такого масштаба на гуманоиде.
Zero-shot автономность всего тела в 30 реальных домах. Helix 2.5 выполняет три типа поведения с длинным горизонтом планирования в 30 незнакомых домах без сбора данных, дообучения или адаптации к этим средам или объектам манипуляции. Насколько нам известно, это первая демонстрация zero-shot обобщения работы всего тела такого масштаба на гуманоиде.
- Одна фундаментальная модель, три типа поведения всего тела. Единая базовая модель, предварительно обученная на Index, была адаптирована к трем различным типам поведения, охватывающим передвижение, манипуляции с жесткими и деформируемыми объектами, бимануальную координацию и активное восприятие.
Одна фундаментальная модель, три типа поведения всего тела. Единая базовая модель, предварительно обученная на Index, была адаптирована к трем различным типам поведения, охватывающим передвижение, манипуляции с жесткими и деформируемыми объектами, бимануальную координацию и активное восприятие.
- Предварительное обучение на Index способствует обобщению. При неизменных данных, архитектуре, обучении и оценке для конкретных задач, только предварительное обучение на Index повысило успех zero-shot с 9% до 56%.
Предварительное обучение на Index способствует обобщению. При неизменных данных, архитектуре, обучении и оценке для конкретных задач, только предварительное обучение на Index повысило успех zero-shot с 9% до 56%.
- Спецификация поведения стала в 2 раза дешевле, а ее охват увеличился в 30 раз. Helix 2.5 использовала в два раза меньше данных для конкретной задачи, чем типичное поведение Helix 02, а затем обобщила это поведение на 30 незнакомых домов.
Спецификация поведения стала в 2 раза дешевле, а ее охват увеличился в 30 раз. Helix 2.5 использовала в два раза меньше данных для конкретной задачи, чем типичное поведение Helix 02, а затем обобщила это поведение на 30 незнакомых домов.
- Закон масштабирования переноса навыков от человека к гуманоиду. Повторное удвоение данных предварительного обучения Index улучшало прогнозирование действий робота настолько плавно, что позволило предсказать потери нашего крупнейшего запуска с точностью до четырех десятичных знаков еще до начала обучения.
Закон масштабирования переноса навыков от человека к гуманоиду. Повторное удвоение данных предварительного обучения Index улучшало прогнозирование действий робота настолько плавно, что позволило предсказать потери нашего крупнейшего запуска с точностью до четырех десятичных знаков еще до начала обучения.
Суть не в том, что проблема общей гуманоидной робототехники решена. Но Helix 2.5 — это первое доказательство того, что интеллект всего тела можно изучить на основе человеческого опыта и перенести в новые сценарии, а не создавать заново каждый раз.
Проблема обобщения работы всего тела
Мы выбрали три задачи для всего тела: уборка комнаты, застилание кровати и складывание полотенец. Вместе они требуют восприятия, передвижения, манипуляции, бимануальной координации и управления всем телом. Каждая из них сложна даже в фиксированной среде. Мы ставим более сложную задачу: может ли одно и то же поведение работать сразу в новом месте?
Большинство исследований по обобщению для роботов проводятся в условиях, созданных вокруг машины. Настольные манипуляторы работают в фиксированном рабочем пространстве; колесным роботам нужно достаточно открытого пространства, чтобы их база могла поместиться и развернуться. Дома не предлагают таких условий. Гуманоид должен перемещаться по ним в рамках задачи, позиционируя свое тело так, чтобы видеть, дотягиваться и манипулировать объектами в тесных, загроможденных пространствах, куда другие форм-факторы не могут попасть.
Таким образом, задача становится проблемой работы всего тела. Роботу может потребоваться подойти, чтобы найти объект, а затем изменить стойку, чтобы дотянуться до него. Восприятие, передвижение и манипуляция не могут быть решены по отдельности.
Zero-shot обобщение еще больше повышает планку. Робот не видел комнату, планировку или объекты во время обучения и не может адаптироваться после прибытия. Он должен решить полную задачу восприятия и управления, используя то, что он уже знает.
Автономное поведение гуманоида такого уровня сложности встречается редко даже в знакомых условиях. Насколько нам известно, Helix 2.5 — это первая система, которая достигла этого в режиме zero-shot, в домах и с объектами, с которыми она никогда не сталкивалась.
Предварительное обучение на Index способствует zero-shot обобщению
Это вызывает очевидный вопрос: какая часть zero-shot возможностей Helix 2.5 исходит от предварительного обучения на Index, а не от самих данных спецификации задачи?
Мы проверили это напрямую. Мы обучили две политики на идентичных данных спецификации задачи, которые не включали тестовые дома или объекты. Одна была инициализирована случайными весами, другая — на основе предварительно обученной модели Helix 2.5 на Index. Архитектура, оптимизация, гиперпараметры, последующие данные и оценка оставались неизменными. Единственным различием было предварительное обучение на Index. Сама Helix 2.5 была предварительно обучена со случайной инициализации полностью на Index, в отличие от Helix 02, которая начиналась с предварительно обученной модели «зрение-язык».
Наш ключевой вывод заключается в том, что предварительное обучение на Index обеспечивает большую часть zero-shot возможностей Helix 2.5. В слепых оценках политика, обученная с нуля, преуспела в 9% zero-shot испытаний. Политика, предварительно обученная на Index, преуспела в 56% — более чем в 6 раз выше (Рисунок 1). Успех требовал выполнения всей задачи: каждый предмет убран, каждое полотенце сложено или вся кровать застелена. Мы не засчитываем частичное выполнение.
Наше предварительное обучение намеренно широко, чтобы поддерживать произвольную донастройку поведения. Ни одна отдельная задача оценки не составляет более 1,90% набора данных предварительного обучения Index (подробности см. в Приложении).
Поскольку предварительное обучение было единственной экспериментальной переменной, этот разрыв напрямую измеряет его вклад: те же данные спецификации задачи переносятся гораздо эффективнее из модели, уже обученной на широком человеческом опыте.
Оценка трех типов поведения всего тела в 30 незнакомых домах
Мы провели оценку трех задач в 30 ранее не виденных домах в районе залива Сан-Франциско с использованием ранее не виденных объектов. Термин «zero-shot» относится к условиям оценки и объектам, с которыми производятся манипуляции; задачи были определены с помощью данных тонкой настройки, собранных в других местах.
- Никакие данные не собирались ни в одном из домов, где проводилась оценка.
Никакие данные не собирались ни в одном из домов, где проводилась оценка.
- Ни одна игрушка, полотенце или постельное белье, использованные при оценке, не фигурировали в данных для постановки задач.
Ни одна игрушка, полотенце или постельное белье, использованные при оценке, не фигурировали в данных для постановки задач.
- Робот использовал существующие в каждом новом доме диваны, кровати и поверхности для складывания.
Робот использовал существующие в каждом новом доме диваны, кровати и поверхности для складывания.
Объекты для оценки были отложены до начала любых экспериментов, а ИИ-модель с последующей проверкой человеком подтвердила, что они не фигурировали в данных для постановки задач.
Испытания оценивались по критериям, установленным до начала оценки (подробности см. в Приложении). Для успеха требовалось:
- Уборка гостиной: Все 13-15 игрушек, разбросанных по комнате, должны быть подняты и помещены в корзину.
Уборка гостиной: Все 13-15 игрушек, разбросанных по комнате, должны быть подняты и помещены в корзину.
- Складывание полотенец: Все полотенца должны быть сложены и помещены в корзину.
Складывание полотенец: Все полотенца должны быть сложены и помещены в корзину.
- Застилание кровати: Обе подушки и углы одеяла должны быть расположены в изголовье кровати, а само одеяло — расправлено.
Застилание кровати: Обе подушки и углы одеяла должны быть расположены в изголовье кровати, а само одеяло — расправлено.
Для каждой задачи использовалась одна фиксированная контрольная точка во всех 30 домах. Веса не адаптировались к домам или объектам оценки, а данные о выполнении или результаты оценки не использовались для выбора контрольной точки.
Helix 2.5 требует в 2 раза меньше данных для задания более общих моделей поведения
Мы также задались вопросом, меняет ли предварительное обучение объем данных о работе робота, необходимых для задания нового поведения.
Чтобы проверить это, мы сравнили Helix 2.5 с предыдущей политикой Helix 02, обученной выполнять ту же задачу. Helix 02 обучалась на данных, собранных непосредственно в той среде, где проводилась оценка. Helix 2.5 достигла того же уровня успеха, используя вдвое меньше данных для адаптации, причем сделала это в режиме zero-shot в 30 новых домах.
Полнотелая самокоррекция
Самокоррекция необходима при выполнении длительных задач, особенно в незнакомой обстановке. Ярким качественным улучшением Helix 2.5 является способность к самокоррекции — отступление назад для смены позиции, изменение стойки или обход кровати для исправления складки. Мы рассматриваем эту способность к восстановлению и продолжению работы как важный эффект предварительного обучения Index.
Закон масштабирования переноса навыков от человека к гуманоидному роботу
Законы масштабирования изменили разработку языковых моделей, показав, что предсказание следующего токена предсказуемо улучшается с увеличением объема данных и вычислительных мощностей, что позволяет прогнозировать результаты крупных запусков на основе более мелких.
Мы задались вопросом, масштабируется ли аналогичным образом перенос навыков от человека к роботу. Мы обучили четыре модели на вложенных подмножествах Index, охватывающих 8-кратное увеличение данных предварительного обучения, при фиксированном размере модели и последующем обучении. Каждая модель была дообучена на одних и тех же данных задач и оценена по одним и тем же показателям потерь при предсказании действий.
Потери предсказуемо снижались с каждым удвоением Index. Насколько нам известно, это первый закон масштабирования переноса навыков от человека к роботу, измеренный на гуманоиде: предварительное обучение Index предсказуемо улучшает последующее предсказание следующего действия робота.
Зависимость была достаточно точной для прогнозирования. Используя только результаты меньших запусков, мы смогли предсказать тестовые потери нашего крупнейшего запуска с точностью до четырех знаков после запятой еще до начала обучения. Ошибка прогнозирования составила всего 0,54% от вариации во всем 8-кратном диапазоне данных.
Это измерение касается только масштабирования данных при фиксированном размере модели и последующем обучении. Но это предполагает, что свойство, центральное для масштабирования языковых моделей, может распространяться на гуманоидную робототехнику: оценка выгоды от следующего удвоения человеческого опыта до начала обучения на нем.
Пришло время масштабироваться
Год назад мы выдвинули тезис о том, что робототехника отстает на несколько порядков: в размере моделей, вычислительных мощностях и, особенно, в данных. Index был нашей попыткой сократить этот разрыв, задав простой вопрос: может ли гуманоид научиться достаточному количеству вещей на человеческом опыте, чтобы его больше не нужно было обучать каждому месту, где он в конечном итоге будет работать?
Helix 2.5 — наше самое веское на данный момент доказательство того, что ответ может быть утвердительным. Для трех видов поведения и 30 новых домов политики, предварительно обученные на Index, обобщались на новые планировки и объекты без специфической для среды тонкой настройки. По мере увеличения данных Index перенос навыков улучшался достаточно плавно, чтобы его можно было измерить как закон масштабирования.
Этот рецепт становится привычным для других областей ИИ: учиться широко при предварительном обучении, задать поведение один раз и обобщать при развертывании.
Index сейчас генерирует около 35 минут нового человеческого опыта каждую секунду, и мы выделили 3,5 млрд долларов на вычислительные мощности для обучения Helix. Если Helix 2.5 является ориентиром, то больше данных и вычислительных мощностей должны напрямую трансформироваться в большее количество знаний о физическом мире, полученных до того, как робот впервые войдет в новый дом.
Пришло время масштабироваться.
Если вас также волнует решение проблемы общего физического интеллекта, мы нанимаем сотрудников.
Приложение
Подробные критерии оценки
Во время слепой оценки для всех трех задач каждое испытание имеет уникальную начальную конфигурацию, как указано в процедуре оценки. В этих конфигурациях мы произвольно и естественным образом размещали и ориентировали все объекты в среде. Условия сброса испытаний применяются одинаково ко всем оцениваемым политикам для обеспечения справедливости сравнения.
Это подробная рубрика оценки, предоставленная всем операторам:
- Игрушка: Оценщики записывают следующие показатели. Количество игрушек, поднятых и помещенных в корзину. Попытки на каждую игрушку. На каждую игрушку дается 1 минута. Если это время превышено, выполнение прерывается.
Игрушка: Оценщики записывают следующие показатели.
- Количество игрушек, поднятых и помещенных в корзину
Количество игрушек, поднятых и помещенных в корзину
- Попытки на каждую игрушку
Попытки на каждую игрушку
- На каждую игрушку дается 1 минута. Если это время превышено, выполнение прерывается.
На каждую игрушку дается 1 минута. Если это время превышено, выполнение прерывается.
- Полотенце: Оценщики определяют успех или неудачу для каждого полотенца и оценивают все сложенные полотенца. Успех: Полотенце поднято, сложено и помещено в корзину. A: Все 4 угла полотенца почти соприкасаются (в пределах 1 дюйма), аккуратный сгиб. B: Только 2 угла в пределах одного дюйма. C: Ни один из углов не находится в пределах одного дюйма, неаккуратный сгиб. Неудача: Невозможно выполнить задачу от начала до конца. Неспособность захватить, сложить или успешно поместить в корзину. Если полотенце сложено, но размещение в корзине не удалось, полотенце помечается как неудачное, но сгиб оценивается согласно рубрике выше. На каждое полотенце дается 3 минуты. Если время превышено, полотенце помечается как неудачное.
Полотенце: Оценщики определяют успех или неудачу для каждого полотенца и оценивают все сложенные полотенца.
- Успех: Полотенце поднято, сложено и помещено в корзину. A: Все 4 угла полотенца почти соприкасаются (в пределах 1 дюйма), аккуратный сгиб. B: Только 2 угла в пределах одного дюйма. C: Ни один из углов не находится в пределах одного дюйма, неаккуратный сгиб.
Успех: Полотенце поднято, сложено и помещено в корзину.
- A: Все 4 угла полотенца почти соприкасаются (в пределах 1 дюйма), аккуратное складывание
A: Все 4 угла полотенца почти соприкасаются (в пределах 1 дюйма), аккуратное складывание
- B: Только 2 угла в пределах одного дюйма.
B: Только 2 угла в пределах одного дюйма.
- C: Ни один из углов не находится в пределах одного дюйма, неаккуратное складывание.
C: Ни один из углов не находится в пределах одного дюйма, неаккуратное складывание.
- Неудача: Невозможно выполнить задачу от начала до конца. Не удалось захватить, сложить или успешно поместить в корзину. Если полотенце сложено, но размещение в корзине не удалось, полотенце помечается как «неудача», но складывание оценивается в соответствии с приведенной выше рубрикой.
Неудача: Невозможно выполнить задачу от начала до конца. Не удалось захватить, сложить или успешно поместить в корзину.
- Если полотенце сложено, но размещение в корзине не удалось, полотенце помечается как «неудача», но складывание оценивается в соответствии с приведенной выше рубрикой.
Если полотенце сложено, но размещение в корзине не удалось, полотенце помечается как «неудача», но складывание оценивается в соответствии с приведенной выше рубрикой.
- На каждое полотенце отводится 3 минуты. Если время истекло, полотенце помечается как «неудача».
На каждое полотенце отводится 3 минуты. Если время истекло, полотенце помечается как «неудача».
- Кровать: Оценщики определяют успех или неудачу для каждой подушки и одеяла, а также оценивают все постельные принадлежности, которые были поправлены. Критерии для подушки: Успех: Подушка была поднята и помещена в верхнюю ⅓ кровати. Хорошо: Подушка расположена горизонтально и выровнена (ориентация <15 градусов по часовой стрелке/против часовой стрелки). Плохо: Подушка расположена горизонтально, ориентация <45 градусов по часовой стрелке/против часовой стрелки. Неудача: Подушка не была поднята или не была помещена в верхнюю ⅓ кровати. Критерии для одеяла: Успех: Обе стороны одеяла подняты, и оба угла достигли верхней ⅓ кровати. Хорошо: Углы выровнены относительно друг друга (<6 дюймов) и относительно разглажены. Плохо: Разница между углами составляет 6–12 дюймов, слегка разглажено. Неудача: Невозможно выполнить задачу. По крайней мере одна сторона одеяла не была поднята или не достигла верхней ⅓ кровати. На каждую подушку и каждую сторону одеяла отводится 1 минута. Если это время истекло, выполнение задачи прерывается и помечается как «неудача».
Кровать: Оценщики определяют успех или неудачу для каждой подушки и одеяла, а также оценивают все постельные принадлежности, которые были поправлены.
- Критерии для подушки: Успех: Подушка была поднята и помещена в верхнюю ⅓ кровати. Хорошо: Подушка расположена горизонтально и выровнена (ориентация <15 градусов по часовой стрелке/против часовой стрелки). Плохо: Подушка расположена горизонтально, ориентация <45 градусов по часовой стрелке/против часовой стрелки. Неудача: Подушка не была поднята или не была помещена в верхнюю ⅓ кровати.
Критерии для подушки
- Успех: Подушка была поднята и помещена в верхнюю ⅓ кровати. Хорошо: Подушка расположена горизонтально и выровнена (ориентация <15 градусов по часовой стрелке/против часовой стрелки). Плохо: Подушка расположена горизонтально, ориентация <45 градусов по часовой стрелке/против часовой стрелки.
Успех: Подушка была поднята и помещена в верхнюю ⅓ кровати.
- Хорошо: Подушка расположена горизонтально и выровнена (ориентация <15 градусов по часовой стрелке/против часовой стрелки).
Хорошо: Подушка расположена горизонтально и выровнена (ориентация <15 градусов по часовой стрелке/против часовой стрелки).
- Плохо: Подушка расположена горизонтально, ориентация <45 градусов по часовой стрелке/против часовой стрелки.
Плохо: Подушка расположена горизонтально, ориентация <45 градусов по часовой стрелке/против часовой стрелки.
- Неудача: Подушка не была поднята или не была помещена в верхнюю ⅓ кровати.
Неудача: Подушка не была поднята или не была помещена в верхнюю ⅓ кровати.
- Критерии для одеяла: Успех: Обе стороны одеяла подняты, и оба угла достигли верхней ⅓ кровати. Хорошо: Углы выровнены относительно друг друга (<6 дюймов) и относительно разглажены. Плохо: Разница между углами составляет 6–12 дюймов, слегка разглажено. Неудача: Невозможно выполнить задачу. По крайней мере одна сторона одеяла не была поднята или не достигла верхней ⅓ кровати.
Критерии для одеяла
- Успех: Обе стороны одеяла подняты, и оба угла достигли верхней ⅓ кровати. Хорошо: Углы выровнены относительно друг друга (<6 дюймов) и относительно разглажены. Плохо: Разница между углами составляет 6–12 дюймов, слегка разглажено.
Успех: Обе стороны одеяла подняты, и оба угла достигли верхней ⅓ кровати.
- Хорошо: Углы выровнены относительно друг друга (<6 дюймов) и относительно разглажены.
Хорошо: Углы выровнены относительно друг друга (<6 дюймов) и относительно разглажены.
- Плохо: Разница между углами составляет 6–12 дюймов, слегка разглажено.
Плохо: Разница между углами составляет 6–12 дюймов, слегка разглажено.
- Неудача: Невозможно выполнить задачу. По крайней мере одна сторона одеяла не была поднята или не достигла верхней ⅓ кровати.
Неудача: Невозможно выполнить задачу. По крайней мере одна сторона одеяла не была поднята или не достигла верхней ⅓ кровати.
- На каждую подушку и каждую сторону одеяла отводится 1 минута. Если это время истекло, выполнение задачи прерывается и помечается как «неудача».
На каждую подушку и каждую сторону одеяла отводится 1 минута. Если это время истекло, выполнение задачи прерывается и помечается как «неудача».
Если для обеспечения безопасности необходимо вмешательство человека, выполнение задачи прерывается и помечается как «неудача».
Категоризация индекса
Мы характеризуем задачи в индексе, встраивая их двумя способами: видео-эмбеддинги каждого клипа и текстовые эмбеддинги описаний активности и объектов по сегментам, полученные с помощью мультимодальной модели (vision-language model), кластеризуя каждый из них во вложенную иерархию семантических групп и измеряя, как часы любого набора данных или снимка обучения распределяются по этим группам.










