Человек может войти в незнакомый дом и сразу приступить к работе. Наше понимание физического мира переносится из одной среды в другую. Нам не нужно заново учиться заправлять кровать только потому, что у нее другая высота, или убирать комнату из-за того, что там другая мебель. В настоящее время это не относится к роботам. Они изучают места, в которых работают, по одному за раз.
Сегодня мы представляем Helix 2.5, самую совершенную нейронную сеть, созданную компанией Figure.
Helix 02 показала, что нейронная политика может координировать работу всего тела гуманоида в долгосрочной перспективе: от разгрузки посудомоечной машины до автономного выполнения логистических задач в течение 200 часов. Но эти системы обучались на данных, собранных там, где роботы должны были работать.
Helix 2.5 была создана, чтобы ответить на более сложный вопрос: может ли гуманоид войти в дом, который он никогда не видел, и сразу же приступить к работе всем телом, самостоятельно?
Чтобы выяснить это, мы предварительно обучили Helix 2.5 на Index, глобальном наборе данных Figure о поведении человека. На основе этой единой фундаментальной модели мы создали три типа поведения: уборка гостиных, складывание полотенец и застилание кроватей. Затем мы отправили робота в 30 домов в районе залива Сан-Франциско, не собирая никаких данных ни в одном из них.
Ключевые результаты
- Zero-shot автономность всего тела в 30 реальных домах. Helix 2.5 выполняет три долгосрочных сценария поведения в 30 ранее не виденных домах без сбора данных, дообучения или адаптации к этим средам или объектам манипуляции. Насколько нам известно, это первая демонстрация zero-shot обобщения всего тела такого масштаба на гуманоидном роботе.
Zero-shot автономность всего тела в 30 реальных домах. Helix 2.5 выполняет три долгосрочных сценария поведения в 30 ранее не виденных домах без сбора данных, дообучения или адаптации к этим средам или объектам манипуляции. Насколько нам известно, это первая демонстрация zero-shot обобщения всего тела такого масштаба на гуманоидном роботе.
- Одна фундаментальная модель, три типа поведения всего тела. Единая базовая модель, предварительно обученная на Index, была адаптирована к трем различным типам поведения, охватывающим передвижение, манипуляции с жесткими и деформируемыми объектами, бимануальную координацию и активное восприятие.
Одна фундаментальная модель, три типа поведения всего тела. Единая базовая модель, предварительно обученная на Index, была адаптирована к трем различным типам поведения, охватывающим передвижение, манипуляции с жесткими и деформируемыми объектами, бимануальную координацию и активное восприятие.
- Предварительное обучение на Index способствует обобщению. При неизменных данных, архитектуре, обучении и оценке, специфичных для задачи, только лишь предварительное обучение на Index повысило успех zero-shot с 9% до 56%.
Предварительное обучение на Index способствует обобщению. При неизменных данных, архитектуре, обучении и оценке, специфичных для задачи, только лишь предварительное обучение на Index повысило успех zero-shot с 9% до 56%.
- Спецификация поведения стала в 2 раза дешевле, а ее охват расширился в 30 раз. Helix 2.5 использовала вдвое меньше данных, специфичных для задачи, чем типичное поведение Helix 02, а затем обобщила это поведение на 30 ранее не виденных домов.
Спецификация поведения стала в 2 раза дешевле, а ее охват расширился в 30 раз. Helix 2.5 использовала вдвое меньше данных, специфичных для задачи, чем типичное поведение Helix 02, а затем обобщила это поведение на 30 ранее не виденных домов.
- Закон масштабирования переноса навыков от человека к гуманоидному роботу. Повторное удвоение данных предварительного обучения Index улучшало прогнозирование действий робота настолько плавно, что позволило предсказать потери нашего крупнейшего запуска с точностью до четырех десятичных знаков еще до начала обучения.
Закон масштабирования переноса навыков от человека к гуманоидному роботу. Повторное удвоение данных предварительного обучения Index улучшало прогнозирование действий робота настолько плавно, что позволило предсказать потери нашего крупнейшего запуска с точностью до четырех десятичных знаков еще до начала обучения.
Суть не в том, что проблема общей гуманоидной робототехники решена. Но Helix 2.5 — это первое доказательство того, что интеллект всего тела может быть получен из человеческого опыта и перенесен в новые сценарии, а не перестраиваться каждый раз заново.
Проблема обобщения всего тела
Мы выбрали три задачи для всего тела: уборка комнаты, застилание кровати и складывание полотенец. Вместе они требуют восприятия, передвижения, манипуляции, бимануальной координации и управления всем телом. Каждая из них сложна даже в фиксированной среде. Мы ставим более сложную задачу: может ли одно и то же поведение работать сразу в новом месте?
Большинство исследований по обобщению роботов проводятся в условиях, созданных вокруг машины. Настольные манипуляторы работают в фиксированном рабочем пространстве; колесным роботам нужно достаточно открытого пространства, чтобы их база могла поместиться и развернуться. Дома не предлагают таких условий. Гуманоид должен перемещаться по ним в рамках задачи, позиционируя свое тело так, чтобы видеть, дотягиваться и манипулировать объектами в тесных, загроможденных пространствах, куда другие форм-факторы не могут попасть.
Таким образом, задача становится проблемой управления всем телом. Роботу, возможно, придется подойти, чтобы найти объект, а затем изменить стойку, чтобы дотянуться до него. Восприятие, передвижение и манипуляция не могут быть решены отдельно.
Zero-shot обобщение еще больше повышает планку. Робот не видел комнату, планировку или объекты во время обучения и не может адаптироваться после прибытия. Он должен решить полную задачу восприятия и управления, используя то, что он уже знает.
Автономное поведение гуманоида такого уровня сложности встречается редко даже в знакомых условиях. Насколько нам известно, Helix 2.5 — первая система, достигшая этого в режиме zero-shot, в домах и с объектами, с которыми она никогда не сталкивалась.
Предварительное обучение на Index стимулирует zero-shot обобщение
Это вызывает очевидный вопрос: какая часть возможностей zero-shot у Helix 2.5 исходит из предварительного обучения на Index, а не из самих данных спецификации задачи?
Мы проверили это напрямую. Мы обучили две политики на идентичных данных спецификации задачи, которые не включали тестовые дома или объекты. Одна была инициализирована случайными весами, другая — на основе предварительно обученной модели Helix 2.5 (Index). Архитектура, оптимизация, гиперпараметры, последующие данные и оценка оставались неизменными. Единственным отличием было предварительное обучение на Index. Сама Helix 2.5 была предварительно обучена со случайной инициализации полностью на Index, в отличие от Helix 02, которая начиналась с предварительно обученной модели «зрение-язык».
Наш ключевой вывод заключается в том, что предварительное обучение на Index обеспечивает большую часть возможностей zero-shot у Helix 2.5. В слепых оценках политика, обученная с нуля, добилась успеха в 9% испытаний zero-shot. Политика, предварительно обученная на Index, добилась успеха в 56% — более чем в 6 раз выше (Рисунок 1). Успех требовал выполнения всей задачи: каждый предмет убран, каждое полотенце сложено или вся кровать застелена. Мы не засчитываем частичные результаты.
Наше предварительное обучение намеренно широко, чтобы поддерживать произвольную тонкую настройку поведения. Ни одна отдельная задача оценки не составляет более 1,90% набора данных предварительного обучения Index (подробности см. в Приложении).
Поскольку предварительное обучение было единственной экспериментальной переменной, этот разрыв напрямую измеряет его вклад: одни и те же данные спецификации задачи переносятся гораздо эффективнее из модели, уже обученной на широком человеческом опыте.
Оценка трех типов поведения всего тела в 30 ранее не виденных домах
Мы оценили выполнение трех задач в 30 ранее не встречавшихся домах в районе Залива Сан-Франциско с использованием незнакомых объектов. Термин «zero-shot» относится к условиям оценки и манипулируемым объектам; задачи задавались с помощью данных дообучения, собранных в других местах.
- Никаких данных ни в одном из домов, где проводилась оценка, не собиралось.
Никаких данных ни в одном из домов, где проводилась оценка, не собиралось.
- Никакие игрушки, полотенца или постельные принадлежности из тех, что использовались при оценке, не фигурировали в данных для спецификации задач.
Никакие игрушки, полотенца или постельные принадлежности из тех, что использовались при оценке, не фигурировали в данных для спецификации задач.
- Робот использовал существующие в каждом новом доме диваны, кровати и поверхности для складывания.
Робот использовал существующие в каждом новом доме диваны, кровати и поверхности для складывания.
Объекты для оценки откладывались в сторону до начала любых экспериментов, а модель искусственного интеллекта с последующей проверкой человеком подтверждала, что они не появлялись в данных для спецификации задач.
Попытки оценивались по критериям, зафиксированным до начала оценки (подробности см. в Приложении). Для успеха требовалось:
- Уборка в гостиной: Все 13–15 разбросанных в комнате игрушек собраны и положены в корзину.
Уборка в гостиной: Все 13–15 разбросанных в комнате игрушек собраны и положены в корзину.
- Складывание полотенец: Все полотенца сложены и положены в корзину.
Складывание полотенец: Все полотенца сложены и положены в корзину.
- Застилание кровати: Обе подушки и углы пухового одеяла расположены в изголовье кровати, а одеяло расправлено.
Застилание кровати: Обе подушки и углы пухового одеяла расположены в изголовье кровати, а одеяло расправлено.
Для всех 30 домов в каждой задаче использовалась одна и та же фиксированная контрольная точка. Никакие веса не адаптировались под дома или объекты оценки, а данные запусков или результаты оценки не использовались для выбора контрольных точек.
Helix 2.5 требует в 2 раза меньше данных для задания более общих моделей поведения
Мы также задались вопросом, меняет ли предварительное обучение объем робототехнических данных, необходимых для задания нового поведения.
Чтобы проверить это, мы сравнили Helix 2.5 с предыдущей политикой Helix 02, обученной выполнять ту же задачу. Helix 02 обучалась на данных, собранных непосредственно в среде, где она оценивалась. Helix 2.5 достигла такого же уровня успешности, используя вдвое меньше данных для адаптации, и сделала это в режиме zero-shot в 30 новых домах.
Полноразмерная робототехника и самокоррекция
Самокоррекция имеет решающее значение на длинных временных горизонтах, особенно в незнакомой обстановке. Ярким качественным улучшением Helix 2.5 является ее способность к самокоррекции — отступление назад для переориентации, смена стойки или обход вокруг большой кровати для исправления складок. Мы рассматриваем эту способность восстанавливаться и продолжать движение вперед как важный результат предварительного обучения Index.
Закон масштабирования передачи навыков от человека к гуманоидному роботу
Законы масштабирования изменили разработку языковых моделей, показав, что прогнозирование следующего токена предсказуемо улучшается с увеличением объема данных и вычислений, что позволяет прогнозировать результаты масштабных запусков на основе меньших.
Мы задались вопросом, масштабируется ли перенос навыков от человека к роботу аналогичным образом. Мы обучили четыре модели на вложенных подмножествах Index, охватывающих 8-кратное увеличение данных предварительного обучения, при этом размер моделей и последующее обучение оставались неизменными. Каждая модель была дообучена на тех же данных задачи и оценена по той же отложенной функции потерь прогнозирования действий.
Потери предсказуемо снижались при каждом удвоении объема данных Index. Насколько нам известно, это первый закон масштабирования переноса навыков от человека к роботу, измеренный на гуманоиде: предварительное обучение Index предсказуемо улучшает последующее прогнозирование следующих действий робота.
Взаимосвязь оказалась достаточно точной для прогнозирования. Используя только небольшие запуски, мы смогли предсказать тестовые потери нашего крупнейшего запуска с точностью до четырех знаков после запятой еще до начала обучения. Ошибка прогнозирования составила всего 0,54% от вариации во всем 8-кратном диапазоне данных.
Это измерение касается только масштабирования данных, при фиксированном размере модели и последующем обучении. Но оно предполагает, что свойство, являющееся центральным для масштабирования языковых моделей, может распространяться и на гуманоидную робототехнику: оценка пользы от следующего удвоения человеческого опыта до начала обучения на нем.
Пришло время масштабироваться
Год назад мы выдвинули тезис о том, что робототехника отстает на несколько порядков: по размеру моделей, вычислительной мощности и, особенно, по данным. Index стал нашей попыткой преодолеть этот разрыв, задавшись простым вопросом: может ли гуманоид научиться у человеческого опыта достаточному количеству вещей, чтобы его больше не нужно было обучать каждому месту, где он в конечном итоге будет работать?
Helix 2.5 — наше самое весомое на данный момент доказательство того, что ответ может быть утвердительным. Для трех моделей поведения и в 30 новых домах политики, предварительно обученные на Index, обобщались на новые планировки и объекты без дообучения под конкретную среду. По мере увеличения объема данных Index перенос улучшался настолько плавно, что это можно измерить как закон масштабирования.
Этот рецепт становится знакомым и для других областей ИИ: широкое обучение на этапе претренинга, однократное задание поведения и обобщение при развертывании.
В настоящее время Index генерирует около 35 минут нового человеческого опыта каждую секунду, и мы выделили 3,5 миллиарда долларов на вычисления для обучения Helix. Если Helix 2.5 может служить ориентиром, больший объем данных и вычислений должен напрямую трансформироваться в больший объем физического мира, освоенного до того, как робот вообще попадет в новый дом.
Пришло время масштабироваться.
Если вы тоже заботитесь о решении задач общей физической интеллектуальности, мы нанимаем сотрудников.
Приложение
Подробные критерии оценки
Во время слепого тестирования для всех трех задач каждая попытка имеет уникальную начальную конфигурацию, как указано в разделе «Начальная конфигурация» нашей процедуры оценки. В этих конфигурациях мы произвольно и естественным образом размещали и ориентировали все объекты в окружающей среде. Условия сброса попытки применяются одинаково ко всем оцениваемым политикам для обеспечения справедливого сравнения.
Это подробный свод правил оценки, предоставленный всем операторам:
- Игрушка: Оценщики фиксируют следующие метрики. Количество поднятых и положенных в корзину игрушек Попытки на одну игрушку На каждую игрушку дается 1 минута тайм-аута. Если этот тайм-аут превышен, прогон прерывается.
Игрушка: Оценщики фиксируют следующие метрики.
- Количество поднятых и положенных в корзину игрушек
Количество поднятых и положенных в корзину игрушек
- Попытки на одну игрушку
Попытки на одну игрушку
- На каждую игрушку дается 1 минута тайм-аута. Если этот тайм-аут превышен, прогон прерывается.
На каждую игрушку дается 1 минута тайм-аут. Если этот тайм-аут превышен, прогон прерывается.
- Полотенце: Оценщики определяют успех или неудачу для каждого полотенца и оценивают все сложенные полотенца. Успех: Полотенце поднято, сложено и помещено в корзину. A: Все 4 угла полотенца почти соприкасаются (в пределах 1 дюйма), аккуратный сгиб B: Только 2 угла в пределах одного дюйма. C: Ни один из углов не находится в пределах одного дюйма, неаккуратный сгиб. Неудача: Невозможно выполнить задачу от начала до конца. Не удалось успешно захватить, сложить или положить в корзину. Если полотенце сложено, но поместить его в корзину не удалось, полотенце отмечается как неудачное, но сгиб оценивается в соответствии с приведенными выше критериями. На каждое полотенце дается 3 минуты тайм-аута. Если этот тайм-аут превышен, полотенце отмечается как неудачное.
Полотенце: Оценщики определяют успех или неудачу для каждого полотенца и оценивают все сложенные полотенца.
- Успех: Полотенце поднято, сложено и помещено в корзину. A: Все 4 угла полотенца почти соприкасаются (в пределах 1 дюйма), аккуратный сгиб B: Только 2 угла в пределах одного дюйма. C: Ни один из углов не находится в пределах одного дюйма, неаккуратный сгиб.
Успех: Полотенце поднято, сложено и помещено в корзину.
- A: Все 4 угла полотенца почти соприкасаются (в пределах 1 дюйма), аккуратное складывание
A: Все 4 угла полотенца почти соприкасаются (в пределах 1 дюйма), аккуратное складывание
- B: Только 2 угла в пределах одного дюйма.
B: Только 2 угла в пределах одного дюйма.
- C: Ни один из углов не находится в пределах одного дюйма, неаккуратное складывание.
C: Ни один из углов не находится в пределах одного дюйма, неаккуратное складывание.
- Неудача: Невозможно выполнить задачу от начала до конца. Не удалось захватить, сложить или успешно поместить в корзину. Если полотенце сложено, но размещение в корзине не удалось, полотенце помечается как «неудача», но складывание оценивается в соответствии с приведенной выше рубрикой.
Неудача: Невозможно выполнить задачу от начала до конца. Не удалось захватить, сложить или успешно поместить в корзину.
- Если полотенце сложено, но размещение в корзине не удалось, полотенце помечается как «неудача», но складывание оценивается в соответствии с приведенной выше рубрикой.
Если полотенце сложено, но размещение в корзине не удалось, полотенце помечается как «неудача», но складывание оценивается в соответствии с приведенной выше рубрикой.
- На каждое полотенце отводится 3 минуты. Если время истекло, полотенце помечается как «неудача».
На каждое полотенце отводится 3 минуты. Если время истекло, полотенце помечается как «неудача».
- Кровать: Оценщики определяют успех или неудачу для каждой подушки и одеяла, а также оценивают все постельные принадлежности, которые были поправлены. Критерии для подушки: Успех: Подушка была поднята и помещена в верхнюю ⅓ кровати. Хорошо: Подушка размещена горизонтально и выровнена (ориентация <15 градусов по/против часовой стрелки). Плохо: Подушка размещена горизонтально, ориентация <45 градусов по/против часовой стрелки. Неудача: Подушка не была поднята или не была помещена в верхнюю ⅓ кровати. Критерии для одеяла: Успех: Обе стороны одеяла подняты, и оба угла достигли верхней ⅓ кровати. Хорошо: Углы выровнены друг относительно друга (<6 дюймов) и относительно разглажены. Плохо: Разница между углами составляет 6-12 дюймов, слегка разглажено. Неудача: Невозможно выполнить задачу. По крайней мере одна сторона одеяла не была поднята или не достигла верхней ⅓ кровати. На каждую подушку и каждую сторону одеяла отводится 1 минута. Если это время истекло, выполнение задачи прерывается и помечается как «неудача».
Кровать: Оценщики определяют успех или неудачу для каждой подушки и одеяла, а также оценивают все постельные принадлежности, которые были поправлены.
- Критерии для подушки: Успех: Подушка была поднята и помещена в верхнюю ⅓ кровати. Хорошо: Подушка размещена горизонтально и выровнена (ориентация <15 градусов по/против часовой стрелки). Плохо: Подушка размещена горизонтально, ориентация <45 градусов по/против часовой стрелки. Неудача: Подушка не была поднята или не была помещена в верхнюю ⅓ кровати.
Критерии для подушки
- Успех: Подушка была поднята и помещена в верхнюю ⅓ кровати. Хорошо: Подушка размещена горизонтально и выровнена (ориентация <15 градусов по/против часовой стрелки). Плохо: Подушка размещена горизонтально, ориентация <45 градусов по/против часовой стрелки
Успех: Подушка была поднята и помещена в верхнюю ⅓ кровати
- Хорошо: Подушка размещена горизонтально и выровнена (ориентация <15 градусов по/против часовой стрелки)
Хорошо: Подушка размещена горизонтально и выровнена (ориентация <15 градусов по/против часовой стрелки)
- Плохо: Подушка размещена горизонтально, ориентация <45 градусов по/против часовой стрелки
Плохо: Подушка размещена горизонтально, ориентация <45 градусов по/против часовой стрелки
- Неудача: Подушка не была поднята или не была помещена в верхнюю ⅓ кровати
Неудача: Подушка не была поднята или не была помещена в верхнюю ⅓ кровати
- Критерии для одеяла: Успех: Обе стороны одеяла подняты, и оба угла достигли верхней ⅓ кровати. Хорошо: Углы выровнены друг относительно друга (<6 дюймов) и относительно разглажены. Плохо: Разница между углами составляет 6-12 дюймов, слегка разглажено. Неудача: Невозможно выполнить задачу. По крайней мере одна сторона одеяла не была поднята или не достигла верхней ⅓ кровати
Критерии для одеяла
- Успех: Обе стороны одеяла подняты, и оба угла достигли верхней ⅓ кровати. Хорошо: Углы выровнены друг относительно друга (<6 дюймов) и относительно разглажены. Плохо: Разница между углами составляет 6-12 дюймов, слегка разглажено
Успех: Обе стороны одеяла подняты, и оба угла достигли верхней ⅓ кровати
- Хорошо: Углы выровнены друг относительно друга (<6 дюймов) и относительно разглажены
Хорошо: Углы выровнены друг относительно друга (<6 дюймов) и относительно разглажены
- Плохо: Разница между углами составляет 6-12 дюймов, слегка разглажено
Плохо: Разница между углами составляет 6-12 дюймов, слегка разглажено
- Неудача: Невозможно выполнить задачу. По крайней мере одна сторона одеяла не была поднята или не достигла верхней ⅓ кровати
Неудача: Невозможно выполнить задачу. По крайней мере одна сторона одеяла не была поднята или не достигла верхней ⅓ кровати
- На каждую подушку и каждую сторону одеяла отводится 1 минута. Если это время истекло, выполнение задачи прерывается и помечается как «неудача».
На каждую подушку и каждую сторону одеяла отводится 1 минута. Если это время истекло, выполнение задачи прерывается и помечается как «неудача».
Если для обеспечения безопасности необходимо вмешательство человека, выполнение задачи прерывается и помечается как «неудача».
Категоризация индекса
Мы характеризуем задачи в Index, встраивая их двумя способами: видео-эмбеддинги каждого клипа и текстовые эмбеддинги описаний активности и объектов по сегментам, полученные с помощью визуально-языковой модели, кластеризуя каждое из них во вложенную иерархию семантических групп и измеряя, как часы любого набора данных или снимка обучения распределяются по этим группам.
