Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Predstavlyaem perceptron egocentric api
Dev48

© 2026 · All rights reserved.

Представляем Perceptron Egocentric API

Источник: Perceptron

Представляем Perceptron Egocentric API

Источник: Perceptron

Передовые методы воплощенного рассуждения для крупномасштабной аннотации робототехнических данных

26 сентября 2026 г.

Perceptron Egocentric превращает необработанные видео с роботов и эгоцентрические видео в структурированные данные для обучения политик: временную сегментацию на атомарные манипуляционные события, автономные метки подзадач и плотные сигналы привязки для каждой руки.

Сегодня мы открываем ранний доступ для робототехнических лабораторий, исследователей и поставщиков данных, создающих крупномасштабные конвейеры аннотирования.

Почему это важно для робототехнических лабораторий

Обучение политик ограничено качеством супервизии. Видео собирать дешево, а размечать дорого: человеческая аннотация стоит примерно 50 долларов за час видео, а автоматизированные конвейеры, построенные на универсальных VLM, выдают плоские текстовые метки со слабыми временными границами и без привязки к действиям рук. Perceptron Egocentric устраняет этот разрыв. Он превосходит Gemini Robotics ER-1.6 и Gemini 3.5 Flash, предыдущие лучшие решения в этой области, и прошел всестороннее тестирование в наших внутренних сценариях использования. Получая эпизод, система сегментирует демонстрацию на атомарные манипуляционные события и помечает каждое из них понятным, автономным описанием, с учетом инструкции к задаче или без нее. Его возможности включают:

  • Плотная аннотация рук. Вспомогательный модуль Perceptron Mk1 для обнаружения рук и оценки позы отслеживает обе руки на видео, создавая ограничивающие рамки для каждого кадра и полные скелеты из 21 ключевой точки (запястье плюс четыре сустава на каждом пальце) с идентификацией левой/правой руки: границы манипуляций следуют за руками, а не за пикселями, поэтому сегментатор получает прямой сигнал о том, где на самом деле происходят контакт, захват и отпускание. Каждая рука независимо описывается в соответствии с предопределенной таксономией манипуляционных действий (дотягивание, захват/щипок, подъем, удержание, размещение/вставка, толкание/тяга, вращение, открытие/закрытие, отпускание и т. д.) плюс состояние видимости.

Плотная аннотация рук.

  • Вспомогательный модуль Perceptron Mk1 для обнаружения рук и оценки позы отслеживает обе руки на видео, создавая ограничивающие рамки для каждого кадра и полные скелеты из 21 ключевой точки (запястье плюс четыре сустава на каждом пальце) с идентификацией левой/правой руки:

Вспомогательный модуль Perceptron Mk1 для обнаружения рук и оценки позы отслеживает обе руки на видео, создавая ограничивающие рамки для каждого кадра и полные скелеты из 21 ключевой точки (запястье плюс четыре сустава на каждом пальце) с идентификацией левой/правой руки:

  • Границы манипуляций следуют за руками, а не за пикселями, поэтому сегментатор получает прямой сигнал о том, где на самом деле происходят контакт, захват и отпускание.

Границы манипуляций следуют за руками, а не за пикселями, поэтому сегментатор получает прямой сигнал о том, где на самом деле происходят контакт, захват и отпускание.

  • Каждая рука независимо описывается в соответствии с предопределенной таксономией манипуляционных действий (дотягивание, захват/щипок, подъем, удержание, размещение/вставка, толкание/тяга, вращение, открытие/закрытие, отпускание и т. д.) плюс состояние видимости.

Каждая рука независимо описывается в соответствии с предопределенной таксономией манипуляционных действий (дотягивание, захват/щипок, подъем, удержание, размещение/вставка, толкание/тяга, вращение, открытие/закрытие, отпускание и т. д.) плюс состояние видимости.

  • Гранулярная аннотация подзадач. Атомарные действия, выполняемые роботом или человеком на видео, разделяются, описываются и проверяются, что обеспечивает значительно более высокое качество аннотаций.

Гранулярная аннотация подзадач.

  • Атомарные действия, выполняемые роботом или человеком на видео, разделяются, описываются и проверяются, что обеспечивает значительно более высокое качество аннотаций.

Атомарные действия, выполняемые роботом или человеком на видео, разделяются, описываются и проверяются, что обеспечивает значительно более высокое качество аннотаций.

  • Работа с опциональными инструкциями. Система работает в двух профилях: с инструкцией к задаче эпизода в качестве контекста (обслуживая потребности, когда задача известна заранее) или полностью «вслепую», без какой-либо инструкции.

Работа с опциональными инструкциями. Система работает в двух профилях: с инструкцией к задаче эпизода в качестве контекста (обслуживая потребности, когда задача известна заранее) или полностью «вслепую», без какой-либо инструкции.

Основные результаты

WGO-Bench («Что происходит») — это эталонный тест Macrodata для автоматизированной аннотации подзадач: эпизоды, охватывающие HomER (эгоцентрические), DROID (внешняя камера робота) и Galaxea (камера на голове робота), с 743 вручную аннотированными сегментами по 62 инструкциям к задачам на 71,5 минутах видео.

Оценка по WGO-Bench дала два основных результата:

  • Наш профиль с использованием инструкций в 10-15 раз дешевле, чем аннотация человеком. Macrodata оценивает стоимость человеческой аннотации примерно в 50 долларов за час видео.

Наш профиль с использованием инструкций в 10-15 раз дешевле, чем аннотация человеком. Macrodata оценивает стоимость человеческой аннотации примерно в 50 долларов за час видео.

  • С инструкциями Perceptron Egocentric обеспечивает +77% сквозного F1, обходясь дешевле, чем полный конвейер Macrodata.

С инструкциями Perceptron Egocentric обеспечивает +77% сквозного F1, обходясь дешевле, чем полный конвейер Macrodata.

Стоимость против качества на WGO-Bench (семантический сквозной F1, стандартные прейскурантные цены). Слева — с инструкцией к задаче: граница Парето (пунктир) проходит от однопроходного метода WGO на низкозатратном конце до Perceptron Egocentric на высококачественном конце; конвейер WGO с начальной переразметкой находится внутри нее. Справа — без инструкции: вариант WGO с начальными данными занимает нижний сегмент; оба профиля Perceptron обеспечивают строго более высокое качество, до 0,225 сквозного F1.

Сравнение на WGO-Bench

Строки WGO взяты из итоговой таблицы сквозной оценки Macrodata (Gemini 3.5 Flash, предоставлена инструкция). Их однопроходный вариант помечает сегменты за тот же проход, который их создает, что является прямым сравнением с нашим однопроходным конвейером. Их вариант с начальной переразметкой добавляет второй проход разметки Gemini для каждого сегмента.

Основные дельты, Perceptron Egocentric (с инструкцией) против однопроходного WGO:

  • Семантический сквозной F1: 0,280 против 0,158 (+77% относительно). Это метрика, которая измеряет готовый продукт: правильно ограниченные и правильно помеченные подзадачи. Мы создаем 181 полностью правильный сегмент из 743 эталонных против ~101 (полнота 0,136) у WGO.

Семантический сквозной F1: 0,280 против 0,158 (+77% относительно). Это метрика, которая измеряет готовый продукт: правильно ограниченные и правильно помеченные подзадачи. Мы создаем 181 полностью правильный сегмент из 743 эталонных против ~101 (полнота 0,136) у WGO.

  • F1 сегмента: 0,370 против 0,302 (+23% относительно), с точностью сегмента 0,435 и полнотой 0,322 (239 из 743 эталонных сегментов совпали при IoU ≥ 0,75 из 550 предсказаний).

F1 сегмента: 0,370 против 0,302 (+23% относительно), с точностью сегмента 0,435 и полнотой 0,322 (239 из 743 эталонных сегментов совпали при IoU ≥ 0,75 из 550 предсказаний).

  • Семантическая точность 0,330 против 0,190 и семантическая полнота 0,244 против 0,136. Больше того, что мы выдаем, является правильным, и мы восстанавливаем на ~80% больше эталонных подзадач в сквозном режиме.

Семантическая точность 0,330 против 0,190 и семантическая полнота 0,244 против 0,136. Больше того, что мы выдаем, является правильным, и мы восстанавливаем на ~80% больше эталонных подзадач в сквозном режиме.

  • Без инструкции профиль с наилучшей точностью все равно превосходит предыдущий конвейер SOTA по сегментации и сквозным показателям. Система восстанавливает происходящее только на основе видео.

Даже без инструкций профиль с наилучшей точностью превосходит предыдущий конвейер SOTA как в сегментации, так и в сквозных показателях. Система восстанавливает происходящее, основываясь только на видео.

  • Профиль с быстрым выводом без инструкций — это вариант для оптимизации стоимости/задержки, а не профиль с максимальными показателями бенчмарка: он сокращает затраты без инструкций примерно на 30% и достигает сквозного показателя F1 0,182, что все еще превосходит по качеству вариант WGO с начальной разметкой без инструкций (0,138).

Профиль с быстрым выводом без инструкций — это вариант для оптимизации стоимости/задержки, а не профиль с максимальными показателями бенчмарка: он сокращает затраты без инструкций примерно на 30% и достигает сквозного показателя F1 0,182, что все еще превосходит по качеству вариант WGO с начальной разметкой без инструкций (0,138).

Вариант с начальной переразметкой обеспечивает точность меток 78,1% ценой дополнительного прохода Gemini по каждому сегменту, при этом сквозной показатель составляет 0,168 — на 40% ниже, чем наш результат без переразметки, но с инструкциями (0,280). Условная точность меток также легче достигается при низком уровне полноты (recall): она оценивается только на сегментах с полнотой 0,144, которые их конвейеру удается сопоставить.

Почему это побеждает

Perceptron Egocentric построен на базе Mk1, нашей передовой модели восприятия. Mk1 обучена непосредственно воспринимать физический мир: руки, контакт, состояние объектов и пространственные отношения являются базовыми концепциями в ее представлении, изученными на этапе предварительного обучения.

Никакие функции аннотирования не были включены в обучение. Mk1 никогда не дообучалась на этом наборе данных, таксономии или эпизодах в стиле WGO. Конвейер представляет собой инфраструктуру времени вывода, построенную вокруг общей модели воплощенного интеллекта. Приведенные выше результаты, включая способность восстанавливать структуру задачи только по видео без каких-либо инструкций, являются естественным следствием продвинутого воплощенного рассуждения.

Конвейеры VLM общего назначения выбирают кадры и угадывают, что произошло; Mk1 воспринимает манипуляцию в момент ее совершения. Этот разрыв обусловлен моделью, а не конвейером, поэтому он сохраняется без обучения под конкретную задачу и будет увеличиваться по мере развития Mk1.

Примечания по оценке и стоимости

Протокол оценки (идентичен для всех строк ниже): предсказанный сегмент совпадает с эталонным, когда временной IoU ≥ 0,75; правильность меток оценивается предписанным бенчмарком LLM-судьей (той же моделью-судьей, что и в опубликованной оценке Macrodata); семантический сквозной результат требует, чтобы предсказание прошло проверку как границ, так и меток. Все результаты получены на полном бенчмарке с предоставленной инструкцией к задаче (за исключением случаев, отмеченных как «без инструкций»).

Не включено: оценка судьи WGO-Bench (это стоимость оценки, а не стоимость аннотирования; обе системы оцениваются одинаково) и поток оценки позы рук, который работает на наших собственных GPU, а не через тарифицируемый API. Его включение добавляет примерно ~$1 на час видео. Цифры являются оценками на основе зарегистрированного использования, а не счетами на оплату.

Источники

  • Показатели WGO: публичный пост в блоге Macrodata, включая итоговую таблицу сквозной оценки (варианты с одним проходом и начальной переразметкой), разбивку сегментации по наборам данных и разбивку стоимости по этапам. Их конвейер получает инструкцию к эпизоду.

Показатели WGO: публичный пост в блоге Macrodata, включая итоговую таблицу сквозной оценки (варианты с одним проходом и начальной переразметкой), разбивку сегментации по наборам данных и разбивку стоимости по этапам. Их конвейер получает инструкцию к эпизоду.

  • Показатели Perceptron: полные прогоны WGO-Bench (июль 2026 г.), все эпизоды завершены, оценка проведена по опубликованному протоколу бенчмарка (временное сопоставление IoU ≥ 0,75 и предписанный бенчмарком LLM-судья меток).

Показатели Perceptron: полные прогоны WGO-Bench (июль 2026 г.), все эпизоды завершены, оценка проведена по опубликованному протоколу бенчмарка (временное сопоставление IoU ≥ 0,75 и предписанный бенчмарком LLM-судья меток).

  • Затраты: рассчитаны на основе зарегистрированного использования модели по стандартным тарифам провайдера на июль 2026 года; пакетные скидки для обеих систем исключены. Затраты на оценку и судейство исключены для обеих систем.

Затраты: рассчитаны на основе зарегистрированного использования модели по стандартным тарифам провайдера на июль 2026 года; пакетные скидки для обеих систем исключены. Затраты на оценку и судейство исключены для обеих систем.

Мы сотрудничаем с робототехническими лабораториями, исследователями и поставщиками данных по крупномасштабной аннотации данных.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Незащищенные агенты OpenAI опубликовали в интернете 53 изображения пользователей без ведома лабораторииПресса
OpenAI

Незащищенные агенты OpenAI опубликовали в интернете 53 изображения пользователей без ведома лаборатории

Создание производственных агентов с помощью Jev и LangGraph
LangChain

Создание производственных агентов с помощью Jev и LangGraph

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов
LangChain

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактовПресса
OpenAI

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактов

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержекПресса
Tesla

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержек

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое
LangChain

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое

Ещё от Perceptron

Представляем декодирование видео на стороне клиента
Perceptron

Представляем декодирование видео на стороне клиента

Представляем API Perceptron Multilook
Perceptron

Представляем API Perceptron Multilook

Представляем Isaac 0.5
Perceptron

Представляем Isaac 0.5

Представляем Perceptron Mk1.5
Perceptron

Представляем Perceptron Mk1.5