Для людей, полагающихся на вспомогательные устройства, важна каждая секунда. Непредсказуемость повседневной среды — например, ребенок, внезапно выбежавший на тротуар, неожиданно появившийся бордюр или упавшая связка ключей — требует мгновенной реакции. Обработка изображений с камер и данных датчиков непосредственно на устройстве, известная как периферийные вычисления (edge computing), позволяет роботизированным платформам мобильности функционировать как отзывчивые инструменты. Эти инструменты должны быть надежными и стабильными в самых разных динамических условиях, в которых живут люди.
В то же время развертывание мощных моделей ИИ, таких как DINOv3 и SAM, на ограниченном аппаратном обеспечении с питанием от аккумулятора создает серьезные инженерные проблемы. При реальном развертывании необходимо учитывать практические факторы, включая время автономной работы, тепловыделение, ненадежное сетевое соединение, а также строгие требования к размеру и весу.
Однако преодоление этих ограничений не имеет смысла для конечного пользователя, если он не может выполнять свои повседневные задачи с помощью этих новых роботизированных систем. Эти новые методы позволяют пользователям взаимодействовать с роботом более естественно, используя окружающую обстановку в качестве контекста, что избавляет как инженеров, так и пользователей от необходимости проектировать и осваивать сложные, трудоемкие интерфейсы. Возможность использовать естественный язык в сочетании с данными изображений для запросов к окружающей среде пользователя и робота, а также для подачи более прямых команд, напрямую снижает когнитивную нагрузку и объем переключения контекста, необходимых пользователю для выполнения такого простого действия, как поднятие чашки со стола.
Эта функциональность уже интегрируется командой RAMMP в их первый прототип. Используются инструменты, созданные на базе DINO, для запросов к датчикам изображения робота с целью обнаружения кнопок автоматических дверей, чашек, а также бордюров и поверхности земли для помощи в навигации. Поскольку эта функциональность теперь готова к тестированию в реальных условиях, инженеры сосредоточились на голосовом и сенсорном вводе, позволяя пользователям выбирать конкретные объекты в своем окружении и взаимодействовать с ними. В дополнение к существующим проблемам обеспечения точности и временной согласованности выходных данных модели, это создает дополнительную задачу обеспечения надежности и предсказуемости при работе с пользовательскими запросами и входными данными.
DINOv3 служит компактным и эффективным «визуальным мозгом» для устройств — это универсальная основа, на которую можно накладывать специализированные легковесные модули для выполнения таких задач, как обнаружение объектов или отслеживание движения, что позволяет повторно использовать визуальные данные и экономить энергию.
Применяя обе модели в рамках разработки робототехнических систем, инженеры оптимизируют их для периферийных устройств, уменьшая объем занимаемой памяти, используя при необходимости более низкую точность и развертывая их в форматах, адаптированных к реальным условиям. Это обеспечивает надежную работу в режиме реального времени для пользователей. Работая с практическим разрешением и эффективной пакетной обработкой, обе модели остаются быстрыми и надежными даже на компактном аппаратном обеспечении с питанием от аккумулятора, используемом в роботизированных платформах мобильности и роботизированных манипуляторах, — иногда жертвуя небольшой точностью границ и/или детализацией признаков ради скорости и стабильности, необходимых пользователям в движении. Этот баланс между точностью и практичностью является центральным элементом философии проекта.
«Для вспомогательной робототехники эффективность измеряется не только точностью по результатам тестов, но и тем, может ли система надежно работать в условиях непредсказуемости повседневной жизни», — сказал Сивашанкар Сивакантан, руководитель аппарата проекта RAMMP. «Запуск таких моделей, как DINOv3 и SAM, непосредственно на устройстве — это то, что обеспечивает восприятие в реальном времени, которому пользователи могут доверять, не полагаясь на сетевое соединение и не ставя под угрозу безопасность».
Система восприятия RAMMP построена на базе RF-DETR, легковесной модели обнаружения, дообученной с использованием эмбеддингов DINOv2. Обучающие данные автоматически размечаются с помощью SAM, что позволяет команде быстро создавать высококачественные аннотации для всего спектра углов, высот, фонов и условий освещения, с которыми вспомогательные устройства сталкиваются в реальном мире. Дополнение данных и стратегии многоракурсного обзора дополнительно обеспечивают согласованность между различными перспективами. Результатом является интеллектуальная, адаптивная система, обеспечивающая более безопасную и уверенную мобильность.
Объединяя возможности разметки SAM с богатыми визуальными представлениями DINOv2 в дообученной модели RF-DETR, RAMMP достигает 360-градусного восприятия окружающей среды в реальном времени и адаптивного обнаружения объектов.







