Для людей, зависящих от вспомогательных устройств, на счету каждая секунда. Непредсказуемый характер повседневной среды — например, ребенок, выбежавший на тротуар, внезапно появившийся бордюр или упавшие ключи — требует немедленной реакции. Обработка изображений с камер и данных датчиков непосредственно на устройстве, известная как периферийные вычисления, позволяет роботизированным платформам мобильности работать в качестве быстро реагирующих инструментов. Эти инструменты должны быть надежными и стабильными в самых разных динамических условиях, в которых живут люди.
В то же время развертывание мощных ИИ-моделей, таких как DINOv3 и SAM, на ограниченном оборудовании с питанием от батарей сопряжено со значительными инженерными трудностями. При внедрении в реальных условиях необходимо учитывать практические факторы, включая время автономной работы, тепловыделение, ненадежное сетевое подключение, а также строгие требования к размеру и весу.
Однако преодоление этих ограничений не имеет никакого значения для конечного пользователя, если он не может выполнять свои повседневные задачи с помощью этих новых роботизированных систем. Эти новейшие методы позволяют пользователям взаимодействовать с роботом более естественным образом, используя свое непосредственное окружение в качестве контекста, освобождая как инженеров, так и пользователей от необходимости разрабатывать сложные и трудоемкие интерфейсы и ориентироваться в них. Возможность использовать естественный язык в сочетании с данными изображений для запроса информации об окружении пользователя и робота и выдачи более прямых команд напрямую снижает когнитивную нагрузку и объем переключения контекста, необходимые пользователю для выполнения столь простой задачи, как поднятие чашки со стола.
Эта функциональность уже интегрируется командой RAMMP в их первый прототип. Используются инструменты, созданные на базе DINO, для отправки запросов к датчам изображения робота с целью обнаружения кнопок автоматических дверей, чашек и бордюров/земли для помощи в навигации. Поскольку эта функциональность теперь готова к тестированию в реальных условиях, инженеры сосредоточились на голосовом и сенсорном вводе, позволяя пользователям выбирать конкретные объекты в своем окружении и взаимодействовать с ними. В дополнение к существующим задачам по обеспечению точности и временной когерентности результатов работы модели, это ставит дополнительную задачу по обеспечению надежности и предсказуемости ответов на запросы и ввод пользователя.
DINOv3 служит компактным, эффективным «визуальным мозгом» для устройств — универсальной основой, на которую можно накладывать легковесные модули под конкретные задачи, такие как обнаружение объектов или отслеживание движения, что позволяет повторно использовать визуальные данные и экономить энергию.
Применяя обе модели в рамках разработки робототехнических систем, инженеры оптимизируют их для периферийных устройств: уменьшают объем памяти, используют более низкую точность, когда это уместно, и развертывают в форматах, адаптированных под реальные условия. Это обеспечивает надежную работу пользователей в реальном времени. Работая при практических разрешениях и с эффективной пакетной обработкой, обе модели остаются быстрыми и надежными даже на компактном оборудовании с батарейным питанием, используемом в роботизированных платформах мобильности и роботизированных руках, — иногда жертвуя небольшой точностью границ и/или детализацией ради скорости и стабильности, необходимых пользователям в движении. Этот баланс между точностью и практичностью является основой философии проекта.
«В вспомогательной робототехнике производительность измеряется не только точностью по бенчмаркам, но и тем, способна ли система надежно работать в условиях непредсказуемости повседневной жизни, — сказал Сивашанкар Сивакантан, руководитель аппарата проекта RAMMP. — Запуск таких моделей, как DINOv3 и SAM, непосредственно на устройстве — это то, что обеспечивает восприятие в реальном времени, которому пользователи могут доверять, не полагаясь на подключение к сети и не жертвуя безопасностью».
Система восприятия RAMMP построена на базе RF-DETR, легковесной модели обнаружения, дообученной с использованием эмбеддингов DINOv2. Данные для обучения автоматически размечаются с помощью SAM, что позволяет команде быстро создавать высококачественные аннотации для всего спектра углов, высот, фонов и условий освещения, с которыми вспомогательные устройства сталкиваются в реальном мире. Аугментация данных и стратегии многоракурсности дополнительно обеспечивают согласованность с разных точек зрения. Результатом является интеллектуальная, адаптивная система, которая предлагает более безопасную и уверенную мобильность.
Сочетая возможности разметки SAM с богатыми визуальными представлениями DINOv2 в дообученной модели RF-DETR, RAMMP обеспечивает 360-градусное восприятие окружающей среды в реальном времени и адаптивное обнаружение объектов.










