Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Sozdanie multimodalnyh modeley dlya prostranstvennogo myshleniya
Dev48

© 2026 · All rights reserved.

Создание мультимодальных моделей для пространственного мышления

Источник: Lambda

Создание мультимодальных моделей для пространственного мышления

Источник: Lambda

Что такое пространственное мышление? ИИ выходит за рамки цифрового мира. Следующему поколению систем ИИ необходимо понимать физическое окружение и взаимодействовать с ним — от роботов до автономных систем, ориентирующихся в сложных пространствах.

25 сентября 2026 г.

Что такое пространственное мышление?

ИИ выходит за рамки цифрового мира. Следующему поколению систем ИИ необходимо понимать физическое окружение и взаимодействовать с ним — от роботов до автономных систем, ориентирующихся в сложных пространствах.

Этот сдвиг в сторону физического ИИ создает фундаментальную проблему: моделям ИИ требуется нечто большее, чем языковой интеллект и распознавание образов. Им необходимо рассуждать о физическом мире.

Пространственное мышление — это способность понимать трехмерную структуру окружающей среды: где находятся объекты, как они соотносятся друг с другом и какие объекты важны для конкретной задачи.

Если вы попросите робота найти объект рядом со столом и перед занавеской, одного лишь их распознавания будет недостаточно. Он должен понимать их пространственные взаимосвязи, определять, какие объекты важны для выполнения инструкции, и оценивать их положение в пространстве.

Почему пространственное мышление представляет собой сложную задачу?

Несмотря на быстрый прогресс в области больших языковых моделей (LLM) и визуально-языковых моделей (VLM), рассуждения о трехмерной среде остаются сложной задачей.

Обычные LLM могут понимать пространственные понятия, выраженные языком, такие как слева от или позади, но они не наблюдают физическую геометрию напрямую. VLM добавляют визуальное восприятие, однако они формируют свои представления на основе двумерных изображений, привязанных к конкретным точкам обзора. Один и тот же объект может появляться в разных положениях, масштабах и ориентациях в зависимости от ракурса камеры. Модель должна объединить эти наблюдения в целостное понимание исходной трехмерной сцены.

Даже когда трехмерная информация доступна, наличие пространственных данных еще не означает умение эффективно с ними работать. Сложная сцена может содержать множество объектов, в то время как конкретный вопрос затрагивает лишь некоторые из них. Поэтому модель должна решать две задачи одновременно: определять, что важно для текущей задачи, и понимать, как организовано более широкое окружение.

Эти проблемы указывают на две взаимодополняющие возможности для эффективного трехмерного пространственного мышления: локальную фокусную направленность на задачу и глобальную пространственную осведомленность.

В своей работе CVP: Central-Peripheral Vision-Inspired Multimodal Model for Spatial Reasoning, принятой на конференцию WACV 2026, исследователи из Калифорнийского университета в Сан-Диего и Lambda исследуют подход, вдохновленный тем, как люди естественным образом сочетают эти способности.

CVP представляет токен целевой близости (target-affinity token), позволяющий сфокусировать модель на объектах, имеющих отношение к задаче, и аллоцентрическую сетку, обеспечивающую структурированное представление более широкого трехмерного окружения: концентрируйтесь на том, что важно, и помните обо всем остальном.

Обучение на основе центрального и периферического зрения

Человеческое зрение сочетает центральное зрение, которое дает детальную информацию о том, на чем мы сосредоточены, с периферическим зрением, которое поддерживает более широкое осознание окружающей обстановки. CVP переводит этот принцип в два взаимодополняющих механизма для мультимодальных моделей.

1. Центральное зрение: на чем мне следует сосредоточиться?

Трехмерное окружение может содержать множество объектов, но для конкретного вопроса важны лишь немногие. CVP вводит токен целевой близости, который учится идентифицировать эти объекты, релевантные задаче.

В процессе обучения модель проецирует многоракурсные визуальные признаки в общую трехмерную систему координат и объединяет их в представления на уровне объектов. Контрастивная целевая функция побуждает представление целевой близости согласовываться с релевантными объектами и удаляться от нерелевантных.

По сути, модель учится отвечать на вопрос: «Учитывая мою текущую задачу, на чем мне следует сосредоточиться?»

2. Периферическое зрение: как устроено окружение?

Знать, на чем сосредоточиться, — это лишь часть проблемы. Модели также необходимо понимать сцену в целом. CVP представляет аллоцентрическую сетку — компактное представление окружающей среды с высоты птичьего полета. В отличие от эгоцентрического представления, привязанного к конкретной камере, аллоцентрическая сетка представляет объекты с точки зрения, центрированной по отношению к миру.

Преобразуя сетку в лаконичное текстовое представление, CVP делает высокоуровневую пространственную структуру явно доступной для языковой модели, избавляя ее от необходимости полностью реконструировать сцену из необработанных визуальных и геометрических признаков.

Сетка по умолчанию размером 6 x 6 демонстрирует отличные результаты. Увеличение ее разрешения не дает дополнительных преимуществ. Это говорит о том, что эффективное пространственное мышление зависит не только от детальной пространственной информации: правильная абстракция имеет не меньшее значение.

В совокупности эти два механизма решают взаимодополняющие задачи:

  • Токен целевой близости: что имеет значение?
  • Аллоцентрическая сетка: как организовано окружение?

В сочетании с многоракурсными визуальными токенами и трехмерной позиционной информацией они позволяют модели рассуждать, обладая как локальным фокусом, так и глобальной пространственной осведомленностью.

На следующем рисунке показана архитектура CVP.

CVP создана на базе LLaVA-Video-7B и многоракурсного представления Video-3D-LLM и совместно обучается на пяти наборах данных, охватывающих ответы на вопросы, визуальную привязку (visual grounding) и плотное описание (dense captioning).

Результаты

Команда оценивает CVP на пяти бенчмарках трехмерного зрения и языка, охватывающих ответы на вопросы, визуальную привязку и плотное описание: ScanQA, SQA3D, ScanRefer, Multi3DRefer и Scan2Cap.

Во всех пяти бенчмарках CVP стабильно превосходит базовую модель Video-3D-LLM:

  • Для трехмерных ответов на вопросы CVP повышает показатель CIDEr с 102,1 до 107,1 на ScanQA и точность точного совпадения (exact-match) с 58,6 до 62,3 на SQA3D.

Для трехмерных ответов на вопросы CVP повышает показатель CIDEr с 102,1 до 107,1 на ScanQA и точность точного совпадения (exact-match) с 58,6 до 62,3 на SQA3D.

  • Для визуальной привязки модель улучшает метрику Acc@0.25 с 58,1 до 62,0 на ScanRefer и F1@0.25 с 58,0 до 60,2 на Multi3DRefer.

Для визуальной привязки модель улучшает метрику Acc@0.25 с 58,1 до 62,0 на ScanRefer и F1@0.25 с 58,0 до 60,2 на Multi3DRefer.

  • Для плотного описания CVP увеличивает показатель CIDEr с 83,8 до 90,5 на Scan2Cap.

Для плотного описания CVP увеличивает показатель CIDEr с 83,8 до 90,5 на Scan2Cap.

Эти результаты демонстрируют стабильный прирост в задачах пространственного мышления — от ответов на вопросы о трехмерных сценах до поиска и описания объектов.

На следующем рисунке представлены несколько качественных результатов.

Абляционные эксперименты также показывают, что оба компонента вносят свой вклад в различные аспекты пространственного мышления. Токен целевой близости дает наибольшие преимущества в задачах визуальной привязки, где критически важно идентифицировать объект, релевантный задаче. Аллоцентрическая сетка особенно важна для ответов на вопросы и плотного описания, которые требуют более широкого понимания сцены.

Полученные результаты подкрепляют концепцию, заложенную в основу CVP: центральное зрение помогает определить, что важно, в то время как периферическое зрение обеспечивает более широкий пространственный контекст. В более широком смысле CVP предполагает, что способ представления информации о физическом мире может иметь столь же важное значение, как и объем предоставляемой информации.

Создание моделей пространственного мышления на Lambda

Обучение мультимодальных моделей для трехмерного пространственного мышления объединяет визуальную информацию, множество ракурсов камеры, геометрию камеры, трехмерные координаты и язык в рамках единого конвейера. Совместная обработка этих модальностей увеличивает требования как к вычислительным ресурсам, так и к памяти, что делает быстрое экспериментирование с новыми архитектурами критически важным.

Для CVP исследователи дообучили мультимодальную модель с 7 миллиардами параметров на пяти датасетах 3D-видео-текст, используя 8 графических процессоров NVIDIA A100 Tensor Core, а вычислительные ресурсы предоставила компания Lambda.

По мере того как ИИ расширяется от текста и 2D-изображений до видео, 3D-окружения, робототехники и физического ИИ, исследователям необходима инфраструктура, способная поддерживать эти ресурсоемкие мультимодальные рабочие нагрузки. Lambda предоставляет масштабируемую инфраструктуру графических процессоров для обучения и дообучения мультимодальных базовых моделей и исследования новых архитектур в больших масштабах, помогая исследователям переходить от распознавания того, что находится в мире, к рассуждениям о том, как этот мир устроен.

Статья: https://arxiv.org/pdf/2512.08135Участники: Калифорнийский университет в Сан-Диего, LambdaАвторы: Цзэюань Чэнь, Сян Чжан, Хайян Сюй, Цзяньвэнь Се и Чжоуэнь Ту. WACV 2026.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Tesla готовится к масштабному производству тяжелых грузовиков Semi с открытием завода в НевадеПресса
Tesla

Tesla готовится к масштабному производству тяжелых грузовиков Semi с открытием завода в Неваде

Waymo быстро масштабируется. Вот что показывают данные автопарка.Пресса
Waymo

Waymo быстро масштабируется. Вот что показывают данные автопарка.

Meta опережает OpenAI на рынке потребительских ИИ-устройств, но стратегия Цукерберга пока не доказала свою эффективность
Пресса
OpenAI

Meta опережает OpenAI на рынке потребительских ИИ-устройств, но стратегия Цукерберга пока не доказала свою эффективность

Скучный ИИ: почему ваш погрузчик важнее вашего чат-бота
DataRobot

Скучный ИИ: почему ваш погрузчик важнее вашего чат-бота

Генеральный директор ElevenLabs — о маржинальности, сроках IPO и предупреждении клиентов о том, что они говорят с ботомПресса
ElevenLabs

Генеральный директор ElevenLabs — о маржинальности, сроках IPO и предупреждении клиентов о том, что они говорят с ботом

Google тестирует функцию вызовов бизнеса с помощью GeminiПресса
Google Gemini

Google тестирует функцию вызовов бизнеса с помощью Gemini

Ещё от Lambda

От структур к динамике: масштабирование ИИ для молекулярной динамики в разработке лекарств
Lambda

От структур к динамике: масштабирование ИИ для молекулярной динамики в разработке лекарств

Замкнуть цикл: агентная оценка для базовых моделей редактирования изображений
Lambda

Замкнуть цикл: агентная оценка для базовых моделей редактирования изображений

MLPerf Inference v6.1: первые агентные бенчмарки и бенчмарки VLM
Lambda

MLPerf Inference v6.1: первые агентные бенчмарки и бенчмарки VLM

Lambda подписала обязательство Белого дома по защите потребителей электроэнергии, подтвердив приверженность интересам местных сообществ и надежности энергосистемы
Lambda

Lambda подписала обязательство Белого дома по защите потребителей электроэнергии, подтвердив приверженность интересам местных сообществ и надежности энергосистемы