Что такое пространственное мышление?
ИИ выходит за рамки цифрового мира. Следующему поколению систем ИИ необходимо понимать физическое окружение и взаимодействовать с ним — от роботов до автономных систем, ориентирующихся в сложных пространствах.
Этот сдвиг в сторону физического ИИ создает фундаментальную проблему: моделям ИИ требуется нечто большее, чем языковой интеллект и распознавание образов. Им необходимо рассуждать о физическом мире.
Пространственное мышление — это способность понимать трехмерную структуру окружающей среды: где находятся объекты, как они соотносятся друг с другом и какие объекты важны для конкретной задачи.
Если вы попросите робота найти объект рядом со столом и перед занавеской, одного лишь их распознавания будет недостаточно. Он должен понимать их пространственные взаимосвязи, определять, какие объекты важны для выполнения инструкции, и оценивать их положение в пространстве.
Почему пространственное мышление представляет собой сложную задачу?
Несмотря на быстрый прогресс в области больших языковых моделей (LLM) и визуально-языковых моделей (VLM), рассуждения о трехмерной среде остаются сложной задачей.
Обычные LLM могут понимать пространственные понятия, выраженные языком, такие как слева от или позади, но они не наблюдают физическую геометрию напрямую. VLM добавляют визуальное восприятие, однако они формируют свои представления на основе двумерных изображений, привязанных к конкретным точкам обзора. Один и тот же объект может появляться в разных положениях, масштабах и ориентациях в зависимости от ракурса камеры. Модель должна объединить эти наблюдения в целостное понимание исходной трехмерной сцены.
Даже когда трехмерная информация доступна, наличие пространственных данных еще не означает умение эффективно с ними работать. Сложная сцена может содержать множество объектов, в то время как конкретный вопрос затрагивает лишь некоторые из них. Поэтому модель должна решать две задачи одновременно: определять, что важно для текущей задачи, и понимать, как организовано более широкое окружение.
Эти проблемы указывают на две взаимодополняющие возможности для эффективного трехмерного пространственного мышления: локальную фокусную направленность на задачу и глобальную пространственную осведомленность.
В своей работе CVP: Central-Peripheral Vision-Inspired Multimodal Model for Spatial Reasoning, принятой на конференцию WACV 2026, исследователи из Калифорнийского университета в Сан-Диего и Lambda исследуют подход, вдохновленный тем, как люди естественным образом сочетают эти способности.
CVP представляет токен целевой близости (target-affinity token), позволяющий сфокусировать модель на объектах, имеющих отношение к задаче, и аллоцентрическую сетку, обеспечивающую структурированное представление более широкого трехмерного окружения: концентрируйтесь на том, что важно, и помните обо всем остальном.
Обучение на основе центрального и периферического зрения
Человеческое зрение сочетает центральное зрение, которое дает детальную информацию о том, на чем мы сосредоточены, с периферическим зрением, которое поддерживает более широкое осознание окружающей обстановки. CVP переводит этот принцип в два взаимодополняющих механизма для мультимодальных моделей.
1. Центральное зрение: на чем мне следует сосредоточиться?
Трехмерное окружение может содержать множество объектов, но для конкретного вопроса важны лишь немногие. CVP вводит токен целевой близости, который учится идентифицировать эти объекты, релевантные задаче.
В процессе обучения модель проецирует многоракурсные визуальные признаки в общую трехмерную систему координат и объединяет их в представления на уровне объектов. Контрастивная целевая функция побуждает представление целевой близости согласовываться с релевантными объектами и удаляться от нерелевантных.
По сути, модель учится отвечать на вопрос: «Учитывая мою текущую задачу, на чем мне следует сосредоточиться?»
2. Периферическое зрение: как устроено окружение?
Знать, на чем сосредоточиться, — это лишь часть проблемы. Модели также необходимо понимать сцену в целом. CVP представляет аллоцентрическую сетку — компактное представление окружающей среды с высоты птичьего полета. В отличие от эгоцентрического представления, привязанного к конкретной камере, аллоцентрическая сетка представляет объекты с точки зрения, центрированной по отношению к миру.
Преобразуя сетку в лаконичное текстовое представление, CVP делает высокоуровневую пространственную структуру явно доступной для языковой модели, избавляя ее от необходимости полностью реконструировать сцену из необработанных визуальных и геометрических признаков.
Сетка по умолчанию размером 6 x 6 демонстрирует отличные результаты. Увеличение ее разрешения не дает дополнительных преимуществ. Это говорит о том, что эффективное пространственное мышление зависит не только от детальной пространственной информации: правильная абстракция имеет не меньшее значение.
В совокупности эти два механизма решают взаимодополняющие задачи:
- Токен целевой близости: что имеет значение?
- Аллоцентрическая сетка: как организовано окружение?
В сочетании с многоракурсными визуальными токенами и трехмерной позиционной информацией они позволяют модели рассуждать, обладая как локальным фокусом, так и глобальной пространственной осведомленностью.
На следующем рисунке показана архитектура CVP.
CVP создана на базе LLaVA-Video-7B и многоракурсного представления Video-3D-LLM и совместно обучается на пяти наборах данных, охватывающих ответы на вопросы, визуальную привязку (visual grounding) и плотное описание (dense captioning).
Результаты
Команда оценивает CVP на пяти бенчмарках трехмерного зрения и языка, охватывающих ответы на вопросы, визуальную привязку и плотное описание: ScanQA, SQA3D, ScanRefer, Multi3DRefer и Scan2Cap.
Во всех пяти бенчмарках CVP стабильно превосходит базовую модель Video-3D-LLM:
- Для трехмерных ответов на вопросы CVP повышает показатель CIDEr с 102,1 до 107,1 на ScanQA и точность точного совпадения (exact-match) с 58,6 до 62,3 на SQA3D.
Для трехмерных ответов на вопросы CVP повышает показатель CIDEr с 102,1 до 107,1 на ScanQA и точность точного совпадения (exact-match) с 58,6 до 62,3 на SQA3D.
- Для визуальной привязки модель улучшает метрику Acc@0.25 с 58,1 до 62,0 на ScanRefer и F1@0.25 с 58,0 до 60,2 на Multi3DRefer.
Для визуальной привязки модель улучшает метрику Acc@0.25 с 58,1 до 62,0 на ScanRefer и F1@0.25 с 58,0 до 60,2 на Multi3DRefer.
- Для плотного описания CVP увеличивает показатель CIDEr с 83,8 до 90,5 на Scan2Cap.
Для плотного описания CVP увеличивает показатель CIDEr с 83,8 до 90,5 на Scan2Cap.
Эти результаты демонстрируют стабильный прирост в задачах пространственного мышления — от ответов на вопросы о трехмерных сценах до поиска и описания объектов.
На следующем рисунке представлены несколько качественных результатов.
Абляционные эксперименты также показывают, что оба компонента вносят свой вклад в различные аспекты пространственного мышления. Токен целевой близости дает наибольшие преимущества в задачах визуальной привязки, где критически важно идентифицировать объект, релевантный задаче. Аллоцентрическая сетка особенно важна для ответов на вопросы и плотного описания, которые требуют более широкого понимания сцены.
Полученные результаты подкрепляют концепцию, заложенную в основу CVP: центральное зрение помогает определить, что важно, в то время как периферическое зрение обеспечивает более широкий пространственный контекст. В более широком смысле CVP предполагает, что способ представления информации о физическом мире может иметь столь же важное значение, как и объем предоставляемой информации.
Создание моделей пространственного мышления на Lambda
Обучение мультимодальных моделей для трехмерного пространственного мышления объединяет визуальную информацию, множество ракурсов камеры, геометрию камеры, трехмерные координаты и язык в рамках единого конвейера. Совместная обработка этих модальностей увеличивает требования как к вычислительным ресурсам, так и к памяти, что делает быстрое экспериментирование с новыми архитектурами критически важным.
Для CVP исследователи дообучили мультимодальную модель с 7 миллиардами параметров на пяти датасетах 3D-видео-текст, используя 8 графических процессоров NVIDIA A100 Tensor Core, а вычислительные ресурсы предоставила компания Lambda.
По мере того как ИИ расширяется от текста и 2D-изображений до видео, 3D-окружения, робототехники и физического ИИ, исследователям необходима инфраструктура, способная поддерживать эти ресурсоемкие мультимодальные рабочие нагрузки. Lambda предоставляет масштабируемую инфраструктуру графических процессоров для обучения и дообучения мультимодальных базовых моделей и исследования новых архитектур в больших масштабах, помогая исследователям переходить от распознавания того, что находится в мире, к рассуждениям о том, как этот мир устроен.
Статья: https://arxiv.org/pdf/2512.08135Участники: Калифорнийский университет в Сан-Диего, LambdaАвторы: Цзэюань Чэнь, Сян Чжан, Хайян Сюй, Цзяньвэнь Се и Чжоуэнь Ту. WACV 2026.









