ReLearn на CVPR 2026: может ли ИИ по-прежнему учиться у людей?

Источник: Lambda•

ReLearn на CVPR 2026: может ли ИИ по-прежнему учиться у людей?

ИИ быстро развивался за счет масштабирования моделей, данных и вычислительных мощностей. По мере того как базовые модели становятся все более способными, возвращается старый вопрос...

ИИ развивался стремительно благодаря масштабированию моделей, данных и вычислительных мощностей. По мере того как фундаментальные модели становятся все более способными, возвращается старый вопрос...

Чему машины все еще должны учиться у человеческого интеллекта?

Этот вопрос оказался в центре воркшопа ReLearn на конференции CVPR 2026, "Rediscovering Intelligence: Can AI Still Learn from Humans?" который Lambda соорганизовала и спонсировала, предоставив вычислительные кредиты для каждой принятой научной работы. Исследователи в области компьютерного зрения, когнитивных наук и воплощенного ИИ собрались вместе, чтобы обсудить, чему человеческий интеллект все еще может научить машины и в каких аспектах машины должны превзойти человеческий проект.

Приглашенными спикерами стали Алексей (Алеша) Эфрос из Университета Калифорнии в Беркли, Манли Ли из Северо-Западного университета, Дима Дамен из Бристольского университета, Алан Юйлл из Университета Джонса Хопкинса, Сайнинг Се из Нью-Йоркского университета и William T. Freeman из Массачусетского технологического института. Их выступления не указали на какой-то один универсальный рецепт для ИИ, вдохновленного человеком. Вместе они проследили сдвиг в том, как исследователи смотрят на интеллект: от того, чему машины должны учиться у людей, до того, как машины должны представлять физический мир и воспринимать его.

Три темы выделялись особенно ярко.

1. Когда ИИ должен учиться у людей?

Эфрос обозначил это противоречие в своем выступлении «Когда полезно учиться у людей?». Его отправная точка прозвучала провокационно: современный ИИ, возможно, уже слишком многому у нас учится.

На высоком уровне фундаментальные модели дистиллируют огромный объем накопленных человеческих знаний. Эфрос назвал их культурными технологиями — системами, созданными на основе знаний, которые люди уже открыли, упорядочили и записали.

Человеческое влияние проявляется и на более низких уровнях стека. Текст поступает с созданной людьми символической структурой, что делает токенизацию относительно простой. Зрение не имеет такого естественного словаря. Даже самоконтролируемое визуальное обучение опирается на разработанные людьми аугментации, которые незаметно определяют, какие изменения должны сохранять смысл.

Таким образом, удаление разметки не устраняет человеческие предположения. Они переходят в представление, аугментацию или целевую функцию обучения.

Человеческий надзор также может обнажить структуры, которые машины все еще упускают. Эфрос обсудил недавнюю работу по оценке перцептивного сходства на основе текстовых подсказок, где люди легко различают разные оттенки «сходства»: позу, цвет, текстуру или идентичность объекта.

Это переосмысляет центральный вопрос воркшопа: где человеческие знания дают правильный индуктивный уклон, а где машины должны находить структуру самостоятельно?

2. Интеллект означает представление мира и его восприятие

Вторая тема проходила красной нитью через несколько выступлений: построить внутреннюю модель мира сложнее, чем просто увидеть его, и то, как система воспринимает мир, может определять то, чему она способна научиться.

Манли Ли подошла к этому через когнитивное развитие в докладе «Как фундаментальные модели строят (и не могут построить) пространственное мышление: взгляд по Пиаже». Опираясь на работы Пиаже, она рассмотрела различные формы пространственного понимания: от топологических отношений до проективных и метрических представлений.

Сайнинг Се сосредоточился на непрерывном визуальном опыте. Люди объединяют частичные виды в целостную картину мира, помнят то, чего не видят в данный момент, и обновляют свои убеждения по мере изменения обстановки. Его примеры показали, насколько трудно моделям до сих пор дается построение глобального пространственного понимания и поддержание постоянного состояния мира на основе того, что они видят.

Выступление Димы Дамен «Переоткрытие интеллекта: почему эгоцентрическое зрение — ваша лучшая отправная точка» добавило еще один ракурс: опыт, на котором обучается интеллект, может иметь не меньшее значение, чем само представление.

Эгоцентрическое зрение предлагает непрерывную запись от первого лица о том, как агент перемещается в своей среде, чего не могут обеспечить коллекции несвязанных изображений и видео из интернета. Дамен связала это с пространственным познанием, обучением на протяжении одной жизни и взаимодействием человека с объектами. С точки зрения первого лица объекты — это то, к чему вы приближаетесь, к чему тянетесь, что подбираете, к чему возвращаетесь и наблюдаете изменения в ответ на ваши действия. Пространство ощущается относительно собственного движения. Опыт связан через время, действие и взаимодействие.

Это предполагает иную модель визуального обучения.

Может ли система учиться на когерентном опыте одной жизни вместо миллиардов несвязанных примеров от множества людей?

Обсуждение Аланом Юйллом системы SpatialReasoner добавило явные 3D-представления, которые связывают восприятие с пространственными вычислениями и рассуждениями. Уильям Т. Фримен, представивший совместно с Эриком Ли работу о генеративных моделях материи, копнул еще глубже: прежде чем рассуждать об объектах, как визуальная система решает, что именно считать постоянным физическим объектом?

В совокупности эти выступления говорят о том, что следующий этап визуального интеллекта может зависеть от усвоения постоянных, структурированных представлений из непрерывного взаимодействия с миром в сочетании с более богатыми признаками изображений.

Это имеет наибольшее значение для физического ИИ. Воплощенный агент должен не просто распознать чашку, но и знать, что она существует независимо, где она находится в трехмерном пространстве, что она все еще там, даже когда скрыта, как люди ее используют и как его собственные действия изменяют сцену.

3. Человеческий интеллект как ориентир

В совокупности эти выступления указывают на более нюансированную роль человеческого интеллекта в ИИ.

  • Человеческое познание дает подсказки о представлении: развитие по Пиаже, о котором говорила Ли, предполагает, что сложное пространственное рассуждение может опираться на структурированные формы пространственного понимания

Человеческое познание дает подсказки о представлении: развитие по Пиаже, о котором говорила Ли, предполагает, что сложное пространственное рассуждение может опираться на структурированные формы пространственного понимания

  • Человеческий опыт дает подсказки об обучении: эгоцентрические исследования Дамен показывают, насколько насыщенным является непрерывный опыт от первого лица, основанный на взаимодействии

Человеческий опыт дает подсказки об обучении: эгоцентрические исследования Дамен показывают, насколько насыщенным является непрерывный опыт от первого лица, основанный на взаимодействии

  • Человеческие способности служат полезными средствами диагностики: примеры Се показывают пространственные навыки и навыки понимания состояния мира, с которыми люди справляются легко, а модели все еще испытывают трудности

Человеческие способности служат полезными средствами диагностики: примеры Се показывают пространственные навыки и навыки понимания состояния мира, с которыми люди справляются легко, а модели все еще испытывают трудности

  • Исследования, вдохновленные человеком, дают подсказки о физической структуре: Юйлл и Фримен исследуют способы восстановления пространственной и физической структуры, скрытой за тем, что видит система

Исследования, вдохновленные человеком, дают подсказки о физической структуре: Юйлл и Фримен исследуют способы восстановления пространственной и физической структуры, скрытой за тем, что видит система

Все это не означает, что ИИ должен копировать человеческое познание. Это возвращает нас к вопросу Эфроса. Человеческие знания могут служить мощным сокращенным путем. Человеческое развитие может подсказать принципы обучения. Человеческий опыт может показать, как связаны восприятие, память и действие. И в то же время человеческие предположения могут ограничивать то, что открывают машины.

Целью может быть поиск того, какие принципы человеческого интеллекта помогают, а какие структуры машины должны открывать самостоятельно.

От масштабирования интеллекта к его структурированию

Прошедшее десятилетие показало, как далеко может зайти обучение за счет масштабирования. ReLearn предполагает, что следующий этап также потребует более глубокого осмысления того, как структурирован интеллект.

Что считается объектом? Как следует представлять пространство? Что система должна запоминать? Чему она может научиться за время непрерывного опыта? Как агент должен поддерживать убеждения о мире, который он видит лишь частично? И какие из этих структур должны быть заданы людьми, а какие — возникнуть в процессе обучения?

Эти вопросы становятся все более актуальными по мере того, как ИИ переходит от распознавания и генерации контента к рассуждениям и действиям в физическом мире.

Компания Lambda выступила соорганизатором и спонсором ReLearn, поскольку эти исследования находятся на стыке фундаментальных моделей, понимания мира и физического ИИ. Работа над ними требует новых идей об интеллекте и вычислительных мощностей для их проверки в широком масштабе.

Семинар: Организаторы семинара: Си Ван, Йен-Лин Куо, Тяньминь Шу, Асен Начков, Алексей Гаврюшин, Ян Чжуан, Чуаньян Цзинь, Цзяньвэнь Се, Люк Ван Гул и Марк Поллефейс

О чём эта статья

Ещё в разделе «AI и машинное обучение»

Все →

Ещё от Lambda