Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Za predelami raspoznavaniya kak nashi modeli rassuzhdayut o video
Dev48

© 2026 · All rights reserved.

За пределами распознавания: как наши модели рассуждают о видео

Источник: Reka AI

За пределами распознавания: как наши модели рассуждают о видео

Источник: Reka AI

В этой статье мы рассматриваем четыре типа рассуждений, которые выполняют наши модели, с реальными результатами на основе реальных видеозаписей для каждого из них, и заканчиваем тем, что считаем не менее важным: эти рассуждения созданы для работы на периферии, на устройствах, где установлены камеры.

27 сентября 2026 г.•Обновлено: 27 сентября 2026 г.

Создание всеобъемлющей модели мира — это нечто большее, чем просто генерация правдоподобного видео. Модель должна знать не только то, что представляет собой объект, но и где он находится (в пространстве и времени). Именно это дают модели мира пространственные и временные рассуждения: основу для действий, а не просто для описания.

Большинство моделей уже могут сказать вам, что на экране мотоцикл, человек или сумка. Ответы, которые действительно нужны людям, — это следующие выводы: где именно это находится, что произошло с течением времени, кто это и имеет ли это значение.

В этой статье мы рассмотрим четыре типа рассуждений, которые выполняют наши модели, с реальными результатами на реальных кадрах для каждого из них, и закончим тем, что мы считаем не менее важным: эти рассуждения созданы для работы на периферии, на устройствах, где установлены камеры.

Точное видение: пространственное обоснование

Полезные рассуждения начинаются с понимания того, где именно находятся объекты, а не просто того, что они существуют. Наши модели обучены для точного определения местоположения: при получении инструкции с открытым словарем, такой как «Обнаружить: красная машина, мужчина в шляпе», Reka Edge возвращает ограничивающие рамки для каждого совпадения, и то же самое обоснование распространяется на маски сегментации с точностью до пикселя. Приведенные ниже маски — это результат работы модели на телевизионных кадрах, достаточно точный для создания композитных эффектов, которые в противном случае пришлось бы ротоскопировать вручную:

Обоснование с такой точностью — это то, что нужно для робототехники, автомобильной промышленности и приложений визуального поиска, и это возможность, которую мы оцениваем напрямую: Reka Edge набирает ~93.01 на RefCOCO-A, опережая 81.46 у Gemini 3 Pro, при значительно меньшем размере. Qwen-VL-8B-Instruct набирает немного больше на обоих наборах RefCOCO. Разрыв, который здесь имеет значение, — это размер, а не лидерство в рейтинге.

Отслеживание времени: временные рассуждения

Кадр говорит вам, что видно. Только последовательность говорит вам, что происходит. Наши модели рассуждают во времени: они могут находить длительные действия, такие как сборка стола в часах видеозаписей, отвечать на вопросы, привязанные к меткам времени, например, что произошло между второй и третьей минутой, и превращать необработанное видео в хронологию каждого субъекта, показывающую, когда именно каждый субъект находится на экране:

Временные рассуждения — это то, на чем обычно ломаются небольшие модели. Reka Edge набирает ~72.31 на MLVU и ~72.80 на MMVU, что примерно вдвое больше, чем у Cosmos Reason 2, и явно опережает Qwen-VL-8B-Instruct, приближаясь к Gemini 3 Pro, ведущим бенчмаркам понимания длинных видео.

Знание того, кто есть кто: идентификация как вывод

Самый сложный вопрос в видео — «кто это?», задаваемый непрерывно при смене ракурсов камеры, перекрытиях и почти идентичной внешности. Идентификация — это не обнаружение. Это вывод, собранный из слабых сигналов: эмбеддингов внешности, доказательств, накопленных по каждому клипу, в котором появляется субъект, оппортунистического считывания чисел или текста, агрегированного путем голосования, и контекстных ограничений, таких как известный список участников и тот факт, что два субъекта в одном кадре не могут иметь одну и ту же личность.

Мы провели стресс-тестирование этого на профессиональных кадрах трансляций автоспорта, что близко к худшему сценарию: двадцать субъектов на высокой скорости, где товарищи по команде ездят на визуально идентичных машинах, а модели «зрение-язык», которым предоставлен полный список участников, не могут их разделить. На замороженном, предварительно зарегистрированном бенчмарке кадров, которые модель никогда не видела, составной конвейер называет участников только по пикселям с точностью 90.9% по критерию top-1 (92.4% макро, 95% интервал Уилсона [76.4%, 96.9%]), с оценкой «оставь один клип вне выборки», чтобы запрашиваемый клип никогда не находился в собственной справочной галерее конкурента. Преимущество над базовым уровнем в 39.6% было достигнуто за счет гигиены оценки и изменений в алгоритме сопоставления, а не за счет увеличения моделей.

Честные оговорки: эти результаты получены за один уик-энд соревнований, отслеживание ухудшается на удаленных кадрах с воздуха, а товарищи по команде в идентичной ливрее остаются самым сложным случаем.

Тот же механизм масштабируется от именования двадцати конкурентов до управления толпами из тысяч человек. Плотность толпы на железнодорожной станции звучит как задача на подсчет, но полезная аналитика толпы — это проблема идентификации: подсчет 23 человек в одном кадре не может сказать, освобождается платформа или заполняется. Непрерывное отслеживание может, потому что, когда каждый пассажир сохраняет стабильную идентичность в разных кадрах и камерах, система знает, как долго ждет каждый человек, освободилась ли платформа между поездами и куда движется толпа. В этом разница между числом на панели мониторинга и сигналом, на который может отреагировать оператор, например, направив персонал до того, как скопление людей станет опасным.

Оценка того, что важно: аномалии и намерения

Последний тип рассуждений — это суждение: большая часть того, что видит камера, является рутиной, и ценность заключается в распознавании момента, который таковым не является. Это требует объединения трех других типов. Открывающаяся дверь — это нормально. Та же дверь, открывающаяся в 3 часа ночи, за которой следует человек, скрывающий свое лицо, — это аномалия, и чтобы отличить их, требуется совместная работа пространственных, временных и идентификационных рассуждений. В SmartHome-Bench, бенчмарке видеоаномалий, разработанном Wyze и охватывающем семь категорий от событий безопасности до дикой природы, наши модели установили лидирующий результат там, где конкуренты галлюцинируют события, упускают временной контекст или не могут объяснить, почему событие является аномальным.

Пример:

То же суждение применимо и за пределами дома. На железнодорожном транспорте аномалии, которые имеют наибольшее значение, — это угрозы безопасности: нож или другое оружие, появляющееся в толпе, драка на платформе, пассажир, поскользнувшийся и упавший при посадке, человек, перелезающий через двери платформы в зону путей. Каждое из них редко, разворачивается за секунды, и их пропуск обходится дорого. Каждое из них также является композицией других типов рассуждений: обнаружение оружия — это пространственное обоснование, отличие драки от приветствия требует временного контекста, а знание того, что кто-то пересек запретную зону, означает отслеживание его до момента совершения действия.

Достаточно компактно, чтобы работать там, где установлены камеры

Способность к рассуждению мало что значит, если ее нельзя развернуть. Reka Edge, наша языковая модель зрения с 7 миллиардами параметров, разработанная для физического ИИ, создана для того, чтобы принести этот вид рассуждений на устройство: пространственное обоснование, временное понимание и суждение об аномалиях в одной модели. Сверточный визуальный энкодер создает всего 64 токена на фрагмент изображения, примерно в 3 раза меньше, чем у сопоставимых моделей для изображения 1024x1024, что трансформируется в пропускную способность 5.46 изображений в секунду и время до первого токена 0.522 секунды. С 4-битным квантованием объем памяти сокращается с 13 ГБ до 5 ГБ при сохранении более 98% производительности, поэтому те же рассуждения работают на NVIDIA Jetson, Apple Silicon, а также телефонах и носимых устройствах Snapdragon, а не только в облаке.

Те же рассуждения, везде, где следят камеры

Ничто в этом стеке не является специфичным для гоночных трасс или гостиных. Ингредиенты универсальны: точное позиционирование, данные, накопленные с течением времени и с разных камер, сохранение идентификации в условиях неопределенности и суждение о том, что заслуживает внимания. Среды с высокой проходимостью, такие как железнодорожные вокзалы, являются естественной областью применения. Сотни пассажиров в похожей одежде пересекают десятки зон обзора камер, и вопросы, которые задает оператор, охватывают все четыре типа рассуждений: где находится оставленная без присмотра сумка, когда она была оставлена, является ли это тем же человеком, который ее оставил, и имеет ли это значение. Мы готовим публичную демонстрацию в этих условиях.

Мы будем публиковать больше материалов по этой работе по мере ее развития. Чтобы следить за обновлениями, присоединяйтесь к нашему Discord, или узнавайте последние новости о Reka здесь https://reka.ai/news

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Lambda построит новый центр обработки данных в округе Мейс, штат Оклахома, что принесет полмиллиарда долларов налоговых поступлений в течение следующего десятилетия
Lambda

Lambda построит новый центр обработки данных в округе Мейс, штат Оклахома, что принесет полмиллиарда долларов налоговых поступлений в течение следующего десятилетия

Google тестирует возможность покупок на принадлежащей Walmart площадке Flipkart через Gemini и AI Mode в ИндииПресса
Google Gemini

Google тестирует возможность покупок на принадлежащей Walmart площадке Flipkart через Gemini и AI Mode в Индии

OpenAI расширяет проверку поведения моделей после появления новых инцидентов с несанкционированными агентами
Пресса
OpenAI

OpenAI расширяет проверку поведения моделей после появления новых инцидентов с несанкционированными агентами

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple WatchПресса
Apple

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple Watch

Незащищенные агенты OpenAI опубликовали 53 пользовательских изображения в интернете без ведома лабораторииПресса
OpenAI

Незащищенные агенты OpenAI опубликовали 53 пользовательских изображения в интернете без ведома лаборатории

Proaction увеличивает продажи на 60% и экономит более 75 часов с Codex
OpenAI

Proaction увеличивает продажи на 60% и экономит более 75 часов с Codex

Ещё от Reka AI

RekaDaily-10k: сбор более 10 000 часов эгоцентрических данных о манипуляциях в домашних условиях
Reka AI

RekaDaily-10k: сбор более 10 000 часов эгоцентрических данных о манипуляциях в домашних условиях

Генерация видео в реальном времени
Reka AI

Генерация видео в реальном времени

Эволюция LLM: Omni-World Models
Reka AI

Эволюция LLM: Omni-World Models

Reka EdgeQ, На устройстве
Reka AI

Reka EdgeQ, На устройстве