Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Evolyutsiya llm omni world models
Dev48

© 2026 · All rights reserved.

Эволюция LLM: Omni-World Models

Источник: Reka AI

Эволюция LLM: Omni-World Models

Источник: Reka AI

Reka Labs об omni-world models: единая архитектура, которая принимает текст, изображения, видео и действия, а возвращает текст, изображения, видео и действия — объединяя подходы VLA и world-model для физического ИИ.

27 сентября 2026 г.•Обновлено: 27 сентября 2026 г.

Большие языковые модели (LLM) стали зрелой технологией, способной обслуживать множество продуктов. Однако LLM никогда не были конечной целью; это лишь промежуточный этап. Интеллект, взаимодействующий с физическим миром, требует архитектуры, которая объединяет все возможные входные и выходные данные, где все сенсорные сигналы — язык, изображения, аудио или видео — могут обрабатываться одной и той же архитектурой.

Хотя недавний прогресс в области ИИ в основном заключался в обучении более крупных моделей на больших объемах текстовых данных, этого направления недостаточно, если мы рассматриваем физический мир, где необходимо понимать правила движения и геометрии.

Разрыв между тем, что предлагают LLM, и тем, что необходимо для успешной работы в реальном мире, ставит вопрос о том, как может выглядеть следующая модель. Поэтому мы создаем «omni world models» (универсальные модели мира), которые могут моделировать реальный мир и рассуждать о нем.

Что на самом деле означает «omni»

Наша модель omni — это единая архитектура, которая обрабатывает множество видов входных данных, например, язык, изображения или видео, а также создает множество видов выходных данных, используя одну унифицированную систему, а не оркестрацию различных агентов. Чтобы работать с произвольными известными выходными данными, она должна обрабатывать как дискретные (например, слова в предложении), так и непрерывные сигналы (например, плавные формы волны произнесенного предложения или значения пикселей в изображении).[1] Поэтому наша долгосрочная цель выходит за рамки генерации изображений, видео и аудио в рамках одной архитектуры. Поскольку изображение можно интерпретировать как однокадровое видео, а аудио можно представить в виде спектрограммы (изображения), одна диффузионная модель должна быть способна обрабатывать эти модальности.

Оптимальное моделирование обоих типов сигналов — сложная задача, и большинство существующих архитектур моделируют дискретные сигналы авторегрессионно или используют диффузионный подход для моделирования непрерывных. Хотя ранние гибридные модели показали, что оба подхода могут сосуществовать, создание унифицированной модели мира, готовой к промышленному использованию, — это следующий рубеж ИИ. Именно наличие такой модели делает «omni» особенной.

Чем «omni» отличается от мультимодальных моделей

Вы можете спросить: разве существующие VLM уже не работают с изображениями и языком? Да, но ключ кроется в мультимодальных выходных данных. VLM обычно преобразуют входные сигналы из различных модальностей, таких как изображения или язык, в одну выходную модальность (обычно язык). Рассуждение о визуальных данных — это то, что отличает их от LLM и позволяет использовать их в таких областях, как OCR, здравоохранение или контроль качества. Хотя VLM также могут применяться в робототехнике, их интуитивное понимание физики реального мира остается потенциальным ограничением. Модели Omni обобщают VLM для работы с потенциально произвольными выходными модальностями, хотя наша первоначальная версия специально фокусируется на изображениях, видео, языке и действиях. Другими словами, в то время как VLM обычно работают по схеме «язык, изображение -> язык», наша модель omni работает по схеме «язык, изображение, видео, действия -> язык, изображение, видео, действия».

Omni открывает множество новых возможностей:

Унификация генерации и понимания. Большинство существующих подходов опираются на агентные методы, где изображения понимаются одним компонентом, но генерируются другим. Omni объединяет оба процесса в один, тем самым избегая дорогостоящего «переключения» между моделями или громоздкого взаимодействия между двумя системами, которые никогда не обучались работать вместе.

Общие представления. Подобно VLM, токены изображений, видео или языка проецируются в единое взаимосвязанное представление, где модель может рассуждать обо всем этом одновременно. Грубая аналогия из биологии: наш мозг не разделяет «язык глаз» и «язык ушей». Свет, попадающий на сетчатку, и волна, воздействующая на улитку, преобразуются в одно и то же общее представление: электрохимические сигналы. Таким образом, восприятие унифицировано на стороне ввода. Интересно, что генерация может работать и в обратном направлении. Omni выступает как вычислительная реализация функциональной интеграции, используя общее представление для соединения разнообразных входных и выходных данных; это одна общая комната с множеством дверей внутрь и множеством дверей наружу.

Обработка непрерывных и дискретных сигналов. Дискретные сигналы представляют язык или логику; и то, и другое лежит в основе общения и рассуждений. С другой стороны, непрерывные сигналы ближе к физическому миру: аудио, изображения, видео или конфигурации суставов манипуляторов. Способность моделировать и то, и другое в рамках одной модели создает универсальный холст, на котором модель потенциально может работать во всех областях науки или техники.

«Omni» отличается от агентного ИИ

Существует справедливое возражение против подхода omni. Разве мы не можем достичь того же самого, объединяя в цепочки разных агентов (будь то LLM, VLM или генераторы текста в видео)? Текущая тенденция объединения разных агентов для работы с различными модальностями — это временная заплатка, а не полноценное решение. Явный недостаток такой цепочки — издержки на переключение моделей: это медленнее, так как каждая модель добавляет свою задержку, и дороже, так как за каждую модель нужно платить отдельно. Такой подход также, вероятно, субоптимален, поскольку каждый агент был оптимизирован для своей собственной цели, а не для сотрудничества. Унифицированная архитектура omni структурно устраняет эти неэффективности, обрабатывая мультимодальные рассуждения в рамках единого общего представления вместо вызовов API. Заметим, что обе концепции не являются взаимоисключающими, так как агенты также могут запускать модели omni-world внутри себя.

Технически архитектура omni может выполнять несколько вызовов моделей внутри себя в зависимости от задачи. Однако, поскольку память является общей на уровне скрытых состояний, входной контекст обрабатывается ровно один раз без необходимости перезагрузки кэша. В результате оплата за токены распределяется между выходными данными, а задержка при переключении между модальностями сводится к нулю.

Автономные системы

Нигде эта унификация не является более важной, чем в робототехнике, где системе необходимо видеть, понимать, представлять, планировать и физически действовать, часто в режиме реального времени. В наши дни производные от VLM, так называемые модели «зрение-язык-действие» (VLA), интегрируют восприятие и понимание языка (как входные данные) с действиями робота (как выходные данные); таким образом, роботы могут выполнять действия в неструктурированных и недетерминированных средах, а не полагаться на жесткие правила или детерминированные настройки. Как производные от VLM, VLA естественным образом предлагают рассуждение над входными данными.

Модели «мир-действие» (WAM) предлагают альтернативную парадигму методам, упомянутым выше. Вместо того чтобы отображать входные данные непосредственно в действия, WAM используют фундаментальные модели генерации видео для прогнозирования будущей динамики путем создания видеопоследовательностей из начального кадра вместе с соответствующими действиями. Вкратце, в то время как VLA отображают визуальные входные данные в действия, WAM прогнозируют лежащую в основе физическую эволюцию того, что произойдет дальше.

Наша модель omni-world объединяет архитектуры VLA и WAM в рамках единой основы, предлагая обобщенную структуру, которая интегрирует ключевые возможности обеих. Она использует общий интерфейс, принимая на вход изображения, конфигурации суставов манипуляторов и языковые инструкции, а на выходе выдавая такие действия, как команды двигателям или конфигурации суставов. Благодаря такому дизайну модель сочетает возможности симуляции среды с рассуждением и мультимодальным пониманием.

Обучение на видео. В отличие от традиционных VLA, где сначала LLM дообучаются для работы с изображениями (или отдельными кадрами видео, например, с частотой 1 кадр/с), а затем настраиваются на вывод действий, наша модель обучается представлять видео целиком. Это означает, что модель учитывает временной компонент для лучшего понимания геометрии, движения или физики. Напротив, многие VLA в основном ограничены высокоуровневыми концепциями, присутствующими в видео, такими как распознавание различных категорий (например, «прогулка с собакой» или «поднятие объекта»).

Генерация. Модель может расширять текущее состояние (например, входное изображение, инструкцию, конфигурацию суставов и т. д.) до вероятных будущих состояний (следующие кадры, конфигурации суставов и т. д.). Она также предлагает декодирование следующего кадра на уровне пикселей, что может быть полезно для интерпретации результатов или использования в качестве входных данных для других моделей, например, внешнего критика. Генерация также может использоваться для масштабирования обучающих данных, где могут создаваться редкие, граничные случаи, например, навигация по улицам Лондона во время сильной метели или столкновение с крайне необычными препятствиями, такими как Годзилла, переходящая улицу (что могло бы произойти на Хэллоуин). Это гарантирует, что физическая модель будет более устойчива к событиям вне распределения. Для поддержания высокого качества вывода модель использует структурированные входные данные, например, карты глубины, которые фиксируют движение и геометрию сцены, и предотвращают галлюцинации модели. Благодаря такому подходу модель генерирует разнообразные визуализации одной и той же сцены, что сродни концепции цифрового двойника.

Симуляция. Omni отличается от VLA тем, что она не просто воспринимает и действует, но и предсказывает, как мир будет выглядеть в следующий момент. Это, по сути, позволяет роботам «воображать», что является важной функцией для более безопасного планирования — предсказания последствий собственных действий, основанных на наблюдаемом мире. Более того, наша модель мира может служить движком для создания симулированных сред для обучения агентов внутри моделей мира и способствовать развитию simulation 2.0 или цифровых кочевников.

Планирование. Моделируя будущее и оценивая результаты, модель может «мысленно репетировать» действие и видеть, как мир отреагирует на него, прежде чем совершить его физически. Та же способность конструировать гипотетические ситуации в воображении перед совершением действия является важнейшим компонентом человеческого планирования, где «воображение» — это ключевой элемент мышления о прошлом и будущем. Вместе это создает замкнутый цикл: Наблюдение -> Симуляция -> Критика -> Действие. Благодаря параллельным симуляциям модель может находить действия и планы, которые являются наиболее безопасными и оптимальными. По своей структуре одна и та же модель может быть одновременно критиком и симулятором, что позволяет избежать объединения двух разных агентов и получить выгоду от использования общего представления и снижения задержек.

За пределами робототехники

Хотя нашей основной целью остается разработка фундаментальных архитектур для физического AGI — где робототехника представляет собой конечную область для систем omni, объединяющих восприятие, рассуждение, планирование и физическое действие, которые должны работать вместе в режиме реального времени, — универсальный характер этого единого интерфейса позволяет внедрять его гораздо шире в различных модальностях. Подобно траектории развития LLM, которые начинались как простые чат-боты, но позже стали универсальным движком, способным решать сложные задачи, выраженные в цифровой среде.

В ближайшем будущем эти архитектуры, вероятно, будут служить сложным расширением существующих агентов, предоставляя гораздо более универсальный интерфейс для разнообразных выходных данных. Еще одна возможность лежит в творческой сфере медиа и развлечений. Здесь такие системы могут выступать в качестве мощного инструмента для художников, позволяя быстро итерировать концепции или служить удобным средством для цифровой пересъемки.

Заглядывая в будущее, за пределы робототехники, модели omni реального времени открывают захватывающие долгосрочные возможности в интерактивных медиа, умных носимых устройствах, периферийных вычислениях и пользовательских интерфейсах, которые мы кратко опишем ниже:

  • Интерактивные медиа и сторителлинг: Генерация «на лету» может заложить основу для развлечений следующего поколения, объединяя классический сторителлинг с интерактивностью в реальном времени, генерируемой кадр за кадром по мере развития сюжета

Интерактивные медиа и сторителлинг: Генерация «на лету» может заложить основу для развлечений следующего поколения, объединяя классический сторителлинг с интерактивностью в реальном времени, генерируемой кадр за кадром по мере развития сюжета

  • Носимые технологии и AR: Интеграция этих моделей в устройства, такие как умные очки, обеспечивает мгновенное понимание окружающей среды и визуализацию дополненной реальности в реальном времени.

Носимые технологии и AR: Интеграция этих моделей в устройства, такие как умные очки, обеспечивает мгновенное понимание окружающей среды и визуализацию дополненной реальности в реальном времени.

  • Периферийные вычисления (Edge Deployment): Единые модели omni-world позволяют избежать задержек и высоких вычислительных затрат, связанных с цепочками из нескольких агентов, что является необходимым условием для интеллекта реального времени. Однако, чтобы соответствовать строгим аппаратным ограничениям и ограничениям по памяти, периферийные модели будут полагаться на дистиллированные варианты базовой модели.

Периферийные вычисления (Edge Deployment): Единые модели omni-world позволяют избежать задержек и высоких вычислительных затрат, связанных с цепочками из нескольких агентов, что является необходимым условием для интеллекта реального времени. Однако, чтобы соответствовать строгим аппаратным ограничениям и ограничениям по памяти, периферийные модели будут полагаться на дистиллированные варианты базовой модели.

  • Операционные системы следующего поколения: Объединяя ввод данных, внутренние вычисления и рендеринг в единую структуру, будущие операционные системы смогут нативно интерпретировать жесты, речь и визуальный контекст, а также общаться с нами, используя те же модальности. Кстати, способствуя более естественному взаимодействию с человеком, эти системы обещают гораздо более интуитивный и богатый пользовательский опыт.

Операционные системы следующего поколения: Объединяя ввод данных, внутренние вычисления и рендеринг в единую структуру, будущие операционные системы смогут нативно интерпретировать жесты, речь и визуальный контекст, а также общаться с нами, используя те же модальности. Кстати, способствуя более естественному взаимодействию с человеком, эти системы обещают гораздо более интуитивный и богатый пользовательский опыт.

Универсальный характер единого интерфейса omni позволяет значительно расширить возможности его внедрения, поскольку одно и то же общее представление, которое планирует движения роботизированной руки, может с таким же успехом интерпретировать жесты или синтезировать высококачественный медиаконтент. Однако, несмотря на то что базовая модель является универсальной, для различных приложений могут потребоваться специализированные модели, разработанные на этапе кастомизации после обучения.

В чем подвох: создание моделей omni-world — задача не из легких

Создание передовых моделей с нуля — крайне сложная задача. Она требует сочетания огромных объемов данных, первоклассных специалистов и вычислительных мощностей. Именно поэтому Moonvalley и Reka объединили свои таланты в области VLM и генерации текста в видео для создания Labs. Вместе они разрабатывают свой первый экземпляр модели omni-world, способной моделировать, рассуждать и прогнозировать действия. Таким образом, ее можно рассматривать как развитие как мировых моделей (World Models), так и моделей «зрение-язык-действие» (VLA). Это объединение также отличает нас от других стартапов.

Наша модель обучается с нуля, и мы планируем выпустить первый прототип в ближайшие два месяца, спустя всего около восьми месяцев совместной работы.

Данные. Обучение модели, которая хорошо справляется с генерацией и пониманием, требует данных, удовлетворяющих обеим задачам одновременно. Это большие объемы данных для предварительного обучения, средние объемы более качественных данных для промежуточного обучения, сфокусированные на эгоцентрических видео, и небольшие объемы данных высочайшего качества, предназначенные для конкретных сценариев использования. Это требует создания конвейеров, обработки данных в масштабе и поиска соответствующих видео. Образец нашего набора данных был опубликован в открытом доступе.

Архитектура. Создание универсальной системы, которую можно эффективно обучать задачам понимания и генерации так, чтобы ни одна модальность не ухудшала другую, — это открытая исследовательская проблема. Иными словами, единого мнения о том, как должна выглядеть такая архитектура, не существует, и это требует экспериментов с нашей стороны. Обучение моделей с разными целями также может привести к нестабильности процесса. Мы решаем эту проблему, объединяя экспертов в области генерации и понимания, а также создавая бенчмарки для отслеживания нашего прогресса.

Согласованность мира. В физическом мире, если вы повернетесь на 360 градусов, вы окажетесь в той же точке. Но это может быть не так в случае с моделями «текст-в-видео», где модель постоянно генерирует новый контент. Поддержание долгосрочной согласованности также является сложной задачей для генерации видео, поскольку требует работы с длинным контекстом.

Генерация и понимание в реальном времени. Взаимодействие с окружающей средой требует, чтобы система работала в режиме низкой задержки. Здесь компромисс между скоростью и мощностью становится более очевидным. Модели, которые лучше справляются с генерацией и пониманием, как правило, крупнее и работают с большим количеством токенов, а значит, они медленнее. Поиск правильного баланса — это открытая проблема.

Интуитивная физика. LLM могут быть очень сильны в формальной физике или математике, но те же модели могут испытывать трудности с интуитивным пониманием физики, необходимым для успешной работы в физическом мире. Создание моделей с прочным фундаментом понимания физики так же, как это делаем мы, — следующая задача в создании моделей omni-world.

Общая картина

Заманчиво рассматривать текущую волну агентов, полагающихся на LLM или VLM, как конечную цель истории ИИ. Однако они ближе к середине пути. Это зрелая технология, работающая в языковом или символьном пространстве, которая спровоцировала недавнюю революцию, но они с трудом справляются с движением и интуитивной физикой и ограничены своими выходными данными. В этом духе наша модель omni-world продолжает эту революцию, создавая модели с более общими интерфейсами и более широкими возможностями. Более того, представляя реальное влияние своих действий, модель предлагает лучшую основу для более управляемого согласования с нашими ценностями.

Аналогия с мозгом также имеет смысл: существует единая система, которая может видеть, слышать, осязать, говорить, писать и действовать в физическом мире; все это опирается на общее и взаимосвязанное представление. Правильная архитектура и масштабирование на больших объемах данных потребуют времени. Но направление очевидно: «один разум, много чувств», работающий в физическом мире, вместо «одного разума на каждую модальность», сфокусированного только на цифровой сфере.

Это указывает на будущее, в котором одна унифицированная модель наблюдает за беспорядком в комнате, улавливает физическую динамику падающих объектов и напрямую выполняет физические действия, избегая зависимости от изолированных компонентов, предназначенных для восприятия, рассуждения или физического движения.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Lambda построит новый центр обработки данных в округе Мейс, штат Оклахома, что принесет полмиллиарда долларов налоговых поступлений в течение следующего десятилетия
Lambda

Lambda построит новый центр обработки данных в округе Мейс, штат Оклахома, что принесет полмиллиарда долларов налоговых поступлений в течение следующего десятилетия

Google тестирует возможность покупок на принадлежащей Walmart площадке Flipkart через Gemini и AI Mode в ИндииПресса
Google Gemini

Google тестирует возможность покупок на принадлежащей Walmart площадке Flipkart через Gemini и AI Mode в Индии

OpenAI расширяет проверку поведения моделей после появления новых инцидентов с несанкционированными агентами
Пресса
OpenAI

OpenAI расширяет проверку поведения моделей после появления новых инцидентов с несанкционированными агентами

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple WatchПресса
Apple

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple Watch

Незащищенные агенты OpenAI опубликовали 53 пользовательских изображения в интернете без ведома лабораторииПресса
OpenAI

Незащищенные агенты OpenAI опубликовали 53 пользовательских изображения в интернете без ведома лаборатории

Proaction увеличивает продажи на 60% и экономит более 75 часов с Codex
OpenAI

Proaction увеличивает продажи на 60% и экономит более 75 часов с Codex

Ещё от Reka AI

За пределами распознавания: как наши модели рассуждают о видео
Reka AI

За пределами распознавания: как наши модели рассуждают о видео

RekaDaily-10k: сбор более 10 000 часов эгоцентрических данных о манипуляциях в домашних условиях
Reka AI

RekaDaily-10k: сбор более 10 000 часов эгоцентрических данных о манипуляциях в домашних условиях

Генерация видео в реальном времени
Reka AI

Генерация видео в реальном времени

Reka EdgeQ, На устройстве
Reka AI

Reka EdgeQ, На устройстве