Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Kadry plany i stseny strukturirovanie video dlya rabochih protsessov ii
Dev48

© 2026 · All rights reserved.

Кадры, планы и сцены: структурирование видео для рабочих процессов ИИ

Источник: Mux

Кадры, планы и сцены: структурирование видео для рабочих процессов ИИ

Источник: Mux

При разработке решений на базе ИИ для каждого вопроса о видео требуется свой фрагмент. Узнайте, как выбирать нужные части и когда их объединять.

25 сентября 2026 г.

Я вырос, катаясь на лыжах, и с каждой осенью начинаю с нетерпением ждать зимы. Я обдумываю, где можно покататься, какие поездки удастся осуществить и как скоро выпадет снег. Это предвкушение возвращает меня к лыжным фильмам, которые я смотрел в детстве, а также к любимым лентам, найденным позже. Кандид Товекс всегда был в моем списке для просмотра. А к фильму Маркуса Эдера «The Ultimate Run» я в последнее время возвращаюсь особенно часто.

Это десять минут катания на лыжах, смонтированных так, будто это один невероятный спуск. Эдер перемещается от высокогорного пухляка через ледники, скалы, сноупарк, замок и кузов грузовика, прежде чем достичь дна долины. Все это выглядит как единый лыжный заезд.

Большую часть этого года я работал над Mux Robots, размышляя о том, как системы ИИ взаимодействуют с видео. Когда лыжный сезон снова начал занимать мои мысли, эти две темы пересеклись. «The Ultimate Run» оказался отличным способом объяснить то, что мы создавали. Одно и то же видео выглядит совершенно по-разному в зависимости от вопроса, на который должен ответить рабочий процесс.

Для системы ИИ, анализирующей «The Ultimate Run», не существует единого метода разбивки видео, подходящего для любого вопроса. Чтобы найти момент, когда Эдер совершает самый высокий прыжок, используйте кадр. Чтобы определить момент смены ракурса камеры, используйте план. Чтобы найти всю последовательность с ледником, используйте сцену.

Это те строительные блоки, которые мы используем в Mux, чтобы сделать рабочие процессы видео-ИИ более целенаправленными и эффективными. Используя «The Ultimate Run» в качестве постоянного примера, мы рассмотрим, что фиксирует каждый блок, когда его использовать и как они работают вместе.

Начните с вопроса

Часовое видео с частотой 30 кадров в секунду содержит 108 000 кадров. Передача каждого изображения в модель компьютерного зрения была бы медленной и дорогой. Большая часть работы уходила бы на многократный анализ кадров, которые не добавляют ничего нового для ответа.

Это была одна из первых проблем, которую нам пришлось решить при создании Mux Robots. Прежде чем модель сможет ответить на вопрос о видео, мы должны решить, какую его часть ей нужно увидеть. Выбор полезного фрагмента видео заранее упрощает задачу. Кадры и планы дают рабочим процессам сфокусированные визуальные входные данные. Сцены группируют отрезки, которые связаны по смыслу, а не только по внешнему виду. Моменты и главы превращают это понимание в результаты, предназначенные для зрителя.

Цель состоит в том, чтобы предоставить модели как можно меньший объем видео, сохранив при этом достаточно контекста для ответа на вопрос.

Вот как это выглядит на примере «The Ultimate Run»:

Вопрос

Что использовать

Что это дает

На каком изображении Эдер совершает самый высокий прыжок?

Кадр

Одно изображение в определенный момент времени

Где произошла склейка с переходом на новый ракурс?

План

Непрерывная съемка между монтажными склейками

Где начинается и заканчивается последовательность с ледником?

Сцена

Цельный визуальный или повествовательный фрагмент

Какая часть убедит моих друзей забронировать поездку?

Момент

Избирательный фрагмент для зрителя

К какому разделу я хочу вернуться?

Глава

Именованный раздел длинного видео

В какой части он проезжает через ледяной туннель?

Поиск на основе эмбеддингов

Результат, найденный по смыслу

Когда достаточно одного мгновения, используйте кадр

Один кадр может ответить на множество вопросов. Кто на экране? Виден ли логотип? Какой текст появился? На каком изображении Эдер совершает самый высокий прыжок?

Mux Robots использует кадры для задач, где ответ содержится в одном изображении. Функция Find Best Thumbnails оценивает кадры-кандидаты по композиции, четкости, лицам, заметным действиям и другим признакам, которые помогают изображению работать самостоятельно. Модерация анализирует отдельные кадры на протяжении всего видео на предмет визуальных сигналов, таких как нагота или насилие.

Творческие интерпретации того, что выдал бы Mux Robots, потому что, ну, авторские права.

«Лучший» кадр также зависит от того, кто его увидит и для чего он нужен. Лыжника может интересовать масштаб прыжка, сложность трассы или положение тела Эдера в воздухе. Тот, кто не катается на лыжах, может больше отреагировать на пейзаж или общую композицию. Find Best Thumbnail поддерживает настройку вывода в зависимости от аудитории и цели (как и все наши рабочие процессы), поэтому система может учитывать эти предпочтения при оценке кандидатов.

Кадр становится плохим выбором, когда ответ зависит от последовательности или тайминга. Одно изображение может показать Эдера в середине вращения, но оно не скажет нам, приземлился ли он. Кадр может показать его внутри ледника, но не то, как он туда попал или откуда выехал. Выборка большего количества кадров покрывает некоторые из этих пробелов, но стоимость и задержка растут с каждым изображением. Меньший набор кадров, выбранных по определенной причине, обычно дает модели более качественные входные данные, чем большая равномерная выборка.

Когда картинка меняется, используйте план

План — это непрерывная съемка между двумя монтажными склейками. Он отвечает на узкий вопрос: когда изменилось визуальное состояние?

Функция Shots в Mux Video находит вероятные склейки, сравнивая последовательные кадры с использованием недорогих визуальных сигналов. Гжегож написал подробный разбор алгоритма обнаружения планов, поэтому я оставлю технические детали там. Для рабочего процесса важен результат — упорядоченный список границ и репрезентативное изображение для каждого плана.

«The Ultimate Run» — это плотный, быстро монтируемый визуальный контент. Фиксированный интервал выборки может пропустить короткий ракурс камеры, прыжок или изменение рельефа. Выборка с учетом планов сохраняет эти различные визуальные состояния, не заставляя модель проверять каждый кадр. Если мы сделаем фиксированную выборку в начале этого плана, мы даже не узнаем, что Эдер делает сальто по всему городу.

План все еще не может сказать нам, что Эдер добрался до очереди на подъемник. Он дает следующей системе карту визуальных изменений. Другие сигналы определяют, что эти изменения означают.

Это различие важно для разных типов контента. Десять минут подкаста могут содержать лишь несколько визуальных состояний, в то время как динамичный контент, подобный этому, постоянно переключается между ними. Полезные входные данные зависят от контента так же сильно, как и от вопроса.

Когда вам нужен целый раздел, используйте сцену

Поиск склейки при входе в ледник — это вопрос о плане. Поиск всей последовательности с ледником — это вопрос о сцене.

Сцена группирует соседние планы, которые связаны визуально или повествовательно. Для определения ее границ требуется больше контекста, чем просто изменение пикселей. Где начинается и заканчивается эта повествовательная последовательность? Какой отрезок охватывает сноупарк? Какие изображения, звуки и действия объединяются в одну узнаваемую часть видео?

Мы уже писали о том, как Find Scenes выстраивает эту структуру. Вкратце: визуальные границы предоставляют начальные окна, доступные подсказки из транскрипции добавляют звуковой контекст, а логика модели группирует соседние окна, описывающие одну и ту же часть видео.

В «The Ultimate Run» мало закадрового голоса; именно здесь по-настоящему проявляется мультимодальность Robots, позволяя визуальным изменениям выполнять большую часть этой работы. Планы вокруг ледника могут быть сняты с разных позиций камеры, но вместе они описывают более крупную последовательность, которую зритель воспринимает как одну часть заезда.

Сцены предоставляют вашему приложению компактную карту видео, предлагая сегменты с привязкой ко времени, содержащие достаточно контекста для просмотра, поиска, монтажных таймлайнов, навигации или логических выводов агента. Для фильма «The Ultimate Run» это означает, что приложение может вернуть последовательность с ледником как один связный результат, а не как набор разрозненных кадров.

LinkMoments and chapters answer product questions

Кадры, планы и сцены описывают то, что находится в медиафайле. Моменты и главы идут дальше. Их границы зависят от того, что именно пользователь хочет сделать с результатом.

В «The Ultimate Run» один план может запечатлеть Эдера в прыжке. Хотя это отличный эффектный кадр, «ключевые моменты» — это нечто большее. Ключевой момент фиксирует самостоятельный фрагмент, который стоит выделить. Весь трюк, от разгона до отрыва и приземления, обладает достаточным контекстом, чтобы работать как отдельный клип.

Функция «Find Key Moments» начинается с планов, добавляет контекст транскрипции при наличии и оценивает непрерывные диапазоны. Выбрав кандидата, она анализирует кадры внутри этого диапазона, чтобы описать развитие действия. Границы планов обеспечивают четкие визуальные переходы; транскрипция и кадры помогают определить, является ли фрагмент самодостаточным. Результат создается для зрителя, а не как очередной низкоуровневый входной сигнал.

Главы отвечают на навигационный запрос. Они делят длинное видео на именованные разделы, помогая зрителям перейти к нужной части.

Главы «The Ultimate Run» следуют за основными этапами спуска Эдера: «Высокогорье», «Ледник и ледяной туннель», «Скалы и сноупарк», «Замок» и «Финальный спуск». Вместе они образуют оглавление всего фильма. В отличие от ключевых моментов, главы не ограничиваются самыми примечательными фрагментами. Каждая часть видео занимает свое место.

«The Ultimate Run» позволяет зрителю легко распознать эти главы, поскольку обстановка кардинально меняется на протяжении всего спуска. Однако функция «Generate Chapters» получает большую часть данных из транскрипции, а в фильме почти нет речи. Даже без дорожки субтитров наши мультимодальные рабочие процессы функционируют, но из-за нехватки контекста у «Generate Chapters» меньше исходных данных, чем было бы для подкаста или лекции. «Find Scenes» лучше подходит для определения визуальной структуры этого конкретного видео.

Короче говоря, сцена описывает фрагмент медиа, который логически связан, в то время как глава дает этому фрагменту место в навигационной структуре, ориентированной на зрителя.

Один и тот же отрезок фильма может быть сценой, принадлежать к главе и содержать ключевой момент. Эти метки не взаимозаменяемы. Каждая из них отвечает на свой вопрос продукта.

LinkWorkflows combine these building blocks

Выбор точки старта не означает, что рабочий процесс останется на этом уровне детализации. Большинство полезных рабочих процессов начинаются с наименее затратного сигнала, который может сузить поиск, а затем добавляют детали там, где это может изменить результат.

Для выбора миниатюр планы делят видео на отдельные визуальные состояния. Кадры предоставляют изображения, которые могут стать миниатюрами. Использование обоих подходов предотвращает трату фиксированного бюджета на почти идентичные кадры из одного и того же плана.

Во время поиска ключевых моментов планы создают диапазоны-кандидаты и помогают избежать клипов, которые начинаются или заканчиваются посередине монтажной склейки. Подсказки из транскрипции объясняют, что было сказано, если присутствует речь. Кадры внутри перспективных диапазонов показывают, как развивается действие. Эти входные данные создают момент с редакционным смыслом.

Поиск сцен в преимущественно визуальном лыжном фильме опирается на смену планов и репрезентативные изображения. В подкасте подсказки из транскрипции могут нести изменения темы, в то время как камера почти не движется.

Один урок, к которому я постоянно возвращаюсь при работе с этими процессами, заключается в том, что больше контекста — не всегда лучший контекст. Рабочий процесс улучшается, когда он получает информацию, способную изменить результат, и пропускает остальное.

LinkEmbeddings face the same choice

Через несколько недель после просмотра спуска Эдера кто-то может вспомнить ледяной туннель, не зная, где именно он появляется в видео. «В какой части он едет внутри ледника?» — это поисковый запрос.

Эмбеддинги превращают текст, изображения или мультимодальные данные в векторы, которые система может сравнивать по смыслу. Они решают другую часть проблемы, находя релевантный контент, а не определяя, где заканчивается один план или сцена.

Однако вопрос гранулярности никуда не исчезает. Должен ли этот поиск вернуть весь фильм, сцену с ледником, план внутри туннеля или один точный кадр? Результат по всему видео может быть достаточен для рекомендации похожего контента. Но он недостаточно точен для прямого перехода к одному визуальному событию.

Эмбеддинг может представлять актив, диапазон транскрипции, визуальный отрезок, описание или мультимодальный фрагмент. Реализация может меняться в зависимости от модели. Полезный результат все равно должен быть достаточно широким, чтобы иметь смысл, и достаточно точным для использования.

Не существует универсально правильной гранулярности поиска для видео. Если вы размышляете над той же проблемой, напишите нам. Наша команда продукта с радостью покажет вам, над чем мы работаем.

LinkUse the smallest piece of video that contains the answer

«Использовать ИИ для анализа этого видео» звучит как одна задача. На практике полезный рабочий процесс делает несколько выборов, прежде чем модель даст ответ.

Он выбирает наименее затратный сигнал для сужения поиска. Он добавляет речевые или визуальные детали, когда того требует вопрос. Он адаптируется к контенту, вместо того чтобы обрабатывать подкаст как лыжный фильм. И он отделяет машинно-ориентированные входные данные от концепций, которые вы представляете зрителю.

Эти выборы окупаются во всех рабочих процессах, которые мы используем сегодня, и в любых будущих процессах: выбор миниатюр, модерация, анализ вовлеченности, автоматическое кадрирование, поиск, обнаружение клипов и навигация. Та же основа может поддерживать монтажные таймлайны, размещение рекламы, создание трейлеров, описания для доступности, проверку на соответствие требованиям и процессы, анализирующие только релевантную часть актива.

Спуск Эдера воспроизводится как одна непрерывная линия вниз по горе. Для рабочего процесса это также 18 000 кадров, 159 планов и 7 сцен, которые могут дать нам 5 глав и 2 ключевых момента. Все эти описания верны одновременно. То, какое из них имеет значение, зависит от того, что вы пытаетесь сделать.

← Все статьи

Ещё в разделе «Медиа, контент и развлечения»

Все →
Meta открывает программу раннего доступа к новым функциям MuseПресса
Meta

Meta открывает программу раннего доступа к новым функциям Muse

«Мощный прорыв» Meta создает уникальную торговую стратегию, считает Майк ХауПресса
Meta

«Мощный прорыв» Meta создает уникальную торговую стратегию, считает Майк Хау

Meta делает ставку на Muse, популярность которой стремительно растет
Пресса
Meta

Meta делает ставку на Muse, популярность которой стремительно растет

Марк Цукерберг представил VR-очки Meta за 1299 долларов и кулон Muse Charm в рамках продвижения ИИ-агентовПресса
Meta

Марк Цукерберг представил VR-очки Meta за 1299 долларов и кулон Muse Charm в рамках продвижения ИИ-агентов

Как создать легкий видеоплеер с приоритетом мобильных устройств для розничных сайтов
Cloudinary

Как создать легкий видеоплеер с приоритетом мобильных устройств для розничных сайтов

Meta создала носимое устройство, похожее на тамагочи, для своего ИИ-агента MuseПресса
Meta

Meta создала носимое устройство, похожее на тамагочи, для своего ИИ-агента Muse

Ещё от Mux

Mux Robots облегчили жизнь нашему видеомонтажеру
Mux

Mux Robots облегчили жизнь нашему видеомонтажеру

Как Firecrawl помогает нашему отделу продаж создавать персонализированные демоверсии продуктов
Mux

Как Firecrawl помогает нашему отделу продаж создавать персонализированные демоверсии продуктов

Использование очередей Laravel для управления директивами Mux Robots
Mux

Использование очередей Laravel для управления директивами Mux Robots

Используйте любую* LLM с @mux/ai
Mux

Используйте любую* LLM с @mux/ai