Миф о видеоданных: почему ИИ еще не «посмотрел» интернет

Источник: Fastly•

Миф о видеоданных: почему ИИ еще не «посмотрел» интернет

ИИ еще не «посмотрел» интернет — и дело не в скорости, а в стоимости токенов и нехватке видеоразметки. Узнайте, в чем заключается настоящий «бутылочное горлышко» данных.

Существует популярное объяснение того, почему ИИ до сих пор с трудом справляется с видео по сравнению с текстом: парсинг еще не добрался до видео, потому что, в отличие от текста, видео нельзя ускорить. Аргумент заключается в том, что модель может усвоить миллион страниц текста за время, которое требуется человеку на прочтение одного абзаца, но 90-минутное видео модель должна «смотреть» все 90 минут, так как именно столько длится запись.

Это убедительная теория. И она в корне неверна.

Модели не смотрят видео, они его сэмплируют

Ни обучение модели, ни анализ видеоконтента не зависят от длительности воспроизведения видео. LLM не нужно воспроизводить файл от начала до конца и усваивать его в реальном времени. Такая система, как Gemini, по умолчанию сэмплирует кадры (примерно один в секунду), обрабатывает вместе с ними аудио и преобразует и то, и другое в токены, с которыми может работать модель. Большая часть этой обработки может происходить параллельно. Конечно, более длинный видеоряд означает больше работы, но 90-минутное видео не требует 90 минут на «просмотр».

Цифры подтверждают это. Опубликованные Google накладные расходы для видеоконвейера Gemini составляют примерно 2 секунды фиксированных затрат плюс ~0,5 секунды обработки на каждую минуту видео. Если произвести расчет для 90-минутного видео, получится значительно меньше минуты фактических накладных расходов на обработку, а не 90 минут (Как Gemini обрабатывает видео?).

Обучение еще дальше отстоит от «реального времени»: видео нарезается на кадры и кодируется в признаки офлайн, пакетами, точно так же, как текстовый корпус токенизируется перед тем, как на нем начнут обучать модель. В конвейере нет этапа, на котором модель сидит и «смотрит» видео.

Так если скорость приема — не узкое место, то что им является?

Возможно, неудивительно, что реальная стоимость заключается не во времени, а в токенах. Другими словами: проблема в том, сколько стоит представление данных, а не в том, сколько времени занимает их прием.

Согласно собственному прайс-листу Google, час видео в низком разрешении (измеряемый в токенах, а не в количестве пикселей) обходится примерно в 475 000 токенов: около 360 000 на кадры и 115 000 на аудио (Понимание и подсчет токенов). Сравните это с часом расшифровки устной речи, который может составлять от 10 000 до 15 000 токенов.

Этот разрыв существует потому, что видеокадры чрезвычайно избыточны: 40-й кадр, на котором кто-то говорит, обычно выглядит почти идентично 39-му, поэтому огромная доля этих токенов кодирует практически дублирующуюся информацию. Недавний переход Google к «агентной» обработке видео, которая позволяет модели выбирать только релевантные части видео, а не каждый кадр, сократил использование токенов на 88% именно за счет устранения этой избыточности (Google cuts Gemini video analysis tokens by up to 88%). Это не исправление скорости — это оптимизация затрат.

Другое реальное узкое место: никто не разметил данные

У текста есть особенность, которая делает его уникально удобным для парсинга при обучении: он самоописателен. Абзац текста сам по себе является меткой. У видео нет эквивалента. Хотя могут существовать некоторые метаданные, видеоклип, где кто-то поднимает чашку и ставит ее обратно, не сопровождается таким объяснением. Подавляющее большинство онлайн-видео либо вообще не имеют подписей, либо они ограничены описанием вроде «мужчина на кухне», без аннотации действий, причинно-следственных связей или физики происходящего в кадре.

Это проблема разметки, а не скорости, и именно поэтому лаборатории перешли к самообучающимся подходам, которые вообще не нуждаются в видео с ручной разметкой. Это передний край науки прямо сейчас — не более быстрый прием данных, а новые архитектуры, которые изначально обходят необходимость в метках.

Почему это происходит сейчас

Если бы видео не ограничивалось скоростью воспроизведения, почему индустрия внезапно бросилась в эту сторону? Потому что текст заканчивается. Согласно одной широко цитируемой оценке, рост объема высококачественного веб-текста, доступного для парсинга, составляет менее 10% в год, в то время как аппетиты обучающих выборок удваиваются ежегодно — ожидается, что эти две линии пересекутся примерно к 2028 году (Стена данных имеет значение). Видео — неразмеченное, избыточное, дорогое в пересчете на токен, но доступное в практически неограниченном количестве — является очевидным следующим рубежом, как только предложение текста сократится. Ян Лекун годами приводил похожий аргумент: четырехлетний ребенок усвоил больше необработанных сенсорных данных, чем любая текстовая обучающая выборка LLM, почти полностью через зрение (Самый дорогой спор в ИИ).

Самый дорогой «запойный просмотр» в интернете

ИИ еще не полностью «добрался» до видео — но не потому, что прием данных идет медленно. А потому, что видео дорого обходится в пересчете на единицу полезного сигнала (огромное, избыточное количество токенов по отношению к информации, которую оно несет) и плохо размечено для понимания временной и причинно-следственной структуры, которая действительно важна. Происходящий сейчас разворот в сторону видео — это не признак того, что кто-то наконец решил проблему скорости. Это признак того, что легкий источник, текст, начинает иссякать, и следующая сложная задача — извлечение сигнала из формата, который.

Узнайте, как облачная платформа Fastly edge cloud может помочь вам оптимизировать производительность и масштабировать рабочие нагрузки с интенсивным использованием данных.

О чём эта статья

Ещё в разделе «Облака и инфраструктура»

Все →

Ещё от Fastly