Звук, который понимает, что и когда происходит
Немое видео может показать нам, что произошло, но полноценное звуковое сопровождение заставляет нас прочувствовать это. Удар ноги о землю, голос в комнате и музыка, задающая эмоциональную арку, выполняют разные задачи. Требуется сочетание всех трех составляющих — звуковых эффектов, речи и музыки, — чтобы сцена казалась целостной.
Сегодня мы представляем Pika Soundtrack — модель, которая преобразует видео в синхронизированное звуковое сопровождение для всей сцены. Загрузите видео, и Pika сгенерирует звуковые эффекты с учетом движения, голоса, музыку и фоновую атмосферу, следующие за действием, с возможностью дополнительных инструкций о том, что следует подчеркнуть, включить или исключить. Модель работает с исключительной скоростью при локальной оценке, что делает Pika Soundtrack до 2 раз более экономичной по сравнению с конкурирующими моделями преобразования видео в аудио.
Посмотрите и послушайте модель
Промпт: Одно непрерывное, интенсивное барабанное соло, тридцать секунд, никаких других инструментов — счет на четыре, а затем груув, неуклонно нарастающий до неистовой пиковой точки: звонкий малый барабан, быстрый хай-хэт, глубокая бочка, мощные переходы по томам, грохочущие тарелки, рим-шот, завершающийся финальным сильным ударом в малый барабан и тарелку. Интенсивность в стиле «Одержимости», близкое и плотное звучание в комнате, каждый удар четкий.
От полного отсутствия промпта к полноценному звуковому оформлению
Техническая задача
Pika Soundtrack — это не просто генерация звука с привязанным изображением. Эффективная система должна решать несколько задач одновременно:
- Понимание сцены: Распознавание объектов, действий, материалов, окружения и предполагаемых источников звука.
- Временная синхронизация: Размещение ударов, движений, вокализаций и переходов в те моменты, когда их ждут зрители.
- Охват сцены: Балансировка фонового шума на переднем плане с фоновой атмосферой и акустическим пространством.
- Перспектива: Учет расстояния, кадрирования, движения камеры и предполагаемой позиции слушателя.
- Направление: Следование дополнительной инструкции без добавления звуков, противоречащих видео.
- Долгосрочная согласованность: Сохранение синхронизации и атмосферы после первых нескольких секунд и при смене сцен.
Звуковая дорожка может быть правдоподобной изолированно, но все равно казаться неуместной на фоне изображения. Pika Soundtrack преуспевает только тогда, когда звук принадлежит сцене и развивается вместе с ней.
Для решения этих задач Pika Soundtrack принимает видео вместе с необязательной инструкцией на естественном языке и создает новую аудиодорожку для всей сцены. Система извлекает визуальную и временную информацию из источника, объединяет ее с указаниями пользователя и генерирует звук, зависящий как от того, что появляется на экране, так и от времени возникновения событий.
Методы
Архитектура
Основная модель представляет собой латентную диффузионную модель на базе трансформера. Она работает с последовательностями сжатых видео-, текстовых и аудиотокенов, используя механизм внимания для связи визуальных событий и семантики промпта с деноизируемыми аудиотокенами.
Модель принимает на вход видео и текстовый промпт, а затем генерирует новую аудиодорожку, которая соответствует как видимому движению, так и запрошенному описанию звука. Изнутри видео сначала сжимается в последовательность визуальных латентных токенов. Эти токены сохраняют тайминг, движение объектов, компоновку сцены и покадровые указатели действий, но они намного меньше сырых пикселей. Текстовый промпт кодируется в семантические токены, которые описывают, какие звуки должны присутствовать, например шаги, ветер, вода, звуки ударов, атмосфера или «без диалогов / без музыки».
Звук генерируется в сжатом латентном пространстве, а не напрямую в виде семплов формы сигнала. Модель начинает со случайных зашумленных аудиолатентностей и постепенно очищает их от шума до чистого представления звука. Во время каждого шага деноизирования генератор звука обращается к входным видеотокенам и текстовым токенам, что позволяет ему решать как то, какой звук создать, так и когда он должен произойти. После деноизирования сгенерированный саундтрек добавляется к видео.
Обучение
Основная цель заключается в функции потерь деноизирования в стиле сопоставления потоков / диффузии для аудиолатентностей. В процессе обучения мы сэмплируем уровень шума или непрерывный временной шаг, интерполируем между чистыми целевыми аудиолатентностями и шумом, а затем обучаем трансформер предсказывать скорость или направление деноизирования, возвращающее зашумленную аудиолатентность к чистой цели. Видеолатентность сохраняется в фиксированном виде в качестве кондиционирования, поэтому функция потерь заставляет траекторию звука выравниваться по видимому движению, смене сцен и семантике промпта, а не изучать звук изолированно.
Эффективный вывод для всей сцены
Генерация полноценного саундтрека требует от модели сохранения визуального контекста при синтезе временно когерентного звука для всей сцены. Наш стек инференса оптимизирован как на уровне модели, так и на уровне обслуживания, благодаря чему обработка длинных роликов остается интерактивной, а не превращается в пакетный оффлайн-процесс.
Мы комбинируем дистилляцию, кэширование активаций и контекста, а также разреженное внимание, чтобы сократить объем вычислений, повторяющихся между соседними окнами. Дистилляция сжимает траекторию генерации до меньшего числа эффективных шагов, кэширование повторно использует визуальные и временные признаки, которые не меняются между соседними фрагментами, а разреженное внимание фокусирует вычисления на локальных аудио-/видеообластях, отвечающих за синхронизацию, сохраняя при этом достаточно глобального контекста для согласованности на уровне сцены. Вместе эти оптимизации позволяют системе генерировать саундтреки полной длины с низкой задержкой при сохранении временной синхронизации.
Результаты бенчмарка
В этом разделе мы оцениваем системы саундтреков с точки зрения как качества, так и эксплуатационного удобства. Мы проверяем, генерирует ли каждая модель звук, соответствующий видимой сцене, сохраняет ли синхронизацию с течением времени и остается ли правдоподобной в различных реальных и кинематографических видео. Поскольку длинные видео выявляют сбои, которые короткие ролики могут скрывать, мы оцениваем весь бенчмарк с использованием временных фрагментов, а не полагаемся только на первые несколько секунд.
В рамках бенчмарка Pika Soundtrack демонстрирует наилучшее семантическое соответствие и минимальную аудиовизуальную десинхронизацию, охватывая при этом всю длительность входного видео и обеспечивая самую высокую наблюдаемую скорость генерации для всей длительности.
Наш бенчмарк содержит видео различных разрешений, охватывающие физические удары, животных, погоду, воду, спорт, человеческие движения, музыкальные выступления, речевую активность, естественную атмосферу и постановочные кинематографические сцены.
Мы сравниваем Pika с LTX-2.3 Foley V2A, HunyuanVideo-Foley и MMAudio v2.
Оценка ImageBind измеряет семантическое соответствие между видео и аудио: относится ли сгенерированный саундтрек к видимой сцене. Показатель DeSync измеряет аудиовизуальное временное рассогласование, где меньшее значение лучше. IS-PANNs и IS-PASST — это классификаторные метрики качества и разнообразия звука.
Pika достигает наилучшего семантического соответствия и минимального временного рассогласования в этом бенчмарке. MMAudio v2 лидирует по метрикам качества и разнообразия на основе классификаторов. Мы публикуем обе метрики, потому что видеозвук не является одномерным: система должна генерировать убедительный звук, но этот звук также должен описывать правильную сцену в правильное время.
Скорость и охват всей длительности
Сравнение задержки звуковой дорожки требует учета того, сколько аудиосигнала каждая система фактически сгенерировала. Система, которая возвращает только часть длинного видео, не должна казаться быстрее из-за того, что ее результат оказался короче.
В этих измерениях используются различные среды выполнения: размещенные сквозные API для Hunyuan и MMAudio, инференс суммированных фрагментов для LTX и предварительно прогретое саморазворачиваемое сквозное время для Pika. Это полезные рабочие наблюдения, а не контролируемое сравнение на одинаковом аппаратном обеспечении.
Тем не менее, достигнутая скорость позволяет Pika Soundtrack быть в 2 раза более экономичной по сравнению с сопоставляемыми моделями.
Приложения и будущие разработки
Pika Soundtrack может добавлять естественные шумы (Foley) к тихим кадрам, создавать атмосферу вокруг сцены, генерировать художественный кинематографический звук или создавать альтернативные звуковые направления на основе того же визуального источника.
Этот релиз является частью нашей более масштабной работы в области генеративного аудио. Pika Real-Time Text-to-SFX создает звук непосредственно из текста; Pika Soundtrack начинает с визуальной последовательности и определяет, что должно быть слышно с течением времени.
Будущие разработки включают генерацию большей длительности, более точное управление на уровне событий, улучшенную пространственную и акустическую перспективу, а также целевые исследования в области речи и многоязычного дубляжа.
Доступность
Pika Soundtrack уже доступна в Pika API Club. Оцените ее в работе. Мы с нетерпением ждем возможности увидеть и услышать то, что вы создадите с ее помощью.










