Производственный звук из текста, генерируемый быстрее реального времени
Сегодня мы представляем Pika SFX, новую модель, которая преобразует текстовое описание в сфокусированный, готовый к использованию звуковой эффект
в реальном времени
Опишите одиночное событие — разбитое стекло или мультяшный свист — или задайте целую звуковую последовательность с таймингом, окружением, текстурой и настроением. Pika SFX генерирует аудиоклип, который соответствует запросу, избегая посторонней речи, музыки и фонового шума, если они явно не указаны в промпте.
Прослушайте модель
Одиночное событие
разбивающееся стекло
разбивающееся стекло
Материал, пространство и перспектива
Тяжелая металлическая дверь с грохотом захлопывается в большом пустом складе, сменяясь долгим металлическим эхом.
Тяжелая металлическая дверь с грохотом захлопывается в большом пустом складе, сменяясь долгим металлическим эхом.
Последовательность событий
Пробка вылетает из бутылки шампанского, за ней следует шипящая жидкость, наливаемая в бокал, с мягко потрескивающими пузырьками при оседании.
Пробка вылетает из бутылки шампанского, за ней следует шипящая жидкость, наливаемая в бокал, с мягко потрескивающими пузырьками при оседании.
Многослойный саунд-дизайн
Старая неисправная машина: шестерни скрежещут неравномерно, из клапана с шипением идет пар, электрические искры трещат, незакрепленный болт дребезжит, завершаясь тяжелым стуком и гулом отключения питания.
Старая неисправная машина: шестерни скрежещут неравномерно, из клапана с шипением идет пар, электрические искры трещат, незакрепленный болт дребезжит, завершаясь тяжелым стуком и гулом отключения питания.
Фантастический звуковой дизайн
Сотворение магического заклинания: нарастающие мерцающие искорки, эфирный хоровой всплеск, а затем мощный выброс воздуха с переливчатыми колокольчиками на затухании.
Сотворение магического заклинания: нарастающие мерцающие искорки, эфирный хоровой всплеск, а затем мощный выброс воздуха с переливчатыми колокольчиками на затухании.
Техническая задача
Полезный звуковой промпт может быть таким коротким: «металлическая дверь хлопает на складе».
Или он может описывать последовательность событий: «Пробка вылетает из бутылки шампанского, затем в бокал льется шипящая жидкость, а пузырьки мягко потрескивают при оседании».
Однако точность следования промпту — лишь первое из трех ограничений. Второе — качество звука: звуки должны иметь чистые, точные переходные процессы, правдоподобную акустику и реверберацию, а также не содержать нежелательного контента, выходящего за рамки промпта. Третье — эффективность: как генерировать высококачественный звук быстро и экономично, не жертвуя точностью или управляемостью?
Pika SFX создана для решения всех трех задач одновременно, объединяя точность промпта, качество звука и эффективную генерацию в единой системе.
Методы
Обзор архитектуры
Pika SFX преобразует описание на естественном языке в полноценную стереофоническую аудиоволну 44,1 кГц. Текстовый энкодер на базе трансформера сначала маппит промпт в обусловленные эмбеддинги, которые фиксируют запрошенные источники звука, физические действия, акустическую среду, тайминг, текстуру и творческое направление.
Генеративным ядром является текстово-обусловленный диффузионный трансформер (DiT), работающий в сжатом акустическом латентном пространстве.
Вместо генерации семплов формы волны напрямую, трансформер постепенно строит компактное представление звука. Это снижает длину последовательности и вычислительные затраты, сохраняя при этом как мелкие акустические детали (такие как переходные процессы, текстура и реверберация), так и более широкую временную структуру.
Таким образом, модель может представлять что угодно: от единичного удара до развивающегося эмбиента и многослойных последовательностей из нескольких событий.
Семантико-акустический автоэнкодер затем декодирует сгенерированные латентные переменные в финальную стереофоническую форму волны.
Мы спроектировали систему вокруг трех целей:
- Точность промпта: сохранение объектов, действий, окружения и последовательности, описанных пользователем.
- Качество производства: генерация чистого, сбалансированного звука с минимальным количеством артефактов или постороннего контента.
- Эффективная генерация: сохранение полезного качества звука в рамках дистиллированного пути вывода с малым числом шагов, подходящего для интерактивных приложений.
Эта архитектура обеспечивает основу; стек инференса определяет, насколько быстро она может обслуживаться.
Обучение эффективной генерации
Мы обучаем Pika SFX в три этапа. Сначала модель учится преобразовывать случайный шум в структурированный звук с помощью функции потерь сопоставления потоков (flow-matching). Во время обучения она наблюдает промежуточные точки между шумом и реальным звуком и изучает направление (или скорость), которое перемещает каждую точку к чистому звуковому представлению. Это учит диффузионный трансформер моделировать разнообразные звуки, временную структуру и взаимосвязи текста и звука.
Затем мы применяем дистилляцию по принципу «учитель-ученик». Высококачественный учитель использует более длинный многошаговый путь генерации, в то время как ученик учится предсказывать конечный результат учителя из промежуточного зашумленного состояния. Это эффективно укорачивает и выпрямляет траекторию генерации, позволяя модели выдавать полезный звук за гораздо меньшее число шагов инференса.
Наконец, мы дорабатываем дистиллированную модель-ученик путем пост-обучения на высококачественных курированных данных с использованием обратной связи от человека. Все эти этапы в совокупности позволяют нам эффективно генерировать высококачественный контент.
Интерактивный инференс в реальном времени
Мы рассматриваем инференс как сквозную системную проблему, оптимизируя модель, железо и стек обслуживания для непрерывной генерации.
На высшем уровне наш подход сочетает в себе две идеи:
- Генерация за малое число шагов. Мы дистиллируем модель для генерации высококачественного звука за меньшее количество шагов инференса, существенно сокращая последовательные вычисления.
- Оптимизация с учетом развертывания. Мы оптимизируем конкретную комбинацию архитектуры модели, оборудования, длительности вывода и конфигурации обслуживания, вместо того чтобы рассматривать каждый компонент изолированно.
В совокупности эти решения превращают инференс из холодной пакетной задачи в теплый цикл непрерывной генерации.
Оценка
Настройка оценки
Бенчмарк использует 50 промптов и 454 секунды запрошенного аудио на каждую модель, с запрошенной длительностью от 2 до 20 секунд. Он охватывает короткие и детальные промпты для ударов, шумов (Foley), животных, природы, транспорта, человеческих звуков, эмбиента, пространственного движения и многослойных последовательностей из нескольких событий.
Производительность генерации
По тем же 50 промптам запрошенного аудио на модель Pika SFX завершила свой локально развернутый сквозной путь в среднем за 0,847 секунды. Для контекста: самые быстрые хостинговые API в этом бенчмарке показали в среднем 2,47 секунды для ElevenLabs v2 и 2,64 секунды для Stable Audio 3 SFX.
Рисунок: Задержка генерации в зависимости от запрошенной длительности аудио для различных моделей text-to-SFX. Pika SFX обеспечивает субсекундную сквозную генерацию, включая обработку на CPU и сохранение файлов. Линии показывают средние значения; закрашенные области показывают ±1 стандартное отклонение. Меньше — значит быстрее.
Качество звука
Оценивать сгенерированный звук сложно. Клип может соответствовать промпту в пространстве эмбеддингов, но все равно быть шумящим, плохо сбалансированным или неудобным для монтажа. Поэтому мы оценили как метрики, связанные с промптом, так и практические качества получаемого аудио.
Что мы измеряем
Оценка разделяет соответствие промпту и практическое качество звука:
- CLAPScore: сходство между сгенерированным аудио и промптом в общем пространстве встраивания.
- AQAScore: присутствуют ли запрошенные события, согласно оценке мультимодальной модели.
- Полезность контента: является ли сгенерированный контент практически пригодным, с использованием соответствующей оси Meta Audiobox Aesthetics.
- Качество производства: является ли аудио чистым и готовым к творческой работе, с использованием соответствующей оси Meta Audiobox Aesthetics.
Результаты
В рамках данного бенчмарка Pika SFX достигла самых высоких показателей полезности контента и качества производства среди оцениваемых систем.
Pika SFX лидирует по показателям, наиболее близким к использованию результата в творческом рабочем процессе — является ли контент полезным и звучит ли аудио так, будто оно готово к производству.
Приложения и будущие разработки
Pika SFX разработана как базовый строительный блок. Она может генерировать изолированный эффект для монтажа, создавать последовательность по детальному указанию, обеспечивать фоновый шум для сцены или переносить генерацию звука непосредственно в приложение через API.
Этот релиз — лишь часть нашей масштабной работы в области генеративного аудио. Pika SFX начинается с языка. Pika Video-to-SFX начинается с самого изображения, генерируя эффекты и фоновый шум, согласованные с видимыми событиями и движением в видео.
Доступность
Pika SFX уже доступна через Pika API Club. Разработчики могут генерировать скачиваемые звуковые эффекты в формате MP3 по текстовым промптам, с настраиваемой продолжительностью от 1 до 20 секунд и опциональными элементами управления для негативных промптов, сида, шагов вывода и коэффициента руководства.
Мы с нетерпением ждем возможности услышать то, что вы создадите.










