Готовый к производству звук из текста, генерируемый быстрее реального времени
Сегодня мы представляем Pika SFX — новую модель, которая превращает текстовое описание в сфокусированный, готовый к использованию звуковой эффект
в реальном времени
Опишите отдельное событие — разбиение стекла или мультяшный свист — или управляйте целой звуковой последовательностью с учетом тайминга, окружения, текстуры и настроения. Pika SFX генерирует аудиоклип, который следует запросу, избегая посторонней речи, музыки и фонового шума, если они явно не указаны в промпте.
Прослушайте модель
Отдельное событие
разбивание стекла
разбивание стекла
Материал, пространство и перспектива
Тяжелая металлическая дверь захлопывается в большом пустом складе, за чем следует долгий металлический эхо-отклик.
Тяжелая металлическая дверь захлопывается в большом пустом складе, за чем следует долгий металлический эхо-отклик.
Последовательность событий
Пробка вылетает из бутылки шампанского, после чего шипучая жидкость наливается в стакан, а пузырьки мягко потрескивают, оседая.
Пробка вылетает из бутылки шампанского, после чего шипучая жидкость наливается в стакан, а пузырьки мягко потрескивают, оседая.
Многослойный саунд-дизайн
Старая неисправная машина: шестерни скрежещут неравномерно, из клапана с шипением идет пар, электрические искры потрескивают, незакрепленный болт дребезжит, завершаясь тяжелым стуком и гулом выключения питания.
Старая неисправная машина: шестерни скрежещут неравномерно, из клапана с шипением идет пар, электрические искры потрескивают, незакрепленный болт дребезжит, завершаясь тяжелым стуком и гулом выключения питания.
Спроектированный фэнтезийный звук
Сотворение магического заклинания: мерцающие искры нарастают, эфирный хоровой всплеск, затем мощный выброс воздуха с переливчатыми колокольчиками на затухании.
Сотворение магического заклинания: мерцающие искры нарастают, эфирный хоровой всплеск, затем мощный выброс воздуха с переливчатыми колокольчиками на затухании.
Техническая задача
Полезный звуковой промпт может быть таким коротким, как «металлическая дверь захлопывается на складе».
Или он может описывать последовательность событий: «Пробка вылетает из бутылки шампанского, за ней следует шипучая жидкость, наливающаяся в стакан, с мягко потрескивающими пузырьками по мере их оседания».
Однако точность следования промпту — это лишь первое из трех ограничений. Второе — качество звука: звуки должны иметь четкие, точные переходные процессы, правдоподобную акустику и реверберацию, а также не содержать нежелательного контента за пределами того, что указано в промпте. Третье — эффективность: как мы можем генерировать высококачественное аудио быстро и экономично, без ущерба для точности или управляемости?
Pika SFX разработана для решения всех трех задач одновременно, объединяя точность следования промпту, качество звука и эффективную генерацию в единой системе.
Методы
Обзор архитектуры
Pika SFX преобразует описание на естественном языке в полноценную стереофоническую аудиоволну с частотой 44,1 кГц. Текстовый энкодер на базе трансформера сначала маппирует промпт в обусловливающие эмбеддинги, которые фиксируют запрошенные источники звука, физические действия, акустическую среду, тайминг, текстуру и творческое направление.
Генеративным ядром является текстово-обусловленный диффузионный трансформер (DiT), работающий в сжатом акустическом латентном пространстве.
Вместо генерации семплов аудиоволны напрямую трансформер постепенно конструирует компактное представление звука. Это снижает длину последовательности и вычислительные затраты, сохраняя при этом как мелкие акустические детали — такие как переходные процессы, текстура и реверберация, — так и более широкую временную структуру.
Таким образом, модель может представлять что угодно: от одиночного удара до развивающейся атмосферы и многослойных последовательностей из нескольких событий.
Семантико-акустический автоэнкодер затем декодирует сгенерированные латентные переменные в финальную стереофоническую аудиоволну.
Мы спроектировали систему вокруг трех целей:
- Точность следования промпту: сохранение объектов, действий, среды и последовательности, описанных пользователем.
- Производственное качество: генерация чистого, сбалансированного звука с минимальным количеством артефактов или постороннего контента.
- Эффективная генерация: сохранение полезного качества звука в рамках дистиллированного пути вывода за несколько шагов, подходящего для интерактивных приложений.
Эта архитектура обеспечивает фундамент; стек вывода определяет, насколько быстро он может обслуживаться.
Обучение для эффективной генерации
Мы обучаем Pika SFX в три этапа. Сначала модель учится преобразовывать случайный шум в структурированное аудио с использованием целевой функции сопряжения потоков (flow-matching). Во время обучения она наблюдает промежуточные точки между шумом и реальным звуком и изучает направление (или скорость), которое перемещает каждую точку в сторону чистого аудиопредставления. Это учит диффузионный трансформер моделировать разнообразные звуки, временную структуру и взаимосвязь между текстом и аудио.
Затем мы применяем дистилляцию учитель–ученик. Высококачественный учитель следует по более длинному многошаговому пути генерации, в то время как ученик учится предсказывать конечный результат учителя из промежуточного зашумленного состояния. Это эффективно укорачивает и выпрямляет траекторию генерации, позволяя модели производить полезное аудио с гораздо меньшим количеством шагов вывода.
Наконец, мы дорабатываем дистиллированную модель ученика посредством пост-обучения на высококачественных курированных данных с использованием обратной связи от человека. В совокупности эти этапы позволяют нам эффективно генерировать контент высокой точности.
Интерактивный вывод в реальном времени
Мы рассматриваем вывод как сквозную системную проблему, оптимизируя модель, железо и стек обслуживания для непрерывной генерации.
В общих чертах наш подход объединяет две идеи:
- Генерация за несколько шагов. Мы дистиллируем модель для генерации высококачественного аудио за меньшее количество шагов вывода, существенно сокращая последовательные вычисления.
- Оптимизация с учетом развертывания. Мы оптимизируем под конкретную комбинацию архитектуры модели, оборудования, длительности вывода и конфигурации обслуживания, вместо того чтобы рассматривать каждый компонент изолированно.
В совокупности эти решения превращают вывод из холодной пакетной обработки в теплый непрерывный цикл генерации.
Оценка
Настройка оценки
Бенчмарк использует 50 промптов и 454 секунды запрошенного аудио на модель, с запрошенной длительностью от 2 до 20 секунд. Он охватывает короткие и детальные промпты, включающие удары, шумы по технологии Фoли (Foley), животных, природу, транспорт, человеческие звуки, амбиент, пространственное движение и многослойные последовательности из нескольких событий.
Производительность генерации
По тем же 50 промптам запрошенного аудио для каждой модели Pika SFX завершила свой локально хостящийся сквозной путь в среднем за 0.847 секунды. Для контекста, самые быстрые хостящиеся API в этом бенчмарке показали в среднем 2.47 секунды для ElevenLabs v2 и 2.64 секунды для Stable Audio 3 SFX.
Рисунок: Задержка генерации по сравнению с запрошенной длительностью аудио для моделей текст-в-SFX. Pika SFX достигает субсекундной сквозной генерации, включая процессорную обработку и сохранение файлов. Линии показывают средние значения; закрашенные области показывают ±1 стандартное отклонение. Меньше — значит быстрее.
Качество звука
Оценивать сгенерированный звук сложно. Клип может соответствовать промпту в пространстве эмбеддингов и при этом быть шумящим, плохо сбалансированным или неудобным для вставки при монтаже. Поэтому мы оценили как метрики, связанные с промптом, так и практические качества получаемого аудио.
Что мы измеряем
Оценка разделяет соответствие промпту и практическое качество звука:
- CLAPScore: сходство между сгенерированным аудио и текстовым запросом в общем пространстве встраивания.
- AQAScore: оценка наличия запрошенных событий с помощью мультимодальной модели.
- Полезность контента: оценка того, пригоден ли сгенерированный контент для практического использования, с использованием соответствующей оси эстетики Meta Audiobox.
- Качество производства: является ли аудио чистым и готовым к творческой работе, с использованием соответствующей оси эстетики Meta Audiobox.
Результаты
В рамках данного бенчмарка Pika SFX показала самые высокие результаты по полезности контента и качеству производства среди оцениваемых систем.
Pika SFX лидирует по показателям, наиболее близким к использованию результата в творческом рабочем процессе — является ли контент полезным и звучит ли аудио так, будто оно готово к производству.
Приложения и будущие разработки
Pika SFX создана как базовый элемент. Она может генерировать изолированный эффект для монтажа, создавать последовательность звуков по подробному описанию, обеспечивать фоновый шум для сцены или интегрировать генерацию звука непосредственно в приложение через API.
Этот релиз — лишь часть нашей масштабной работы в области генеративного аудио. Pika SFX начинается с языка. Pika Video-to-SFX начинается с самого изображения, генерируя эффекты и атмосферу, синхронизированные с видимыми событиями и движением в видео.
Доступность
Pika SFX уже доступна через Pika API Club. Разработчики могут генерировать скачиваемые звуковые эффекты в формате MP3 по текстовым запросам с настраиваемой продолжительностью от 1 до 20 секунд и опциональными элементами управления для негативных запросов, сида, шагов инференса и шкалы руководства (guidance scale).
Мы с нетерпением ждем возможности услышать то, что вы создадите.










