Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Predstavlyaem pika music
Dev48

© 2026 · All rights reserved.

Представляем Pika Music

Источник: Pika

Представляем Pika Music

Источник: Pika

Новая модель генерации музыки для воплощения творческого замысла в готовый трек — из текста, текста песни, эталонного голоса, существующего трека или любой их комбинации.

26 сентября 2026 г.

Одна модель — множество способов создания песни.

Начните с идеи, готового текста песни, эталонного голоса, существующего трека — или скомбинируйте их — и создайте полноценное музыкальное произведение в рамках единого рабочего процесса.

Сегодня мы представляем Pika Music — новую модель генерации музыки для превращения творческого замысла в готовые треки. Она поддерживает множество входных данных: текст, текст песни, голосовое условие, музыкальный эталон и комбинации этих входных данных в рамках единой системы.

Большинство музыкальных инструментов заставляют создателей выбирать отдельный рабочий процесс для каждой отправной точки. Мы хотели, чтобы модель соответствовала тому, с чего начинается идея. Иногда это предложение: мечтательный синти-поп с интимным вокалом и эйфорическим финальным припевом. Иногда это полный текст песни. Иногда важным компонентом является голос, мелодия или песня, которую нужно переосмыслить.

Pika Music рассматривает каждый из этих вариантов как разные способы описания одной и той же цели: песни, которую вы хотите услышать.

Она также создана для итераций. В наших локальных тестах

Pika Music генерирует 90-секундную песню локально в среднем за 6,21 секунды — примерно в 14,5 раза быстрее воспроизведения, — поэтому создатели могут изучать новый текст, голос или аранжировку, не выходя из творческого цикла.

Четыре входные модальности

1. Промпт — путь от описания к готовому треку

Генерация текста в музыку начинается с обычного творческого руководства. Промпт может описывать жанр, настроение, инструментарий, вокальный характер, аранжировку или развитие на протяжении всей песни. Модель превращает эти инструкции в связный трек, а не в короткую музыкальную фактуру.

Промпт

modern pop R&B, B flat minor, 69 bpm, softly swung groove, mellow lofi textures, deep piano melody, vinyl crackle, sparse synth pads, warm low bass, clean reverbed female lead vocal, soulful lead with breathy ad-libs, subtle low male doubles on the chorus only, chill spacious mix

текст песни:

[куплет]

Night after night I keep the light on low

Counting all the things I said I'd let go

[припев]

So I stay, so I stay awake

Some kind of quiet only midnight makes

2. Текст песни — начните со слов

Текст песни вводится в качестве токенов обусловленности наряду с промптом, поэтому слова являются частью задачи шумоподавления, а не прохода выравнивания, применяемого после. Теги разделов, такие как [куплет] и [припев], считываются как структура, определяющая фразировку и границы разделов, в то время как промпт обуславливает аранжировку вокруг них.

Поскольку эти два пути разделены, текст песни можно оставить неизменным, пока промпт варьируется: те же слова звучат как акустическая баллада, танцевально-поп-сингл или кинематографическое рок-исполнение.

Текст песни + направление

Промпт

Modern pop R&B, B flat minor, 69 bpm, softly swung groove, mellow lofi textures, deep piano melody, vinyl crackle, sparse synth pads, warm low bass, clean reverbed female lead vocal, soulful lead with breathy ad-libs, subtle low male doubles on the chorus only, chill spacious mix

Текст песни

[Verse] Night after night I keep the light on low Counting all the things I said I'd let go [Chorus] So I stay, so I stay awake Some kind of quiet only midnight makes

[Verse] Night after night I keep the light on low Counting all the things I said I'd let go [Chorus] So I stay, so I stay awake Some kind of quiet only midnight makes

Промпт

Haunting emotional ballad steeped in longing, quiet resilience and heartbreak, soft and sorrowful mood like walking through empty rooms filled with memories, gentle melody carried by piano chords and orchestral swells that rise and fall like tides, fragile tender reverent delivery, spacious and cinematic. Duration: 60

Текст песни

[Verse 1] I still hear your voice in the hush of the dawn, A whisper that fades, but never is gone. The bed still holds your shape like a ghost in the light, And I reach out to shadows in the heart of the night. [Pre-Chorus] We said forever in the breath of a kiss, But forever can crumble like this… [Chorus] You're the echo in my silence, the tear I cannot cry, A dream I keep reliving though I know it's goodbye.

[Verse 1] I still hear your voice in the hush of the dawn, A whisper that fades, but never is gone. The bed still holds your shape like a ghost in the light, And I reach out to shadows in the heart of the night. [Pre-Chorus] We said forever in the breath of a kiss, But forever can crumble like this… [Chorus] You're the echo in my silence, the tear I cannot cry, A dream I keep reliving though I know it's goodbye.

3. Голосовое условие — подарите своей песне вокалиста

Короткий вокальный эталон может задать вокальную фактуру, тембр, подачу и энергию. Его можно использовать как отдельно, так и в сочетании с промптом и текстом песни, что позволяет одновременно управлять музыкальной аранжировкой и вокальным характером.

Это создано для творческого голосового кондиционирования — а не просто для добавления голоса к независимо сгенерированной фонограмме. Эталон участвует в создании выступления.

Обратите внимание, что наша модель требует от пользователя подтверждения наличия прав на использование любого вводимого им голоса.

Входные данные · голосовой эталон

Результат

4. Музыкальный эталон — добавьте атмосферу

Некоторые особенности песни проще показать, чем описать. Музыкальный эталон позволяет предоставить трек, настроение которого вы хотите передать, вместо того чтобы пытаться описать словами жанр, инструментарий и характер производства.

Эталон формирует музыкальный мир новой песни — ее текстуру, инструментарий, энергию и общее ощущение, — в то время как промпт и текст песни определяют то, о чем песня говорит на самом деле. Эталон задает атмосферу; письменное руководство задает содержание.

Перед генерацией эталон разделяется и нормализуется, чтобы его музыкальные качества можно было считывать независимо от исходного микса. Затем новый трек генерируется как единое исполнение, обусловленное этими качествами, а не сшивается из фрагментов исходного материала.

Обратите внимание, что наша модель требует от пользователя подтверждения наличия прав на использование любого вводимого им трека.

Одна модель, множество видов контроля

Под капотом эти рабочие процессы представляют собой различные комбинации сигналов обусловленности:

  • Язык описывает жанр, настроение, инструментарий, вокальный стиль и аранжировку.
  • Текст песни определяет слова и может задавать структуру песни высокого уровня.
  • Голосовые эталоны задают вокальный характер и подачу.
  • Музыкальные эталоны служат исходным материалом для создания новой атмосферы.
  • Длительность и сид обеспечивают дополнительный контроль генерации.

Задача заключается не просто в принятии большего количества входных данных. Эти входные данные могут противоречить друг другу. Текст песни подразумевает одну структуру, а эталонная песня — другую; запрашиваемый стиль может противоречить исходной аранжировке; вокальная идентичность и разборчивость могут конкурировать. Система должна разрешить эти сигналы в одно музыкально связное исполнение.

Наш конвейер генерации подготавливает каждый сигнал для модели. Текст и текст песни нормализуются в более четкие творческие инструкции. Голосовые эталоны анализируются на предмет полезных вокальных атрибутов, а исходный аудиоматериал разделяется и нормализуется перед созданием кавера. Затем модель создает полноценный трек на основе полученной обусловленности.

Практическая польза заключается в компонуемости. Создателям не нужна другая модель или интерфейс каждый раз, когда меняется исходный материал.

Практическая польза заключается в композитности. Создателям не нужна новая модель или интерфейс каждый раз, когда меняется исходный материал.

Архитектура

По своей сути Pika Music представляет собой диффузионный трансформер в латентном пространстве со смесью слоев локального и полного внимания. Модель работает в сжатом акустическом представлении, где долгосрочная музыкальная структура поддается вычислениям, а затем декодирует готовую латентную последовательность в стереофонический сигнал.

Различные входные данные поступают через специализированные пути кондиционирования в виде токенов кондиционирования или латентных представлений акустического контекста.

Эти сигналы объединяются внутри одного общего генеративного декодера. Такая конструкция имеет решающее значение: кавер-версия с новым голосом и новым стилем не создается путем объединения нескольких независимо сгенерированных результатов. Модель определяет исходную мелодию, текст, тембр и письменные указания одновременно с генерацией целевой песни.

Этот общий латентный интерфейс позволяет одной модели переходить от свободной композиции к жестко обусловленной трансформации без изменения базовой архитектуры.

Цель обучения

Мы обучаем модель с использованием метода сопоставления потоков (flow matching). Для чистого целевого латентного представления

, гауссовского шума

, и сэмплированного уровня шума

, мы строим:

Трансформер предсказывает скорость, которая направляет вектор от чистого примера к сэмплированному шуму:

Здесь

, представляет собой любое доступное для примера кондиционирование: текст, слова песни, голос или контекст исходной песни. Во время обучения кондиционирование выборочно подвергается возмущениям или удаляется. Это учит модель сохранять эффективность при несовершенных ссылках и обеспечивает применение руководства без классификатора (classifier-free guidance) во время вывода.

Совместная цель служит двум задачам. Она учит модель использовать каждый новый сигнал кондиционирования и сохраняет общую способность модели к композиции.

Бенчмарк-оценка

Мы создали бенчмарк с фиксированными текстами песен для сравнения систем генерации музыки при одинаковых творческих задачах, а не для отбора только выгодных сэмплов. Полный бенчмарк содержит 15 запросов, охватывающих акустический фолк, поп, R&B, рэп, рок, кантри, электронную музыку, метал, джаз, киномузыку, детскую музыку, афробит и многоязычные песни. Каждый запрос определяет стиль, текст, желаемую продолжительность, язык, BPM, тональность и размер.

Каждая система генерирует два результата на один запрос, создавая 30 результатов для каждой измеряемой системы. Мы оцениваем два взаимодополняющих измерения:

  • Качество музыки: Audiobox Aesthetics измеряет удовольствие от прослушивания, полезность, сложность и качество производства. SongEval измеряет когерентность, музыкальность, запоминаемость, четкость и естественность. MuQ-MuLan измеряет соответствие запросу и разнообразие в рамках одного запроса. Мы также оцениваем темп и тональность для проверки музыкального контроля.
  • Задержка: Мы измеряем время, необходимое для того, чтобы сгенерированный материал стал пригодным для использования. Для размещенных у провайдеров систем замеряется полный цикл от отправки запроса до загрузки полученного аудио.

Бенчмарк оценивает путь преобразования текста/слов в музыку.

Результаты

Основные результаты приведены ниже. Автоматические оценщики являются полезными масштабируемыми суррогатными метриками, но небольшие различия не следует интерпретировать как окончательный рейтинг предпочтений людей.

Производительность генерации

Генерация музыки носит итеративный характер. Люди корректируют текст, меняют энергетику вокалиста, пробуют другую аранжировку или исследуют несколько направлений, прежде чем выбрать одно. Задержка поэтому влияет на творческий процесс: каждое долгое ожидание прерывает петлю между идеей и прослушиванием результата.

Мы оптимизировали весь путь вывода для конкретной модели, оборудования и конфигурации обслуживания. Результатом стал быстрый метод генерации, который работает значительно быстрее реального времени.

В нашем синхронизированном производственном бенчмарке оптимизированная система генерировала 90-секундную песню в среднем за 6,21 секунды. По всем 30 измеренным генерациям средняя задержка составила 6,25 секунды, медианная — 6,14 секунды, а задержка P90 — 8,11 секунды. Медианный коэффициент реального времени составил 0,068, или примерно в 14,6 раза быстрее воспроизведения.

Рисунок: Задержка сквозной генерации музыки в логарифмическом масштабе. Ромбы показывают средние значения, полые точки — медианы, вертикальные отметки — P90, а полосы показывают наблюдаемый диапазон от минимума до максимума по 30 генерациям.

Качество музыки

Ни одна отдельная оценка не отражает, удалась ли песня. Мы оцениваем взаимодополняющие свойства — техническое качество, музыкальную когерентность, соответствие запросу, запоминаемость, вокальную естественность, разнообразие, темп и тональность — и сочетаем автоматическую оценку с прослушиванием.

В бенчмарке текста/слов к музыке Pika Music вошла в высший эшелон оценки Audiobox Aesthetics. Ее показатель удовольствия от контента (Content Enjoyment) составил 7,403 по сравнению с 7,412 у Suno, а показатель качества продукции (Production Quality) составил 8,064 по сравнению с 8,151 у Suno.

Pika Music сочетает в себе конкурентоспособную автоматическую эстетику с широким, композитным рабочим процессом и существенно более быстрой измеряемой задержкой вывода.

Создавайте музыку с того места, где зарождается идея

Запрос, готовый текст, эталонный голос или существующая песня могут стать началом трека. Pika Music объединяет эти входные данные в одной модели, чтобы создатели могли исследовать, комбинировать и дорабатывать идеи без переключения между отдельными инструментами.

Начните в песочнице, чтобы попробовать Pika Music напрямую. Когда вы будете готовы внедрить ее в свой собственный продукт или рабочий процесс, используйте страницу API, чтобы начать разработку.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Создание производственных агентов с помощью Jev и LangGraph
LangChain

Создание производственных агентов с помощью Jev и LangGraph

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов
LangChain

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактовПресса
OpenAI

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактов

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержекПресса
Tesla

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержек

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое
LangChain

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое

Tesla готовится к масштабному производству тяжелых грузовиков Semi с открытием завода в НевадеПресса
Tesla

Tesla готовится к масштабному производству тяжелых грузовиков Semi с открытием завода в Неваде

Ещё от Pika

Обзор участников Pika API Club
Pika

Обзор участников Pika API Club

Добро пожаловать в новый Pika
Pika

Добро пожаловать в новый Pika

Слушайте сюда: Pika SFX
Pika

Слушайте сюда: Pika SFX

Знакомство с Pika Soundtrack
Pika

Знакомство с Pika Soundtrack