Сегодня мы представляем MiniMax Music 3.0, нашу модель генерации музыки нового поколения. Получив творческую концепцию и необязательный текст, модель сочиняет, аранжирует, исполняет и производит полную песню за один проход.
Music 3.0 фокусируется на тех аспектах создания музыки, которые труднее всего уловить с помощью простого промпта: понимание выразительного замысла автора; сохранение этого замысла на протяжении всей песни длиной до пяти минут; передача инструментов с четкостью и физическим реализмом; а также создание вокала, который звучит как живое исполнение, а не синтетика.
Для достижения этого мы полностью переработали конвейер генерации — от описания музыки и языкового моделирования до рендеринга аудио. Детализированные темпоральные описания фиксируют эволюцию эмоций, инструментовки и вокальной подачи. Глобально-локальная гибридная языковая модель (Hybrid-LM) совместно моделирует долгосрочную структуру и акустические детали. Многослойное остаточное векторное квантование (RVQ), слияние скрытых состояний, сопоставление потоков (flow matching) и Flow-VAE дополнительно повышают точность вывода. В совокупности эти достижения обеспечивают три основных улучшения: более точное интерпретирование творческого замысла, более полные и разнообразные аранжировки, а также более чистое и естественное звучание.
Music 3.0: Техническая архитектура
Music 3.0 состоит из трех взаимосвязанных основных компонентов: токенизатора, Hybrid-LM и стека синтеза. Они отвечают соответственно за то, как представляется музыкальная информация, как моделируются долгосрочная структура и локальные детали, и как аудио реконструируется с высокой точностью. Полный рабочий процесс показан ниже.
Многослойный RVQ: отделение базовой структуры от акустических деталей
Восьмислойный RVQ представляет музыкальную информацию иерархически. Первый слой фиксирует базовую семантику и структуру, в то время как остальные семь постепенно кодируют акустические остатки. При поэтапном обучении первый слой сначала изучает стабильную информационную основу, после чего все кодовые книги обучаются совместно для моделирования детализированного звука. Такая конструкция обеспечивает более стабильное дискретное представление для предсказания длинных последовательностей и позволяет избежать перегрузки одного слоя токенов как структурной информацией, так и информацией о точности.
Hybrid-LM: совместное моделирование глобальной структуры и локальной акустики
Глобальная языковая модель на 8B инициализируется из Qwen3.5-8B и выполняет покроковое предсказание семантических токенов, одновременно моделируя глобальный контекст. Случайным образом инициализированная локальная языковая модель на 0.6B предсказывает внутрикадровые акустические токены вдоль оси глубины. Обучение проходит в два этапа: глобальное выравнивание сначала устанавливает способность глобальной языковой модели предсказывать музыкальную семантику, за которым следует совместное обучение глобальной и локальной моделей с полными параметрами. Это иерархическое сотрудничество позволяет модели сохранять структурную стабильность на уровне песни, одновременно прорабатывая акустические детали внутри каждого кадра.
Слияние скрытых состояний: от дискретного предсказания к непрерывному рендерингу аудио
Обычные системы обычно подают дискретные акустические токены напрямую в декодер. Music 3.0 вместо этого объединяет непрерывные скрытые состояния глобальной и локальной языковых моделей и использует их для условного направления модуля сопоставления потоков (flow-matching) размером 2.4B. Затем декодер Flow-VAE размером 123M декодирует аудио. Полный путь выглядит следующим образом:
Объединенные признаки LLM → Сопоставление потоков (Flow matching) → Скрытые состояния VAE → Декодер Flow-VAE → Конечное аудио
Эта конструкция напрямую связывает структурное понимание языковой модели с реконструкцией звука акустической модели через непрерывные представления. Она сохраняет долгосрочную согласованность, одновременно улучшая точность произношения, инструментальную когерентность и точность мелких деталей.
Пользовательский промпт
Демо
Классический шанхайский джаз / соул с мягкой lo-fi теплотой. Нежные, ностальгические куплеты переходят в мягко сияющий припев, исполненный интимным женским вокалом со сдержанной фразировкой, в сопровождении мягкого пианино, контрабаса, ударных со щетками, теплых духовых акцентов и винтажного микса, создающего ощущение живой комнаты.
Футуристический мелодичный EDM / прогрессив-хаус. Задумчивые куплеты о памяти и цифровой идентичности перерастают в воодушевляющий припев с запоминающимся мотивом, эмоциональным лид-вокалом, яркими многослойными синтезаторами, пульсирующим басом, четкими ударными four-on-the-floor, тонкими глитч-текстурами и широким полированным фестивальным миксом.
Прогрессив-хаус / EDM, 126 BPM, си-бемоль мажор. Задумчивые и ностальгические куплеты переходят в катарсический, эйфорический припев с плавным, чуть хриповатым мужским тенором, пульсирующими синтезаторами с сайдчейном, плотным клубным басом, четкими ударными и широкой реверберацией концертного зала.
Яркий пауэр-поп / поп-рок, 112 BPM, ми-бемоль мажор. Ностальгические, горьковато-сладкие куплеты взрываются катарсическими припевами, исполненными чистым женским меццо-сопрано с парящими октавными хуками, плотными ударными, широкими многослойными гитарами, тонкими синтезаторами и полированным современным миксом.
Понимание творческого замысла
Музыка, созданная с помощью ИИ, может звучать как полноценная песня и при этом отклоняться от исходного технического задания. Заданные инструменты могут постепенно исчезать из аранжировки, предполагаемый эмоциональный характер может ослабевать по мере развития песни, а запрошенный вокальный стиль может появиться только в одном фрагменте вместо того, чтобы оставаться целостным на протяжении всего произведения.
Music 3.0 представляет более выразительную структуру описания музыки. Вместо того чтобы суммировать все произведение с помощью одной глобальной метки, она использует структурированные описания (Structured Captions) для описания музыки с высокой временной детализацией. Эти описания задают жанр, темп, размер, тональность, сценарий использования и характер производства, а также отслеживают эмоциональный контур; вступление и уход основных и поддерживающих инструментов; развитие грува и басовой энергии; а также изменения вокальной подачи, гармонии и вокальных эффектов на уровне разделов.
Эти описания переводят субъективные впечатления от прослушивания в профессиональный каркас аранжировки, который модель может изучить и выполнить. В результате модель может более точно переводить творческий язык в конкретное музыкальное выражение, сохранять цельную музыкальную идентичность по мере развития песни и при этом вводить необходимые динамические вариации.
Чтобы сделать создание профессиональной музыки более доступным, мы также разработали систему улучшения промптов на основе шаблонов (Prompt Enhancement System). Она выбирает подходящий язык из тщательно подобранной библиотеки шаблонов структурированных описаний и применяет устоявшуюся музыкальную терминологию и принципы аранжировки, чтобы расширить простое описание пользователя до детальной, музыкально когерентной инструкции. Таким образом, создатели могут осуществлять точный контроль без освоения специального словаря — будь то интимное, сдержанное акустическое выступление; ночной R&B-трек с качающими хай-хэтами и глубоким басом 808; или кинематографический инструментал, вырастающий от интроспекции до масштабной интенсивности.
Пользовательский промпт
Демо
Теплый китайский поп / традиционная китайская баллада, 74 BPM, ля-бемоль мажор. Нежная ностальгия переходит в праздничный припев с зрелым мужским баритоном-тенором, изящным гучжэном, мягкими струнными, нежными акустическими текстурами, выразительным вибрато и естественным звучанием живой студии.
Гимновый стадионный поп-рок, 132 удара в минуту, ми-мажор. Воздушные, жизнерадостные куплеты переходят в наполненный адреналином припев с мощным женским меццо-сопрано, парящими октавными хуками, драйвовыми барабанами, широкими гитарами, мерцающей атмосферой и коротким невесомым бриджем.
Барочный поп / эмо-рок, 162 удара в минуту, ми-бемоль минор. Величественное, скорбное вступление ведет к королевскому финалу в стиле «стена звука» с хриплым театральным мужским баритонором, оркестровыми струнными, клавесином, искаженными гитарами, агрессивными барабанами и дерзким брейкдауном.
Более полные, разнообразные аранжировки
Задача генерации длинных песен заключается не просто в создании звука большей длительности, а в построении убедительного развития между частями. Эмоции должны нарастать и разрешаться, инструменты — вступать, накладываться и затихать в нужные моменты, а куплеты, припевы, бриджи и инструментальные проигрыши — служить единому направлению.
Music 3.0 решает эту задачу на двух уровнях. Во-первых, теги разделов в тексте — такие как [intro], [verse], [pre-chorus], [chorus], [bridge], [instrumental], [solo] и [outro] — определяют макроструктуру песни. Во-вторых, структурированное описание (Structured Caption) задает эмоциональное развитие, изменения в инструментарии, манеру вокала, ритмическую основу, орнаментальные тембры и пространственные эффекты на каждом этапе, превращая то, что и где меняется, в явное условие генерации.
На уровне модели Music 3.0 использует глобально-локальную гибридную языковую модель (Hybrid-LM). Глобальная LLM с параметрами 8B прогнозирует основные семантические и структурные токены кадр за кадром и поддерживает контекст всей песни. Локальная LLM с параметрами 0.6B прогнозирует акустические токены по оси глубины внутри каждого кадра, обеспечивая локальные звуковые детали. Такое разделение обязанностей поддерживает временную стабильность в песнях продолжительностью до пяти минут, сохраняя при этом богатую вариативность в пределах отдельных частей.
用户prompt
Demo
Воодушевляющий прогрессив-хаус / EDM, 126 ударов в минуту, ля-бемоль мажор. Сфокусированное вдохновение перерастает в эйфорическую кульминацию с теплым, слегка хриплым мужским тенором, парящими пентатоническими хуками, пробивными клубными барабанами, контролируемым басом, яркими синтезаторами и полированным панорамным миксом.
Бодрый фанк / ню-диско, 112 ударов в минуту, ми-бемоль мажор. Уверенный, дерзкий и праздничный, с гладким душевным мужским тенором, игривой стаккато-фразировкой, фальцетными срывами, хлесткими барабанами, упругим басом, ритмичной гитарой, глянцевыми клавишными и широким танцевальным миксом.
Мрачный эй-панк хип-хоп / индастриал-рэп, 108 ударов в минуту, си-бемоль минор. Зловещее проповедническое напряжение переходит в готовую для клуба катарсическую разрядку с хриплым мужским тенором, сочетающим агрессивный рэп, панк-крики и наводящие жуть песнопения поверх искаженной электроники, жестких барабанов и насыщенного баса.
Повышение качества звука
Убедительная композиция требует столь же убедительного звука. Music 3.0 обеспечивает существенное улучшение качества звука, создавая более открытые, чистые и сбалансированные миксы без лишней загроможденности и мутности.
Акустическое моделирование начинается с многоуровневого остаточного векторного квантования (RVQ). Первый слой использует кодовую книгу на 16 384 элемента, предназначенную для передачи основной семантики и структуры музыки. Слои 2–8 используют кодовые книги на 1024 элемента каждый и постепенно кодируют остаточные акустические детали. Во время обучения мы сначала обучаем начальный слой независимо, чтобы он максимально полно захватывал основную информацию; затем все восемь лет обучения проводятся совместно. Такая иерархическая конструкция сбалансированно сочетает семантическую емкость, стабильность генерации и восстановление деталей, одновременно уменьшая накопление ошибок при генерации длинных последовательностей.
Однако финальный рендеринг звука в Music 3.0 выходит за рамки дискретных токенов. На этапе инференса стек синтеза не загружает путь декодирования дискретного токенайзера. Вместо этого он объединяет непрерывные скрытые состояния из финальных слоев глобальной LLM (8B) и локальной LLM (0.6B), а затем генерирует звук напрямую с помощью сопоставления потоков (flow matching) и модели Flow-VAE. По сравнению с использованием только дискретных токенов, эти непрерывные признаки сохраняют более богатую высокоразмерную акустическую информацию, улучшая точность вокального произношения и физическую когерентность звучания инструментов.
Модуль сопоставления потоков на 2.4B отображает объединенные признаки языковой модели в скрытое пространство VAE. Модуль Flow-VAE на 123M унаследован от архитектуры MiniMax Speech и переобучен для достижения специфических для музыки динамического диапазона и спектральных распределений с целью восстановления финальной формы волны. Это позволяет модели точнее следовать указаниям по использованию инструментов и воспроизводить аутентичные приемы исполнения, такие как глиссандо и легато. Роли инструментов в аранжировке становятся более различимыми, низы сохраняют плотность, не маскируя микс, а мелкие звуковые детали остаются четкими даже в плотно сложенных продакшенах.
Эти улучшения охватывают весь спектр музыкального выражения: атаку струнных и звукоизвлечение смычком в сольных инструментах, плотность ударных и баса, разделение источников звука в плотных электронных аранжировках и ощущение пространства вокруг голоса. Music 3.0 приближает каждый из этих элементов к восприятию от прослушивания полноценно спродюсированной записи.
用户prompt
Demo
Футуристический мелодичный EDM / прогрессив-хаус. Задумчивые куплеты о памяти и цифровой идентичности перерастают в воодушевляющий, ориентированный на хуки припев с эмоциональным лид-вокалом, яркими многослойными синтезаторами, пульсирующим басом, плотными ударными four-on-the-floor, тонкими глитч-текстурами и широким полированным фестивальным миксом.
Легкая босанова / бразильский поп, 88 ударов в минуту, ре-бемоль мажор. Безмятежная и медитативная, постепенно перерастающая в тихую уверенность, с чистым интимным женским сопрано, расслабленной фразировкой, мягкими восходящими хуками, мягкой гитарой, фортепиано, сдержанным басом и деликатной перкуссией.
Теплая исцеляющая китайская баллада в стиле мандапоп, глубоко эмоциональная с легкими элементами рока, дуэт зрелого мужчины и женщины среднего возраста, зрелые родительские голоса в возрасте около 50–70 лет, мать поет мягкие нежные ведущие партии теплым зрелым мягким женским вокалом, слегка возрастной тембр, мудрый и нежный тон, отец обеспечивает глубокие низкие устойчивые поддерживающие гармонии, насыщенный зрелый мужской вокал, слегка потрепанный хриплый нижний регистр, начинается с фортепиано и пышных струнных на вступлении, припев постепенно нарастает за счет слоев ударных и электрогитары, заканчивается возвращением к чистому акустическому нежному затуханию, искренние подлинные эмоции без излишней драматизации, тонкая сдержанная родительская любовь в китайском стиле, гордое, но нежное невысказанное поощрение, сильный тайваньский акцент в вокале, эмоциональный, искренний, теплый родительский взгляд, перерастает в воодушевляющий надеющийся финал, мягкое шепотное интимное аутро вроде нежного ропотного зова домой, ностальгическая, но придающая сил песня о семейной любви, опытные зрелые голоса, без юношеского яркого тона.
Более естественный вокал
Именно в вокале синтетический характер генерируемой музыки зачастую проявляется наиболее ярко. Высокочастотные артефакты, жесткая фразировка, нечеткое произношение и неестественное дыхание могут разрушить эмоциональную связь слушателя, даже если песня в остальном отлично отполирована.
Music 3.0 представляет новую систему рендеринга аудио, разработанную для создания более естественного вокала студийного качества. Структурированное описание (Structured Caption) детально описывает тембр вокала, манеру исполнения, такие техники, как придыхание и фальцет, аранжировку гармоний, а также эффекты вроде задержки (delay) и Auto-Tune. Непрерывные скрытые состояния, объединенные из глобальной и локальной языковых моделей, передают эту информацию об исполнении в процессы генерации flow-matching и Flow-VAE. В совокупности эти механизмы уменьшают высокочастотные цифровые артефакты, характерные для сгенерированного вокала, одновременно улучшая контроль над мелодией, произношением, дыханием и многослойными гармониями.
Вокал способен более чутко реагировать на изменения эмоций и ритма — переходить от сдержанных куплетов к масштабным припевам или от четко артикулированной ритмичной подачи к протяжным, открытым мелодическим линиям. Гармонии разворачиваются более естественно вокруг лид-вокала, а дыхание становится частью выступления, а не синтетическим артефактом поверх него.
用户prompt
Demo
Акустическая босса-нова / фолк, 88 ударов в минуту, фа-диез мажор. Безмятежная, пасторальная и игривая композиция с бодрыми припевами, медовым женским сопрано с придыханием, расслабленной манерой речи-пения, переборами акустической гитары, теплым басом, легкой перкуссией и мягким затухающим финалом.
Бодрый фанк / современный R&B с глянцевым оттенком ню-диско. Игривые ночные куплет перетекают в праздничный танцевальный припев, с плавным душевным лид-вокалом, упругим басом, синкопированной ритм-гитарой, яркими клавишными, четкими ударными, неоновыми синтезаторными акцентами и теплым пространственным клубным миксом.
Теплый поп-рок / соул, 88 ударов в минуту, си-бемоль мажор. Интимная рефлексия перерастает в вдохновляющий гимн самооценки, исполненный опытным женским альтом с бархатной легкой хрипотцой, согретыми аналоговым звуком гитарами, ровными ударными, душевными клавишными, запоминающимися хуками и широкими кинематографичными припевами.
От творческого замысла и структуры песни до локальных акустических деталей и финального сведения аудио — Music 3.0 выводит генерацию музыки на новый уровень: от создания правдоподобного звука к воплощению целостного, гармоничного творческого замысла. Мы с нетерпением ждем ваших произведений.
