Сегодня мы рады представить MiniMax Speech 2.8.
Это не просто техническое обновление; это прорыв в аутентичности голоса. Благодаря встроенной поддержке звуковых тегов, высокоточному клонированию и студийной чистоте мы сокращаем разрыв между ИИ и человеческим голосом.
Наша миссия остаётся прежней: сделать синтетическую речь по-настоящему человеческой и неотличимой от живой.
1. Возвращая «нюанс»: учим ИИ делать паузы и дышать
В прошлом голоса ИИ часто казались холодными, потому что были «слишком идеальными». Настоящая человеческая речь наполнена несовершенными вдохами, паузами и запинками — тонкими сигналами, которые передают эмоции и выделяют ключевые моменты.
Speech 2.8 представляет нативные звуковые теги. Моделируя разговорные заполнители, такие как «э-э», «м-м» и «а-а», мы сохраняем естественный ритм, интонацию и паузы человеческого диалога.
Никакой больше роботизированной, плоской речи; тепло — в деталях.
Текст: «Эй, это я. Как дела? (смешок) Надеюсь, у тебя отличный день! У нас вчера был небольшой сумасшедший день запуска, знаешь, но (вдох) я уже восстановился и готов к работе. Ты слушаешь это и, наверное, думаешь, что я просто болтаю в микрофон, верно? Но вот в чём фишка: (прочищает горло) на самом деле я не человек. Я — новая модель Speech 2.8 от MiniMax. Безумие, правда? (смеётся) Если послушать внимательно, ты услышишь, как я управляю темпом, маленькими вдохами и даже этой непринуждённой атмосферой. Хорошего дня!»
Текст: «Эй, это я. Как дела? (смешок) Надеюсь, у тебя отличный день! У нас вчера был небольшой сумасшедший день запуска, знаешь, но (вдох) я уже восстановился и готов к работе. Ты слушаешь это и, наверное, думаешь, что я просто болтаю в микрофон, верно? Но вот в чём фишка: (прочищает горло) на самом деле я не человек. Я — новая модель Speech 2.8 от MiniMax. Безумие, правда? (смеётся) Если послушать внимательно, ты услышишь, как я управляю темпом, маленькими вдохами и даже этой непринуждённой атмосферой. Хорошего дня!»
2. Клонирование голоса: воспроизведите свой «голосовой отпечаток» за 10 секунд
Мы оптимизировали процесс извлечения признаков, чтобы достичь нового уровня сходства при клонировании голоса. Всего за 10-секундный образец Speech 2.8 точно улавливает вашу уникальную тембральную окраску, придыхание и даже ваш индивидуальный темп речи.
Результат — это не просто голос, который звучит «как» вы, — это вы.
Это английское демо показывает, как Speech 2.8 улавливает «душу» профессионального рассказчика:
Аутентичная разговорность: голос обладает качеством «прожитой» речи. Он не звучит как скованный диктор; вместо этого он звучит как надёжный друг, рассказывающий историю за чашкой кофе. Динамичная каденция: этот говорящий использует естественные заполнители и ритмичные паузы (например, «но в любом случае», «знаешь»), которые создают ощущение спонтанности и присутствия. Тёплый среднечастотный резонанс: тембр устойчивый и ровный, что даёт ощущение комфорта и надёжности и быстро устанавливает контакт со слушателем.
Аутентичная разговорность: голос обладает качеством «прожитой» речи. Он не звучит как скованный диктор; вместо этого он звучит как надёжный друг, рассказывающий историю за чашкой кофе.
Динамичная каденция: этот говорящий использует естественные заполнители и ритмичные паузы (например, «но в любом случае», «знаешь»), которые создают ощущение спонтанности и присутствия.
Тёплый среднечастотный резонанс: тембр устойчивый и ровный, что даёт ощущение комфорта и надёжности и быстро устанавливает контакт со слушателем.
3. Чистый звук: устранение фонового шума и цифровых артефактов
Чистота звука — основа премиального опыта.
Мы переработали наш процессорный движок, чтобы устранить фоновый шум и синтетические искажения. Результат — кристально чистое, прозрачное звучание, которое передаёт присутствие профессионального диктора, записывающегося в студии.
В глубине леса лежит тишина, которой не коснулся никто. Когда первый свет рассвета пробивается сквозь плотный полог, мир, кажется, затаил дыхание. Прислушайтесь — это мягкий шёпот ветра в соснах, звук настолько нежный, что он едва ли больше, чем секрет. Давайте задержимся в этом покое на мгновение, заново открывая истинную нежность, которую шумный мир так часто скрывает.
В глубине леса лежит тишина, которой не коснулся никто. Когда первый свет рассвета пробивается сквозь плотный полог, мир, кажется, затаил дыхание. Прислушайтесь — это мягкий шёпот ветра в соснах, звук настолько нежный, что он едва ли больше, чем секрет.
Давайте задержимся в этом покое на мгновение, заново открывая истинную нежность, которую шумный мир так часто скрывает.
Более продвинутая кросс-языковая производительность: глобальный голос для каждого рынка
Мы разрушаем языковые барьеры, устраняя «акцентное просачивание», которое часто возникает в речи ИИ.
Начиная с пары мандаринский-японский, мы исправили неестественные тоны и сдвиги произношения, чтобы каждый голос звучал как у настоящего носителя языка. Следите за обновлениями: скоро мы привнесём этот бесшовный опыт в ещё больше языков.
MiniMax Speech 2.8 уже доступен. Оцените следующее поколение интеллекта.
Интеллект для каждого.








