Строка текста может звучать совершенно по-разному в зависимости от того, как она произнесена. Фраза «Мне нужно, чтобы вы сохраняли спокойствие» будет звучать иначе, если её произносит врач, мягко успокаивающий испуганного пациента, или персонаж видеоигры, кричащий своему отряду перед броском в бой.
Сегодня мы выпускаем Eleven v4 — нашу самую эмоциональную модель синтеза речи на сегодняшний день, а также её вариант с низкой задержкой, Eleven v4 Turbo.
Признанная #1 по версии Artificial Analysis и выбираемая ~75% слушателей в слепых сравнительных тествах по сравнению с конкурирующими моделями, Eleven v4 была разработана для интерпретации тона, темпа, эмоций, характера и контекста. Она генерирует речь, которая может звучать драматично, нежно, срочно, комично или разговорно, сохраняя при этом индивидуальность говорящего. Более естественная динамика диалогов между несколькими спикерами делает беседы живыми, а не похожими на склеенные из отдельных реплик фрагменты. Спикеры реагируют на контекст разговора, создавая более естественный диалог и взаимодействие персонажей.
Новая архитектура, созданная для максимальной производительности
Созданная на совершенно новой архитектуре, Eleven v4 является нашей самой эмоциональной моделью Text to Speech, занявшей первое место по версии Artificial Analysis. Eleven v4 Turbo переносит ту же технологию в сценарии с низкой задержкой, такие как агенты. Благодаря средней задержке инференса около 100 мс, она может отвечать быстрее, чем средняя пауза между говорящими людьми.
Обе модели способны генерировать эмоциональную, а не механическую речь. Общее качество звука также стало выше во всем диапазоне, обеспечивая более чистое и естественное звучание.
Предыдущие поколения моделей синтеза речи умели читать текст вслух, но Eleven v4 придает речи эмоциональную глубину, которая воспринимается гораздо более естественно. Модель способна интерпретировать задуманный тон, темп речи, характер текста и контекст, чтобы создать эмоционально резонирующую речь.
[excited, happy] Большие новости, друзья. Наше летнее меню выходит в эту пятницу. И да, липкий рис с манго наконец-то возвращается.
0:00
[sleepy drowsy voice] Ммм, еще пять минут. [yawning] Обещаю встать сразу после того, как досмотрю этот сон.
0:00
Пользователи также имеют детальный контроль над результатами и могут описывать на естественном языке, как именно должна быть произнесена фраза. Они могут добавлять конкретные инструкции о том, как произносить определенные фразы, какие эмоции те должны передавать, и даже звуковые эффекты с помощью встроенных тегов, таких как [laughs], [said angrily in French accent], [light rain] или [phone buzzing]. Eleven v4 точнее следует этим аудиотегам и подсказкам, чем предыдущие модели, поэтому вы получаете именно ту подачу, которую описываете. Это упрощает режиссуру озвучки, проработку персонажей или их диалогов, а также другие задачи, где важна манера исполнения.
Документация для разработчиков ElevenLabs описывает полный синтаксис тегов и способы их применения через API. Поддержка фонем Международного фонетического алфавита (IPA) также была существенно улучшена, поэтому пользовательское произношение работает надежнее.
Eleven v4 также повышает стабильность и качество динамических разговоров между несколькими спикерами. Используя новый метод захвата индивидуальности говорящих, Eleven v4 сохраняет уникальные особенности каждого голоса. Модель способна поддерживать стабильное звучание речи в диалогах агентов, аудиокнигах или рекламе. Поскольку модель понимает контекст всей сцены, она генерирует естественный диалог, в котором спикеры реагируют на только что сказанное, а не просто склеивают изолированные реплики.
Модель Turbo для сценариев с низкой задержкой
Высококачественные голосовые модели обычно генерировали речь медленнее, из-за чего пользователям приходилось выбирать между быстрыми и выразительными голосовыми агентами. Многие выбирали квалифицированных, но монотонных агентов, которые могут казаться роботами растерянному клиенту, желающему лишь решить свою проблему.
Eleven v4 Turbo сочетает в себе скорость и эмоции, при этом среднее время до первого звука составляет около 150 мс. Это позволяет развертывать мощные агенты в бесчисленных отраслях: от теплых, успокаивающих агентов, способных точно произносить медицинские термины в здравоохранении, до говорящих в быстром темпе и использующих сленг агентов для развлечения игроков в видеоиграх.
Модель Eleven v4 Turbo создана для работы с платформой разговорных агентов ElevenLabs — ElevenAgents. Создатели других агентов объединяют модели и программное обеспечение от разных поставщиков, из-за чего пользователи лишены возможности дорабатывать или улучшать результаты работы модели под свои конкретные задачи. Исследовательские и инженерные команды ElevenLabs оптимизировали Eleven v4 Turbo и ElevenAgents как единую систему, создавая более выразительные, надежные агенты с низкой задержкой.
Один голос, множество языков
Способ нашего общения меняется в зависимости от контекста, места и даже времени суток. Создание выразительной речи, отражающей это на разных языках, остается одной из самых сложных задач в аудиальном ИИ.
Eleven v4 представляет собой шаг вперед во всех этих аспектах, причем улучшения выходят далеко за рамки того, как модель произносит фразы. Eleven v4 лучше улавливает ритм, эмоции и подачу на разных языках, помогая создателям контента производить речь, которая звучит естественно для конкретного языка и контекста. Например, то, как вы обратитесь к пожилому незнакомцу в Японии, сильно отличается от того, как вы заговорили бы с ним в Италии.
И Eleven v4, и Eleven v4 Turbo поддерживают более 90 языков. Теперь голос, записанный на одном языке, свободно говорит и на любом другом, перенимая акцент носителя языка, но сохраняя индивидуальность оригинала. Такое следование акценту стало заметно сильнее, чем раньше, поэтому голос больше не «сползает» обратно к исходному акценту в процессе генерации.
Каталанский
Sovint caminem per la vida amb la mirada fixada en l'horitzó, preocupats pel demà, sense adonar-nos que el miracle real està passant just sota els nostres peus.
0:00
Испанский
El viento susurra historias olvidadas entre las hojas secas del parque. La ciudad aún duerme bajo un manto de neblina dorada, ajena al bullicio que pronto inundará sus calles. Un viejo farol parpadea por última vez antes de ceder su lugar a los primeros rayos del sol. En este preciso instante, el tiempo parece detenerse.
0:00
Для дубляжа и локализации это означает, что выбранный вами голос бренда — будь то известный актер, с которым вы сотрудничаете, или тон, наиболее подходящий под стиль вашей компании — будет звучать великолепно на любом языке, поддерживаемом Eleven v4.
Более аутентичное и стабильное клонирование голоса
Клонирование голоса стало более аутентичным, мощным и стабильным в Eleven v4 и Eleven v4 Turbo, обеспечивая значительно большую схожесть с исходным голосом. Функция мгновенного клонирования голоса (Instant Voice Clones) теперь способна захватывать голоса с высокой точностью, используя всего 10 секунд аудио.
Реальный голос
Эй, большое спасибо, что подождали. Э-э, в общем, я открыл ваш аккаунт, и похоже, что списание действительно прошло дважды одиннадцатого числа, что, да, определенно не должно было произойти. Позвольте мне оформить вам возврат прямо сейчас.
0:00
Eleven v4
Эй, спасибо большое за ожидание. Так, я открыл ваш учетный запись, и похоже, что списание действительно прошло дважды 11-го числа, чего, да, определенно быть не должно. Давайте я прямо сейчас оформлю для вас этот возврат.
0:00
Eleven v4 также более надежно сохраняет идентичность диктора при генерации длинных текстов, диалогов, закадрового текста и переозвученных реплик. Это означает, что в долгосрочных проектах персонажи, рассказчики и клонированные голоса остаются неизменными на протяжении всего производства. Eleven v4 также добавляет поддержку профессиональных клонов голоса (PVC) для задач клонирования наивысшего качества.
Связывание запросов — объединение генераций в цепочки для контента большей длины — также стало значительно надежнее в Eleven v4, что улучшает работу в ElevenLabs Studio и читалки ElevenLabs Reader App.
Услышьте разницу сами
Eleven v4 и Eleven v4 Turbo являются результатом наших последних исследований в области выразительной генерации речи. Они созданы для контента, где манера подачи важна не меньше, чем сами слова — будь то аудиокниги, игра персонажей, озвучка, дубляж или локализация разговорных агентов.
Обе модели уже доступны в ElevenAgents, ElevenCreative и через ElevenAPI. Создайте бесплатную учетную запись, чтобы начать генерацию с Eleven v4 или Eleven v4 Turbo уже сегодня.












