Руководство по словарю произношений: исправьте любое слово в TTS на Eleven v4

Источник: ElevenLabs

Руководство по словарю произношений: исправьте любое слово в TTS на Eleven v4

Источник: ElevenLabs

Исправьте произношение в моделях TTS с помощью словаря произношений. Узнайте, как использовать правила псевдонимов и фонем, а также встроенный IPA для точечных исправленией.

•Обновлено: 6 октября 2026 г.

Eleven v4 задает новый стандарт качества произношения для моделей синтеза речи (TTS), справляясь с аббревиатурами, техническими терминами, именами и текстами на нескольких языках точнее, чем любая предыдущая модель. Тем не менее, у каждого бренда есть свой собственный словарный запас — от уникальных названий продуктов до специфического для отрасли жаргона, а это значит, что вам нужен полный контроль над тем, как звучат эти слова.

Eleven v4 предлагает множество способов исправления произношения, предоставляя вам детальный контроль над тем, как говорит модель. Вы можете составить подробный словарь произношений, который будет применяться ко всем сценариям, создаваемым вами в приложении TTS. Либо вы можете записать IPA прямо в текст для точечного исправления.

Вот небольшой пример того, как Eleven v4 справляется со сценарием, насыщенным сложными терминами:

В 2:47 ночи телефон Шивон Лестер загорелся. Служба поиска в кластере Kubernetes превышала время ожидания. Она прочитала логи подов и нашла причину в релизе от вторника. Новая функция нечеткого поиска сравнивала каждый запрос со всем каталогом продуктов с использованием расстояния Левенштейна, поэтому каждый поиск занимал 1400 миллисекунд, что намного превышало односекундный лимит. Ее руководитель, пурист, цитирующий Дейкстру и Эйлера на код-ревью, хотел переписать сопоставитель с нуля. Вместо этого она откатилась до сборки от понедельника, и к 3:30 ночи откат был запущен, а время отклика вернулось к значениям менее 50 миллисекунд. Правильное исправление, индекс, который сужает каждый поиск до близких совпадений, было выпущено в релизе в четверг.

0:00

В этом руководстве рассказывается о том, как создавать и использовать словарь произношений для TTS, а также о сопутствующих стратегиях, которые можно применить, чтобы сделать ваше аудио максимально приближенным к тому, что вы задумали.

Резюме

  • Словарь произношений — это набор создаваемых вами правил, которые указывают модели синтеза речи, как произносить определенные слова или фразы.
  • Правила произношения для TTS основаны либо на псевдонимах (заменяющих один текст на другой), либо на фонемах (использующих фонетическое написание).
  • Eleven v4 поддерживает правила фонем и встроенный IPA (Международный фонетический алфавит).
  • Теги фонем и пауз SSML не работают в Eleven v4, но в качестве альтернативы на естественном языке вы можете использовать словарь произношений или аудио-теги.
  • Через ElevenAPI вы можете применять до трех словарей произношений на один запрос.

Что такое словарь произношений?

Словарь произношений — это инструмент, позволяющий точно настроить то, как модель синтеза речи произносит определенные слова. Добавляя определенные слова или фразы в словарь произношений, вы определяете, как они будут звучать при каждом появлении в сценарии TTS.

Словаре произношений обычно используются для:

  • Названий брендов: Названия брендов — частый элемент словарей произношений, особенно если у них уникальное или необычное написание.
  • Акронимов: Определенные акронимы имеют особый способ произношения. Например, AEO должен звучать как /ˌeɪ.iːˈoʊ/ («А-Е-О»), а не /eɪˈjoʊ/ («эй-йо»). Жесткое правило словаря гарантирует, что модель сделает все правильно каждый раз, когда вы его пишете.
  • Географических названий и других собственных имен: Некоторые географические названия при визуальном восприятии могут звучать совсем не так, как вы предполагаете. Вустершир — известный пример, когда руководство по произношению помогает избежать любых проблем.
  • Отраслевых терминов: Отраслевой жаргон или специализированные термины из медицинской или юридической сфер, например, могут выиграть от использования словаря произношений, если модель явно не проходила обучение на данных из этих секторов.

Вне контекста синтеза речи словари произношений обычно представляют собой краудсорсинговые репозитории аудиоклипов от носителей языка, которые учащиеся используют, чтобы услышать, как произносятся те или иные слова.

Как управлять произношением TTS в Eleven v4

Eleven v4 признана моделью синтеза речи высочайшего качества по версии Artificial Analysis' Provider Voice Arena. Отчасти то, что делает Eleven v4 лидером рынка, — это способность модели обрабатывать сложный текст, сохраняя при этом естественность звучания результата.

Чтобы предоставить пользователям наилучшие возможности при работе с Eleven v4, модель предлагает множество способов настройки произношения, гарантируя, что каждый результат будет соответствовать вашим стандартам точности.

Вот как вы можете управлять произношением с помощью Eleven v4:

  • Встроенный IPA: Вы можете писать IPA в своих сценариях между косыми чертами для управления произношением без использования словаря произношений. Вскоре мы коснемся деталей того, как это сделать.
  • Правила фонем в словарях: Записывайте правила на основе фонем в свои словари произношений, чтобы контролировать фонетическое звучание повторяющихся слов.
  • Свободное произношение на разных языках: Eleven v4 может генерировать естественно звучащую речь на более чем 90 языках. Сохраняйте родное произношение на каждом языке, используя один и тот же голос для обеспечения единого звукового фирменного стиля.

Вот как соотносятся различные модели ElevenLabs TTS по возможностям управления произношением:

Модель

Правила псевдонимов (словарь)

Правила фонем (словарь)

Встроенный IPA (/.../)

Теги фонем SSML (<phoneme>)

Eleven v4

Да

Да

Да

Eleven v4 Turbo

Да

Да

Да

Eleven v3

Да

Да

Да

Eleven Flash v2

Да

Да

Да (только для английского)

Eleven Turbo v2

Да

Да (только для английского)

Eleven Multilingual v2

Да

В чем разница между правилами псевдонимов и фонем в словаре произношений?

Правила произношения на основе псевдонимов заменяют один фрагмент текста другим перед тем, как модель произнесет слово. Это происходит в фоновом режиме всякий раз, когда модель генерирует аудио, заменяя звучание слова/фразы тем, что вы включили в свой словарь произношений.

Вот несколько примеров правил произношения на основе псевдонимов:

  • «SaaS» преобразуется в «сасс»
  • «UN» преобразуется в «United Nations»
  • «OAuth» преобразуется в «оу аф»

С другой стороны, правила фонем предоставляют модели точное фонетическое написание для использования. Их сложнее создавать, так как вам придется самостоятельно написать или сгенерировать транскрипцию IPA и ввести ее в свой словарь. Например, «Kubernetes» преобразуется в /ˌkuː.bərˈnɛt.iːz/.

Как исправить произношение названия бренда в модели TTS

Названия брендов — одна из самых частых записей в словарях произношений, так как они не всегда являются реальными словами. Если ваша компания изобрела слово или уникальное написание для своего бренда, модели TTS могут испытывать трудности с его правильным произношением, поскольку существует очень мало доступных обучающих данных, включающих это конкретное произношение.

Вот как исправить произношение названия бренда в Eleven v4:

  • Проверьте звучание по умолчанию: Откройте приложение Text to Speech и напишите название своего бренда. Сгенерируйте клип и послушайте, как он звучит. Если есть ошибка в произношении, вам нужно перейти к следующему шагу.
  • Попробуйте правило псевдонима: Самый простой способ исправить ошибку в произношении бренда — создать правило псевдонима. Их быстро писать, и они интуитивно понятны.
  • Переключитесь на правило фонем: Если ваше правило псевдонима работает не совсем так, как надо, прибегните к IPA. Транскрибируйте название вашего бренда с помощью IPA, а затем создайте правило в словаре произношений Text to Speech, чтобы исправить его произношение.
  • Охватите все варианты регистра: Обязательно включите транскрипцию IPA как для строчных, так и для прописных версий названия вашего бренда, если вы используете оба варианта.
  • Используйте встроенный IPA для разовых изменений: Если вам нужно быстро исправить ошибку в единичной генерации, вы можете просто добавить IPA прямо в свой сценарий, не настраивая запись в словаре.

После того как вы создадите правило для названия бренда, оно будет действовать во всех общих проектах в будущем — будь то в вашем ИИ-агенте или при доступе через API.

Как создать словарь произношений с ElevenLabs

Вы можете создать словарь произношений, добавив правила в приложении Text to Speech, загрузив файл .pls или через ElevenAPI. В этом руководстве мы рассмотрим первый вариант, который требует всего несколько шагов.

Вот шаги, которые необходимо выполнить для создания словаря произношений:

  • Откройте панель словарей произношений: На странице Text to Speech нажмите на строку поиска в верхней части, введите «Pronunciation dictionary» и выберите «Pronunciation dictionaries» в разделе Actions.
  • Создайте или выберите словарь: Нажмите «New», чтобы начать новый словарь, или выберите существующий из списка слева.
  • Добавьте правило: Нажмите «Add rule», чтобы создать новую строку. Введите слово, которое хотите исправить. В поле Input введите слово или фразу точно так же, как они написаны в ваших сценариях. Правила учитывают регистр, поэтому соблюдайте заглавные буквы.
  • Выберите тип правила: Выберите «Alias», чтобы заменить текст другим текстом, или «Phoneme», чтобы ввести написание IPA или CMU.
  • Введите замену: Введите псевдоним или фонетическую транскрипцию в поле Output. Используйте селектор голоса в верхней части панели, чтобы прослушать правило с тем голосом, с которым вы работаете.
  • Сохраните изменения: Нажмите «Save changes» в нижней части панели.

Чтобы привязать руководство по произношению к агенту или применить его через API, обратитесь к нашей документации по словарям произношений.

Как использовать IPA в функции Text to Speech в Eleven v4

Для небольших изменений или редких слов вам необязательно создавать новую запись в словаре произношений TTS, чтобы исправить ошибку. Вместо этого вы можете использовать встроенный IPA, чтобы точно указать модели, как произносить слово.

В Eleven v4 вы можете активировать встроенный IPA с помощью косых черт (слешей). Подобно аудиотегам, они добавляются прямо в ваш сценарий, чтобы сделать работу максимально простой. Вот несколько примеров использования IPA в Eleven v4:

  • Технические термины: Термин "/ˌbaɪoʊˈkemɪstri/" относится к изучению химических процессов.
  • Медицинская лексика: "/ɡluːˈkoʊs/" и "/ˈɪnsjəlɪn/" обычно используются для контроля таких состояний, как "/ˌdaɪəˈbiːtiːz/".
  • Названия брендов и продуктов: Наши серверы работают на "/ˌɛndʒɪnˈɛks/" для обработки всплесков трафика.

Между прочим, для тех, у кого нет лингвистического образования, использование конвертера IPA поможет получить правильную транскрипцию IPA для вставки в сценарий на основе текста на естественном языке.

Почему теги фонемов SSML не работают в Eleven v4

Eleven v4 не поддерживает SSML, вместо этого предлагая ряд более гибких функций, таких как аудиотеги и словари произношений, которые дают вам больше контроля над созданием финального аудио.

Каждая функция, предлагаемая SSML, имеет прямую замену в v4:

Тег SSML

Что он делал

Замена в Eleven v4

<phoneme>

Установка фонетического произношения

Встроенный IPA (/…/) или правило фонемы в словаре

<sub alias>

Замена текста перед произнесением

Правило псевдонима в словаре

<break>

Добавление паузы

Аудиотеги, такие как [pause], многоточия или переводы строк

<prosody rate>

Изменение скорости речи

Аудиотеги темпа, такие как [slowly] или [rushed]

<emphasis>

Выделение слова

Заглавные буквы или аудиотег подачи

Начните работу с естественным произношением текста в речи в Eleven v4

Благодаря целому ряду инструментов, помогающих повысить точность произношения в Eleven v4, вы можете писать подробные сценарии и заставлять модель воспроизводить их именно так, как вы задумали.

Создавайте словари произношений в приложении ElevenLabs Text to Speech и применяйте их в массовом порядке с помощью ElevenAPI.

Часто задаваемые вопросы

О чём эта статья

Что-то непонятно? Спросите по статье — объясню простыми словами.

Не хотите разбираться сами? Мы поможем.