Голос может изменить ощущение всего разговора. Одни и те же слова могут звучать обнадеживающе, взволнованно, неуверенно или искренне в зависимости от того, как они произнесены. Для разработчиков, создающих голосовые интерфейсы, правильная подача часто означала необходимость обходить ограничения синтеза речи: выбирать из небольшого набора голосов, корректировать сценарии, чтобы добиться нужного тона, и надеяться, что голос останется стабильным на протяжении более длительного обмена репликами.
Запуск Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS знаменует шаг вперёд. Это новое поколение синтеза речи, которым разработчики могут управлять с большей точностью. Gemini 3.8 Flash TTS также предлагает расширенную библиотеку из более чем 2000 голосов, открывая гораздо больше возможностей выбора для разных языков и регионов.
В Agora мы рады тому, что это значит для тех, кто создаёт голосовые интерфейсы реального времени. Более выразительный голос даёт ИИ-агенту больше способов соответствовать моменту — будь то помощь клиенту, сопровождение пользователя в приложении или оживление истории.
Управление эмоциями, темпом и акцентом речи
Традиционный синтез речи начинается со сценария и создаёт аудио. Слова могут быть правильными, но подача не всегда соответствует намерению. Приветствие может звучать безжизненно. Извинение — бодро. Смену настроения в середине предложения бывает трудно передать.
Gemini 3.8 Flash TTS даёт разработчикам больше контроля над тем, как произносится речь. Они могут задавать такие характеристики, как эмоция, темп, характер и акцент, и менять стиль по мере изменения ситуации. Персонаж может начать реплику тихо, а закончить её с воодушевлением. Голосовой агент может ответить с теплотой, когда клиент расстроен, а затем звучать более жизнерадостно, когда проблема решена.
Этот контроль важен, потому что разговор динамичен. Люди меняют тон, когда слушают и отвечают. Предоставление разработчикам возможности формировать эти изменения приближает сгенерированную речь к тому опыту, который они пытаются создать.
Более 2000 голосов на разных языках и в разных регионах
Выбор голоса — ещё одна часть этого творческого процесса. Gemini 3.8 Flash TTS представляет расширенную библиотеку из более чем 2000 голосов, включая варианты, локализованные для конкретных языков и регионов. Исходные именованные голоса также остаются доступными.
Для разработчиков это означает больше возможностей найти голос, который подходит под опыт и аудиторию. Обучающее приложение, игровой персонаж и агент службы поддержки могут требовать разного звучания. Региональные варианты голоса также помогают продукту ощущаться более знакомым для аудитории в разных местах.
Размер библиотеки впечатляет, но настоящая ценность — в выборе. Команды могут выйти за рамки нескольких стандартных голосов и подумать о том, как продукт должен звучать для каждой аудитории и сценария использования.
Стабильность голоса и речь нескольких говорящих
Убедительный голосовой интерфейс должен работать не только в пределах одного предложения. В более длинном разговоре небольшие изменения качества голоса или акцента могут отвлекать. Обмен репликами между говорящими также должен ощущаться как разговор, с естественным темпом и ответами.
Gemini 3.8 Flash TTS разработан для улучшения стабильности при длинной речи и поддержки более естественного диалога с несколькими говорящими. Он добавляет больше реализма таким элементам, как дыхание, темп и смена реплик. Эти детали могут иметь большое значение в интерактивной истории, интерактивном уроке или голосовом агенте, который несколько минут помогает пользователю выполнить задачу.
Для приложений реального времени цель — создать опыт, в котором люди остаются вовлечёнными. Голос должен поддерживать взаимодействие — от первого приветствия до конца разговора.
Что разработчики могут создавать с помощью Gemini TTS
Мы видим широкий спектр возможностей для более выразительной сгенерированной речи: голосовые агенты, отвечающие с подходящим тоном, обучающие приложения, делающие диалог увлекательным, персонажи, остающиеся узнаваемыми на протяжении всей истории, и приложения, которые могут говорить с людьми голосами, подходящими для их языка и региона.
Разработчики сами решат, что создавать с помощью Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Этот запуск привлекателен тем, что теперь у них больше пространства для дизайна самого голоса. Они могут думать о подаче, индивидуальности и течении разговора наряду со словами на странице.
В Agora мы верим, что следующая волна голосового ИИ будет определяться опытом, в котором естественно участвовать. Более выразительная речь и гораздо более широкий диапазон голосов дают разработчикам новые инструменты для создания такого опыта.










