Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Novoe pokolenie golosa gemini 38 flash tts dlya razrabotchikov golosovogo ii 2
Dev48

© 2026 · All rights reserved.

Новое поколение голоса: Gemini 3.8 Flash TTS для разработчиков голосового ИИ

Источник: Agora

Новое поколение голоса: Gemini 3.8 Flash TTS для разработчиков голосового ИИ

Источник: Agora

Изучите Gemini 3.8 text-to-speech, выразительное управление голосом и то, что новейшие возможности генерации речи могут значить для разработчиков, создающих голосовой ИИ.

28 сентября 2026 г.•Обновлено: 28 сентября 2026 г.

Голос может изменить ощущение всего разговора. Одни и те же слова могут звучать обнадеживающе, взволнованно, неуверенно или искренне в зависимости от того, как они произнесены. Для разработчиков, создающих голосовые интерфейсы, правильная подача часто означала необходимость обходить ограничения синтеза речи: выбирать из небольшого набора голосов, корректировать сценарии, чтобы добиться нужного тона, и надеяться, что голос останется стабильным на протяжении более длительного обмена репликами.

Запуск Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS знаменует шаг вперёд. Это новое поколение синтеза речи, которым разработчики могут управлять с большей точностью. Gemini 3.8 Flash TTS также предлагает расширенную библиотеку из более чем 2000 голосов, открывая гораздо больше возможностей выбора для разных языков и регионов.

В Agora мы рады тому, что это значит для тех, кто создаёт голосовые интерфейсы реального времени. Более выразительный голос даёт ИИ-агенту больше способов соответствовать моменту — будь то помощь клиенту, сопровождение пользователя в приложении или оживление истории.

Управление эмоциями, темпом и акцентом речи

Традиционный синтез речи начинается со сценария и создаёт аудио. Слова могут быть правильными, но подача не всегда соответствует намерению. Приветствие может звучать безжизненно. Извинение — бодро. Смену настроения в середине предложения бывает трудно передать.

Gemini 3.8 Flash TTS даёт разработчикам больше контроля над тем, как произносится речь. Они могут задавать такие характеристики, как эмоция, темп, характер и акцент, и менять стиль по мере изменения ситуации. Персонаж может начать реплику тихо, а закончить её с воодушевлением. Голосовой агент может ответить с теплотой, когда клиент расстроен, а затем звучать более жизнерадостно, когда проблема решена.

Этот контроль важен, потому что разговор динамичен. Люди меняют тон, когда слушают и отвечают. Предоставление разработчикам возможности формировать эти изменения приближает сгенерированную речь к тому опыту, который они пытаются создать.

Более 2000 голосов на разных языках и в разных регионах

Выбор голоса — ещё одна часть этого творческого процесса. Gemini 3.8 Flash TTS представляет расширенную библиотеку из более чем 2000 голосов, включая варианты, локализованные для конкретных языков и регионов. Исходные именованные голоса также остаются доступными.

Для разработчиков это означает больше возможностей найти голос, который подходит под опыт и аудиторию. Обучающее приложение, игровой персонаж и агент службы поддержки могут требовать разного звучания. Региональные варианты голоса также помогают продукту ощущаться более знакомым для аудитории в разных местах.

Размер библиотеки впечатляет, но настоящая ценность — в выборе. Команды могут выйти за рамки нескольких стандартных голосов и подумать о том, как продукт должен звучать для каждой аудитории и сценария использования.

Стабильность голоса и речь нескольких говорящих

Убедительный голосовой интерфейс должен работать не только в пределах одного предложения. В более длинном разговоре небольшие изменения качества голоса или акцента могут отвлекать. Обмен репликами между говорящими также должен ощущаться как разговор, с естественным темпом и ответами.

Gemini 3.8 Flash TTS разработан для улучшения стабильности при длинной речи и поддержки более естественного диалога с несколькими говорящими. Он добавляет больше реализма таким элементам, как дыхание, темп и смена реплик. Эти детали могут иметь большое значение в интерактивной истории, интерактивном уроке или голосовом агенте, который несколько минут помогает пользователю выполнить задачу.

Для приложений реального времени цель — создать опыт, в котором люди остаются вовлечёнными. Голос должен поддерживать взаимодействие — от первого приветствия до конца разговора.

Что разработчики могут создавать с помощью Gemini TTS

Мы видим широкий спектр возможностей для более выразительной сгенерированной речи: голосовые агенты, отвечающие с подходящим тоном, обучающие приложения, делающие диалог увлекательным, персонажи, остающиеся узнаваемыми на протяжении всей истории, и приложения, которые могут говорить с людьми голосами, подходящими для их языка и региона.

Разработчики сами решат, что создавать с помощью Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Этот запуск привлекателен тем, что теперь у них больше пространства для дизайна самого голоса. Они могут думать о подаче, индивидуальности и течении разговора наряду со словами на странице.

В Agora мы верим, что следующая волна голосового ИИ будет определяться опытом, в котором естественно участвовать. Более выразительная речь и гораздо более широкий диапазон голосов дают разработчикам новые инструменты для создания такого опыта.

← Все статьи

Ещё в разделе «Медиа, контент и развлечения»

Все →
Может ли Muse преодолеть проблемы доверия Meta?Пресса
Meta

Может ли Muse преодолеть проблемы доверия Meta?

Агент Muse от Meta атакует одно из самых прибыльных слабых мест экономикиПресса
Meta

Агент Muse от Meta атакует одно из самых прибыльных слабых мест экономики

Meta и YouTube заявили, что все-таки будут показывать рекламу документального фильма о Маске
Пресса
Meta

Meta и YouTube заявили, что все-таки будут показывать рекламу документального фильма о Маске

На Meta Connect умные очки компании были повсюдуПресса
Meta

На Meta Connect умные очки компании были повсюду

У Automattic новый совет директоров после неудачной попытки отправить генерального директора в отпускПресса
Automattic

У Automattic новый совет директоров после неудачной попытки отправить генерального директора в отпуск

Meta открывает программу раннего доступа к новым функциям MuseПресса
Meta

Meta открывает программу раннего доступа к новым функциям Muse

Ещё от Agora

Голосовой ИИ, который слушает, пока говорит: внутри GPT-Live-1
Agora

Голосовой ИИ, который слушает, пока говорит: внутри GPT-Live-1

Gemini 3.8 Live против Extended Thinking: что лучше для голосового ИИ?
Agora

Gemini 3.8 Live против Extended Thinking: что лучше для голосового ИИ?

Как задержка между репликами влияет на голосовой ИИ?
Agora

Как задержка между репликами влияет на голосовой ИИ?

Голосовой ИИ, который слушает, пока говорит: внутри GPT-Live-1
Agora

Голосовой ИИ, который слушает, пока говорит: внутри GPT-Live-1

Говорительный ИИ, который слушает во время разговора: изнутри GPT-Live-1
Agora

Говорительный ИИ, который слушает во время разговора: изнутри GPT-Live-1

Agora: как RTE-платформа превращает звонки и стримы в конкурентное преимущество
Agora

Agora: как RTE-платформа превращает звонки и стримы в конкурентное преимущество