Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Gemini 38 text to speech govorit privet
Dev48

© 2026 · All rights reserved.

Gemini 3.8 text-to-speech говорит «привет»

Источник: Google

Gemini 3.8 text-to-speech говорит «привет»

Источник: Google

Gemini 3.8 Fla h-Lite TTS и Gemini 3.8 Fla h TTS — наши самые выразительные аудиомодели на сегодняшний день.

25 сентября 2026 г.

23 сентября 2026 г.

Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS — наши самые выразительные модели для генерации аудио. Создавайте уникальные голоса персонажей и управляйте диалогами в сценах с помощью Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook и Google Vids.

Лиланд Речис

Групповой менеджер по продукту

Алан Коуэн

Директор по научным исследованиям, от имени команды Gemini Audio

Сегодня мы представляем две новые модели преобразования текста в речь (TTS) для семейства Gemini, превращая генерацию голоса из статических пресетов в динамичную творческую студию. Эти модели позволяют авторам, разработчикам и предприятиям создавать более богатый и выразительный аудиоконтент, а также улучшают пользовательский опыт в таких продуктах, как Gemini Notebook и Google Vids.

  • Gemini 3.8 Flash TTS: создана для глубокой творческой режиссуры и дизайна персонажей. Создавайте совершенно новые голоса с нуля, используя подсказки на естественном языке, чтобы оживить персонажей в играх, иммерсивных аудиокнигах, подкастах и интерактивных медиа. Управляйте каждым выступлением построчно с детальным контролем над актерскими ремарками, темпом, диалектными особенностями и фоновыми реакциями.
  • Gemini 3.8 Flash-Lite TTS: создана для высокообъемного и экономически эффективного масштабирования. Оптимизирована для массового дубляжа, создания аудиоконтента и выразительных голосовых агентов с тонкой настройкой тона, темпа и эмоциональных нюансов.

Эти модели дополняют наше быстрорастущее семейство Gemini Audio, следуя за 3.5 Live Translate, 3.5 Transcribe, 3.8 Live и 3.8 Live Extended Thinking.

Создавайте и настраивайте свои собственные голоса

Расширьте возможности от 30 оригинальных голосов до бесконечной библиотеки. Если вам нужен совершенно оригинальный голос персонажа или постоянный бренд-амбассадор, наша модель 3.8 Flash TTS обеспечит работу полноценной вокальной студии. Это позволяет создавать и использовать выразительные, естественно звучащие голоса для любого момента, предоставляя разработчикам и предприятиям возможность легко создавать пользовательские аудиорешения.

  • Генеративный дизайн голоса: с помощью Gemini 3.8 Flash TTS создавайте уникальные голоса с нуля, настраивая роль, акцент и характеристики голоса на более чем 100 языках и диалектах с помощью подсказок на естественном языке — будь то оживление драматичного огнедышащего дракона или создание харизматичного рассказчика с отчетливым региональным акцентом.
  • Обширная библиотека голосов: доступ к более чем 2000 готовых к использованию голосов с широким языковым охватом, включая региональные варианты, такие как мексиканский испанский, квебекский французский и шотландский английский.
  • Репликация голоса: воссоздавайте стабильные вокальные профили всего по 30-секундному аудиообразцу вашего голоса или голоса, на использование которого у вас есть права, при поддержке встроенной проверки согласия, водяных знаков SynthID и учетных данных C2PA для защиты как разработчиков, так и их вокальных талантов.
  • Сохранение и масштабирование: сохраняйте и управляйте созданными вами пользовательскими голосами, чтобы обеспечить стабильное качество и минимальные отклонения в текущих проектах.
  • Ремикширование голоса: скоро появится возможность выбрать голос из нашей библиотеки и настроить тембр, высоту тона, темп и акцент. Используйте подсказки для точной настройки характеристик (например, «добавить легкий южный акцент США» или «смягчить подачу»).

Режиссируйте выступление, строка за строкой

После выбора голосов обе модели TTS дают вам точный контроль над тем, как произносится каждая строка.

  • Режиссура построчно: пишите собственные сценические указания или позвольте Gemini управлять подачей с помощью естественных ремарок к сценарию — от спокойного агента службы поддержки до шепота в сцене саспенса.
  • Генерация длинных форм: поддерживайте высокое качество голоса, естественный темп и тембр персонажа на протяжении часов непрерывного аудио с минимальным дрейфом спикера — идеально для подкастов и аудиокниг.
  • Нативная постановка сцены с двумя спикерами: бесшовно управляйте многоходовыми диалогами из одного сценария — будь то подкаст или драматическое повествование — сохраняя при этом четкое разделение голосов с естественной очередностью реплик.
  • Сценарные вокальные всплески и фоновые реакции: добавляйте реалистичную разговорную текстуру, используя невербальные сигналы (например, <смех>, <вздох>, <всхлип>) и междометия активного слушания (например, |мгм| или |да|) для точного комедийного тайминга и реакций.

Получите выразительную высококачественную генерацию речи, созданную для глобального масштаба

Gemini 3.8 Flash TTS обеспечивает передовые возможности настройки голоса, занимая 1-е место в общем зачете по тесту Hume AI Voice Design Benchmark (71,4) и лидируя в моделировании акцентов (60,8).

Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS обеспечивают по-настоящему выразительное исполнение без ущерба для надежности, также занимая 1-е и 2-е места соответственно в индексе общего качества Hume AI. Модель демонстрирует значительные улучшения в широком спектре сценариев использования, таких как длинный контент и управление сценарием с двумя спикерами, по сравнению с Gemini 3.1 Flash TTS.

В слепых оценках предпочтений пользователей на Voice Arena, Gemini 3.8 Flash и Flash-Lite TTS занимают лидирующие позиции среди конкурентов на ключевых мировых языках, включая японский, бразильский португальский, вьетнамский, современный стандартный арабский (MSA), мексиканский испанский и хинди. Благодаря поддержке более 100 языков эти модели позволяют авторам, разработчикам и предприятиям создавать высококачественные многоязычные голосовые решения по всему миру.

Создавайте с доверием, согласием и прозрачностью

Мы создали наши возможности создания и репликации голоса со строгими мерами безопасности, чтобы помочь защитить вокальные таланты, уважать личность и обеспечить прозрачность контента. Для репликации голоса наша система использует проверку согласия: пользователи должны предоставить запись устного согласия от владельца голоса, которая соответствует эталонному спикеру, прежде чем голос может быть создан.

В более широком смысле, каждый аудиоклип, созданный нашими моделями Gemini Audio, снабжен водяным знаком SynthID. Этот незаметный водяной знак вплетается непосредственно в аудиовыход, гарантируя, что сгенерированная ИИ речь остается обнаруживаемой, что помогает предотвратить дезинформацию. Для получения более подробной информации о нашем подходе к безопасности и ответственности ознакомьтесь с карточкой модели.

Попробуйте нашу новую аудио-песочницу Google AI Studio

Начиная с сегодняшнего дня, разработчики могут опробовать эти новые возможности генерации речи в Google AI Studio. Созданная как рабочее пространство для дизайна голоса, она позволяет создавать совершенно новые вокальные идентичности с нуля или реплицировать свой собственный голос 1, а затем переносить их непосредственно в редактор сценариев с двумя спикерами для управления построчной подачей.

Попробуйте репликацию голоса в Google AI Studio.

Легко развертывайте высокопроизводительные голосовые интерфейсы

Используя Gemini API, платформы для разработчиков, такие как Agora, LiveKit, Pipecat, Vercel, позволяют разработчикам легко создавать и развертывать высокопроизводительные решения для генерации речи.

Мы сотрудничаем с такими компаниями, как Figma, HeyGen, Linguana, Wondercraft, 99.co и Ollang, которые интегрируют наши новейшие модели TTS, чтобы помочь ускорить глобальный дубляж, локализовать медиа с нюансированными региональными акцентами и обеспечить работу разговорных голосовых агентов в масштабе.

Начните использовать наши новейшие модели Gemini Audio:

Gemini 3.8 Flash TTS выходит начиная с сегодняшнего дня:

  • Для разработчиков: в Gemini API и Google AI Studio
  • Для предприятий: скоро через API в Gemini Enterprise
  • Для всех: в Gemini Notebook.

Gemini 3.8 Flash-Lite TTS выходит начиная с сегодняшнего дня:

  • Для разработчиков: в Gemini API и Google AI Studio
  • Для корпоративных клиентов: скоро через API в Gemini Enterprise
  • Для всех: в Google Vids

Получайте последние новости от Google на свою электронную почту

Подпишитесь на наши рассылки с обновлениями продуктов, информацией о мероприятиях, специальными предложениями и многим другим.

Ваша информация будет использоваться в соответствии с политикой конфиденциальности Google. Вы можете отказаться от рассылки в любое время.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Создание производственных агентов с помощью Jev и LangGraph
LangChain

Создание производственных агентов с помощью Jev и LangGraph

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов
LangChain

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактовПресса
OpenAI

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактов

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержекПресса
Tesla

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержек

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое
LangChain

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое

Tesla готовится к масштабному производству тяжелых грузовиков Semi с открытием завода в НевадеПресса
Tesla

Tesla готовится к масштабному производству тяжелых грузовиков Semi с открытием завода в Неваде

Ещё от DeepMind

Представляем Gemini 3.8 Live с функцией Live Avatar
DeepMind

Представляем Gemini 3.8 Live с функцией Live Avatar

Развитие Private AI Compute с помощью безопасной серверной памяти
DeepMind

Развитие Private AI Compute с помощью безопасной серверной памяти

Представляем Gemini 3.8 Live и 3.8 Live Extended Thinking
DeepMind

Представляем Gemini 3.8 Live и 3.8 Live Extended Thinking

AlphaGenome Atlas: прогностическая карта всех возможных изменений букв ДНК в геноме человека
DeepMind

AlphaGenome Atlas: прогностическая карта всех возможных изменений букв ДНК в геноме человека