В сфере голосового ИИ обычно задают один вопрос: какая модель самая лучшая?
Новые модели Gemini 3.8 Live от Google предлагают более практичный вопрос: какой тип разговора вы пытаетесь создать?
Gemini 3.8 Live отдает приоритет низкой задержке и немедленным ответам. Gemini 3.8 Live Extended Thinking разработана для диалогов, требующих более глубокого рассуждения, вызова нескольких инструментов и более сложного анализа.
Для разработчиков голосового ИИ выбор между ними сводится не столько к тому, какая модель мощнее, сколько к тому, какой опыт вы хотите создать.
Когда использовать Gemini 3.8 Live
Gemini 3.8 Live имеет смысл использовать для голосовых агентов, которые обрабатывают прямые вопросы и предсказуемые задачи.
Вспомните администратора, отвечающего на вопросы: «Во во сколько вы закрываетесь?» или «Могу ли я записаться на завтра?». На эти вопросы обычно есть простые ответы. Дополнительные рассуждения не приносят особой пользы и могут заставить абонента ждать дольше.
Небольшие задержки особенно заметны во время голосового разговора. Пауза, которая кажется нормальной в текстовом интерфейсе, по телефону может выглядеть неловко. Звонящие могут повторять свои слова, спрашивать, на месте ли агент, или думать, что соединение прервалось.
В голосовом ИИ задержка модели — это лишь часть общего восприятия. Обнаружение речи, передача по сети, инференс модели, выполнение инструментов и генерация аудио могут в совокупности создавать задержку, которую реально ощущает пользователь. Время отклика становится частью того, насколько удобно пользоваться агентом. Быстрый ответ создает впечатление внимательности и уверенности.
Это делает Gemini 3.8 Live отличным выбором для планирования встреч, проверки статуса заказов, базовой поддержки клиентов, квалификации лидов, маршрутизации звонков и ответов на часто задаваемые вопросы. Такие диалоги выигрывают от четких ответов, выдаваемых в естественном темпе.
Как асинхронные вызовы инструментов поддерживают непрерывность диалога
Gemini 3.8 Live также может выполнять асинхронные вызовы инструментов, позволяя агенту начать действие, не приостанавливая весь разговор в ожидании ответа от внешней системы.
Например, агент по записи на прием может начать проверку календаря, одновременно уточняя у звонящего предпочитаемое местоположение. Агент техподдержки по заказам может начать поиск информации о покупке, спрашивая, по какому именно товару звонит клиент.
Агент может продолжать сбор полезной информации, пока приложение ожидает результата работы инструмента.
Разработчики также могут управлять тем, как эти результаты попадают в разговор. Действие может выполняться незаметно в фоновом режиме, ждать окончания речи агента или прерывать его, если результат срочный.
Это дает приложениям больший контроль над ритмом звонка и позволяет уменьшить количество ненужных пауз.
Gemini 3.8 Live Extended Thinking лучше подходит для разговоров, требующих принятия более сложных решений.
Представьте, что вы звоните в авиакомпанию после отмены рейса. Агенту может потребоваться найти бронирование, понять пункт назначения пассажира, найти доступные рейсы, сравнить стыковки, проверить наличие мест, применить правила авиакомпании и оформить переоформление билета.
Лучший ответ может зависеть от информации из нескольких систем. Он также может зависеть от приоритетов пассажира. Одному путешественнику важнее прилететь в этот же вечер. Другой предпочтет прямой рейс на следующее утро.
Агенту необходимо собрать эти предпочтения, сравнить доступные варианты и решить, какие именно варианты стоит предложить.
Gemini 3.8 Live Extended Thinking может выполнять этот процесс в фоновом режиме и координировать вызовы нескольких инструментов во время разговора. Модель может продолжать генерировать аудио во время рассуждений или ожидания ответа от внешних систем.
Агент авиакомпании может сказать: «Я проверяю доступные маршруты. Прибытие сегодня вечером важнее для вас, чем избежание лишней пересадки?»
Это держит звонящего в курсе дела и одновременно собирает информацию, которая может улучшить рекомендацию.
Это похоже на то, как опытный оператор-человек справляется со сложным запросом: объясняет происходящее, задает целенаправленные вопросы и сужает круг доступных вариантов, приближаясь к результату.
Обновление контекста во время живого разговора
Обе модели Gemini 3.8 Live также позволяют приложениям обновлять контекст во время активного разговора. Приложение может внедрять новую информацию, добавлять структурированную историю диалога или обновлять данные, известные модели, без перезапуска сеанса.
Агент службы поддержки может получить информацию об учетной записи после того, как абонент пройдет верификацию личности. Агент по планированию может загрузить информацию о доступности после того, как узнает, какой офис предпочитает позвонивший. Помощник по продажам может получить технические характеристики после того, как клиент определит товар.
Это позволяет информации поступать в разговор тогда, когда она становится актуальной. Агент может начать с контекста, необходимого для начала звонка, а затем получать дополнительные данные по мере развития взаимодействия.
Модель управляет разговором, в то время как окружающее приложение предоставляет актуальную информацию из бизнес-систем.
Как выбрать правильную модель Gemini для вашего голосового агента
Gemini 3.8 Live подходит для разговоров с прямыми вопросами, предсказуемыми действиями и острой необходимостью немедленных ответов.
Gemini 3.8 Live Extended Thinking подходит для разговоров, связанных с расследованием, сравнением, планированием и координацией с использованием нескольких инструментов.
Одно голосовое приложение может сталкиваться с обоими типами задач. Агент службы поддержки может обрабатывать сбор идентификационных данных, балансы счетов и маршрутизацию с помощью быстрого паттерна взаимодействия. Спор по счетам или сложное изменение аккаунта могут потребовать более глубоких рассуждений и нескольких внешних действий.
Агентам голосового ИИ требуется надлежащий баланс задержки, рассуждений и автономности. Администратор должен отвечать на простой вопрос немедленно. Агент авиакомпании должен потратить достаточно времени, чтобы найти вариант, который действительно подойдет пассажиру.
Оба сценария могут восприниматься как интеллектуальные, поскольку каждый из них соответствующим образом реагирует на ситуацию.
Практический вопрос для разработчиков прост: что этот разговор требует от агента?
Ответ должен определять выбор модели.
Говы попробовать? Изучите интеграции Gemini 3.8 Live и Live Extended Thinking в документации Agora, чтобы начать работу.
