Вы находитесь на середине объяснения проблемы, когда голосовой ассистент начинает отвечать не на тот вопрос. Вы пытаетесь его исправить. Он продолжает говорить.
К тому моменту, когда у вас появляется еще один шанс, вы уже забыли часть того, что хотели сказать.
Это по-прежнему привычная ситуация при использовании голосового ИИ. Голос может звучать отлично, а ответ — быть точным, но сам разговор все равно требует больше усилий, чем следовало бы.
Вы начинаете адаптироваться. Вы делаете свои вопросы короче. Вы избегаете пауз, потому что ассистент может решить, что вы закончили. Вы выжидаете ненужное вам объяснение, потому что перебивать кажется ненадежным.
В конце концов, вы начинаете говорить так, как удобно программе, чтобы она работала.
GPT-Live-1 решает эту проблему с помощью полнодуплексного голосового взаимодействия: возможности слушать и говорить одновременно. Он также может поддерживать разговор, пока отдельный ИИ-агент работает над вашим запросом.
Это дает ему возможность справляться с тем, что люди делают постоянно: менять запрос прямо во время его объяснения.
«Кстати, есть еще одна вещь».
Эти шесть слов могут изменить всю задачу.
Представьте, что вы получаете помощь с роутером. Вы говорите, что соединение постоянно обрывается, и ассистент начинает объяснять, как его перезагрузить. Вы прерываете его:
«Я уже делал это дважды. Это происходит только тогда, когда я нахожусь на видеозвонке».
Это исправление важнее, чем остальные инструкции по перезагрузке.
Полезный ассистент должен остановиться, услышать это и продвинуть разговор вперед. GPT-Live-1 поддерживает такой обмен репликами, поскольку может продолжать принимать речь во время собственного выступления.
Для разработчиков это создает гораздо лучшую основу для естественной обработки прерываний и вклинивания в разговор.
Слушание также включает в себя короткие подтверждения. Быстрое «угу» во время вашего выступления говорит о том, что собеседник следит за ходом мыслей.
Это называется поддакиванием (backchanneling), и GPT-Live-1 поддерживает эту функцию.
Тишина может заставить вас задуматься, услышал ли вас ассистент, в то время как полный ответ может перебить вас. Полезная золотая середина — это краткое подтверждение, которое позволяет вам закончить мысль.
Слишком большое его количество быстро начинает раздражать. Тайминг важнее частоты.
Продолжайте разговор во время выполнения работы
Многие запросы требуют большего, чем просто устный ответ.
Кому-то может потребоваться что-то найти, сравнить варианты, проверить информацию в приложении или выполнить действие с помощью подключенного инструмента.
GPT-Live-1 может передать эту работу отдельному агенту, оставаясь при этом участником разговора.
Представьте, что вы просите помочь с выбором авиабилета. Рабочий агент начинает проверять варианты с помощью подключенных инструментов приложения для путешествий.
Пока он это делает, вы вспоминаете, что не можете уехать раньше шести.
Затем вы добавляете, что предпочли бы заплатить немного больше, чем иметь длинную пересадку.
Эти детали поступают естественным образом. У вас не было готовых требований к моменту начала разговора.
Система, построенная вокруг непрерывного разговора, имеет возможность услышать эти обновления и передать измененный запрос агенту, выполняющему работу.
Инструменты путешествий все равно должны существовать, и приложение должно правильно обрабатывать обновления. GPT-Live-1 не превращается автоматически в службу бронирования.
Он предоставляет способ продолжать разговор, пока идет полезная работа, вместо того чтобы превращать каждый поиск или вызов инструмента в паузу в разговоре.
Это разделение также дает разработчикам более четкую архитектуру.
Голосовая модель управляет разговором. Рабочий агент выполняет задачу.
Голосовой уровень может сосредоточиться на прослушивании, говорении и поддержании естественности взаимодействия, в то время как рабочий агент занимается поиском, процедурами, рассуждениями и подключенными инструментами.
Перенос контекста через весь разговор
Приложение может предоставить GPT-Live-1 релевантную предысторию до начала звонка.
Оно может передать предыдущие сообщения или другую информацию, необходимую ассистенту для понимания того, почему кто-то звонит.
Рассмотрите клиента, который уже описал поврежденную доставку в чате поддержки.
Имея этот контекст, предоставленный приложением, голосовой ассистент может начать с существующей проблемы, а не просить клиента объяснять все заново.
Это может быть небольшим изменением с точки зрения компании и большим — с точки зрения клиента.
Повторение проблемы особенно расстраивает, когда вы уже пытаетесь ее решить.
Важная деталь заключается в том, что историю предоставляет приложение. Ассистент не знает автоматически, что произошло на другом канале. Разработчикам по-прежнему необходимо связывать эти записи и решать, какая информация относится к разговору.
GPT-Live-1 также может суммировать предыдущий разговор по мере увеличения продолжительности сеанса. Это помогает поддерживать непрерывность, не перенося каждое предыдущее слово дальше.
Точные записи по-прежнему принадлежат приложению, особенно когда необходимо точно сохранить имя, номер, адрес или подтвержденное решение.
Информация также может добавляться во время звонка.
Некоторые обновления полезно знать ассистенту тихо. Другие готовы к тому, чтобы рассказать их человеку.
Например, приложение поддержки может сообщить ассистенту, что поиск заказа все еще выполняется. Звонящему не нужно голосовое объявление для каждого внутреннего шага.
Когда результат поступает, приложение может предоставить обновление, предназначенное для озвучивания: замена отправлена, а предполагаемая дата доставки — пятница.
GPT-Live-1 поддерживает это различие между фоновым контекстом и информацией, предназначенной для произнесения.
Инструкции также могут меняться по мере развития взаимодействия.
Представьте себе человека, который следует объяснению по устранению неполадок и говорит:
«Потише. Просто давайте мне по одному шагу за раз».
Система может подстроиться без запуска нового звонка. Предпочтения в языке и запросы на более короткие ответы могут обрабатываться аналогичным образом.
Есть также возможность для пользователя печатать текст, продолжая использовать голос. Приложение может позволить пользователю ввести название продукта, номер подтверждения или вопрос для рабочего агента, а затем обсудить результат вслух.
Иногда печатать просто проще, чем что-то произносить.
Голос является частью опыта
GPT-Live-1 может быть запрограммирован на то, чтобы сначала поприветствовать человека, что полезно, когда звонящий ожидает, что ассистент представится.
Он также поддерживает пользовательские голоса для проектов с необходимым доступом, давая разработчикам больше контроля над тем, как звучит ассистент и как начинается взаимодействие.
Но узнаваемый голос не может компенсировать плохое умение слушать.
Следующий скачок в голосовом ИИ — это не просто придание голосам более человечного звучания. Это обеспечение того, чтобы разговор работал более естественно.
Это означает работу с паузами, прерываниями, исправлениями, незавершенными мыслями и деталями, которые поступают с опозданием.
У разработчиков все еще есть важные задачи, которые нужно правильно решить за кулисами разговора.
Прерывание объяснения не должно случайно отменить заказ. Ассистент никогда не должен объявлять об успехе до того, как действие будет подтверждено. Контекстом нужно управлять осторожно, а подключенные инструменты по-прежнему нуждаются в надежной логике приложения.
Но цель проста.
Вы должны иметь возможность объяснить проблему по-своему, прервать собеседника, если что-то идет не так, и добавить детальную информацию, когда вы ее вспомните.
Чем меньше людям приходится управлять ассистентом, тем больше голосовой ИИ начинает напоминать реальный разговор.
Готовы попробовать? Изучите интеграцию GPT-Live-1 в документации Agora, чтобы начать работу.
