Что такое детектор активности голоса и как он работает?

Источник: ElevenLabs•

Что такое детектор активности голоса и как он работает?

Детектор активности голоса (VAD) классифицирует аудиофрагменты как речь или тишину. Узнайте, как работает VAD, чем он отличается от эндпоинтинга и как его тестировать.

Детектор активности голоса классифицирует, содержат ли короткие, длительностью в миллисекунды, аудиофрагменты человеческую речь. Он используется во многих приложениях для обработки цифрового аудио, включая транскрибацию, телефонию и голосовых агентов.

В этой статье мы рассмотрим, что делает детектор активности голоса, чего он не делает и как он вписывается в ключевые корпоративные приложения.

Резюме

  • Детектор активности голоса (VAD) — это фундаментальный компонент современных аудиопроцессов. Он непрерывно анализирует аудиопоток и выдает решение «да/нет» о том, присутствует ли человеческая речь в каждом аудиофрагменте длительностью в миллисекунду.
  • VAD сообщает последующим аудиоинструментам, когда нужно работать, а когда находиться в режиме ожидания. Он используется LLM, сервисами транскрибации и как часть других корпоративных аудиоконвейеров.
  • Алгоритмы детекции активности голоса работают в непрерывном пятиэтапном цикле: захват аудио, разбивка на фрагменты, извлечение вокальных признаков, оценка вероятности наличия речи и передача решения последующим сервисам.
  • Изначально VAD полагался исключительно на математическую обработку сигналов для принятия решений «да/нет» о наличии речи. Современные системы на базе ИИ используют нейронные сети для выполнения той же функции, но с лучшим контекстуальным пониманием фонового шума и семантических сигналов.
  • Системы VAD классифицируют только то, содержит ли аудиофрагмент речь. Они не сообщают, когда человек закончил говорить. Системы эндпоинтинга используют VAD и другие инструменты эвристического анализа, чтобы решить, завершил ли говорящий свою мысль.
  • В корпоративных условиях VAD помогает голосовым агентам естественно общаться с клиентами, не перебивая их, оптимизирует использование полосы пропускания VoIP, снижает затраты на ИИ-транскрибацию речи в текст (STT) и имеет другие варианты использования.
  • Тестируйте системы VAD в реальных условиях. Безупречные студийные записи не являются эффективным средством для определения их возможностей.

Что такое детектор активности голоса (VAD)?

Детектор активности голоса (VAD) — это программный процесс, который классифицирует, содержат ли небольшие фрагменты аудио, называемые кадрами, речь. Алгоритмы VAD запускаются десятки или сотни раз в секунду на аудиопотоке и возвращают бинарный ответ «да» или «нет» о том, обнаружили ли они речь.

Они используются в более широких конвейерах цифрового аудио, таких как телекоммуникации или транскрибация речи. Они сообщают другим последующим системам, таким как ASR/STT, LLM и планировщики очереди, нужно ли активно прослушивать аудиопоток или находиться в режиме ожидания.

VAD — это не то же самое, что автоматическое распознавание речи (ASR). Все, что делает система VAD, — это выдает вероятностный ответ «да» или «нет» о том, обнаружила ли она речь. Она не выводит сами слова. Ее основная функция — сообщать последующим системам, нужно ли обрабатывать данный аудиофрагмент.

Как работают алгоритмы детекции активности голоса?

Алгоритм VAD работает с аудиопотоком и принимает решение «да/нет» о том, содержит ли данный аудиофрагмент (обычно 10–30 миллисекунд) речь.

Они работают непрерывно в пятиэтапном цикле:

  • Захват голоса: система, работающая с VAD, получает аудиопоток через WebRTC или телефонию и применяет базовую фильтрацию шума к данным.
  • Разбивка на фрагменты: алгоритм нарезает необработанный аудиопоток на равномерные фрагменты.
  • Извлечение признаков: алгоритм извлекает из потока акустические признаки, которые он может представить математически как цифровые данные.
  • Оценка: система пропускает извлеченные признаки внутри фрагмента через сам алгоритм VAD, чтобы сгенерировать показатель уверенности от 0 до 1 (0 = «нет речи», 1 = «речь») о том, содержит ли он речь.
  • Принятие решения о состоянии: система VAD передает показатель уверенности аудиоконвейеру, в котором она работает, чтобы конвейер мог решить, как с ним поступить.

Традиционная детекция активности голоса против ИИ-детекции

VAD делится на две широкие категории: обработка сигналов и ИИ.

В рамках ИИ-VAD существуют два отдельных подхода, что в сумме дает три вида детекции активности голоса.

Давайте разберем их более подробно.

Традиционный (сигнальный) VAD

Традиционная технология VAD измеряет уровень энергии аудиопотока и подтверждает наличие речи, если он превышает определенный порог. Это чисто математический расчет, часто среднеквадратичное значение (RMS) или частота пересечения нуля (ZCR). Если фрагмент превышает порог, он передается как речь. Ниже порога — нет.

Традиционный VAD быстрый и вычислительно недорогой, но он измеряет только уровень звука внутри аудио. Громкий фоновый шум может вызвать ложные срабатывания. В нем нет интеллекта, который действительно распознает речь.

ИИ-VAD

Существует два типа более новых ИИ-VAD: нейронный и семантический. Вместо использования чисто математического порога, нейронный VAD использует небольшую, высоконастроенную нейронную сеть для определения того, содержит ли аудиофрагмент речь или тишину. Их обучение позволяет им понимать разницу между речью и шумом, поэтому они работают лучше, чем традиционный VAD, при низком отношении сигнал/шум (SNR) в аудиопотоке, то есть при наличии значительного фонового шума.

Минус нейронного VAD в том, что он все еще не распознает саму речь. Семантический ИИ-VAD — это другая разновидность, которая это делает. Он пересекается с эндпоинтингом в том, что прослушивает аудиопоток на предмет завершенности высказанных мыслей. Он может грамматически и контекстуально понять, будет ли продолжение речи.

VAD против эндпоинтинга

VAD и эндпоинтинг — это взаимодополняющие технологии. Система детекции активности голоса просто решает, говорит ли кто-то в каждом обрабатываемом аудиофрагменте. Она принимает бинарное решение «да/нет» и передает его остальной части конвейера обработки аудио.

Система эндпоинтинга использует выходные данные VAD в сочетании с эвристическим анализом, чтобы определить, закончил ли говорящий свою мысль. Она может использовать обработку сигналов на основе правил или ИИ для принятия этого решения.

Приложения детекции активности голоса в ИИ реального времени

Детекция активности голоса важна в ряде сценариев использования.

Автономные голосовые агенты и колл-центры

Автономному агенту, проверяющему звонки клиентов, нужно знать, когда уместно ответить. Вы не хотите, чтобы агент перебивал клиента на полуслове или продолжал говорить поверх клиента, когда тот отвечает раньше. VAD помогает регулировать очередность в разговоре и поддерживать естественный поток взаимодействия. Поскольку он работает с точностью до миллисекунды, он также очень эффективен в управлении «вклиниванием» клиента, заставляя агента замолчать, когда клиент его перебивает.

Конвейеры транскрибации

Если вы используете API-сервис транскрибации речи в текст, такой как ElevenAPI, вы можете фильтровать отправляемое аудио с помощью детекции активности голоса, чтобы модель обрабатывала только озвученные фрагменты. Это снижает сетевую задержку и, что более важно, уменьшает использование токенов в модели транскрибации. Вы не будете тратить бюджет на ИИ из-за фонового шума.

Оптимизация VoIP и телефонии

Задержка также может влиять на качество связи в корпоративных сетях VoIP. Для оптимизации производительности эти системы цифрового аудио временно отключают линию с помощью VAD, когда вызывающий абонент не говорит.

Что делает детекцию активности голоса сложной задачей?

Традиционное обнаружение голосовой активности (VAD) опирается на математические алгоритмы для определения наличия речи. Однако человеческая речь отличается непредсказуемостью. Разговоры часто бывают беспорядочными, прерывистыми и происходят в реальных условиях, сопровождаясь фоновым шумом и даже посторонними разговорами. Основная задача VAD заключается в выявлении значимых пауз в зашумленном аудиопотоке.

Это приводит к возникновению нескольких специфических проблем.

Паузы в середине предложения

Люди не говорят в равномерном темпе на протяжении всего разговора. Они делают паузы, собираются с мыслями, передумывают во время речи и теряют нить рассуждения. Ни одна из этих пауз не означает, что говорящий закончил свою мысль. Человеку обычно легко это понять, но для программного обеспечения, даже для новых моделей ИИ, это может стать сложной задачей.

Если системы VAD ошибочно принимают такие паузы за окончание речи, это может привести к обрыву фразы в процессе транзакции или к тому, что голосовой агент перебьет собеседника.

Вокальные шумы

Тихая речь, затухающие согласные в конце слов (часто встречающиеся в конце предложений) и такие особенности, как скрипучий голос, могут привести к тому, что системы VAD пропустят реальную речь.

Непредсказуемая акустика

Постоянный фоновый белый шум, например, от вентилятора или текущей воды, относительно легко отфильтровывается системами VAD. Однако спорадические шумы, такие как лай собаки, могут быть ошибочно распознаны как «фантомная» речь.

Сильное сжатие аудио снижает динамический диапазон и может затруднить для VAD различие между кадрами тишины и речи.

Как оценивать производительность VAD

Человеческая речь сложна, особенно при записи в динамичных реальных условиях. Идеально чистые аудиозаписи не являются хорошим инструментом для тестирования производительности VAD. Точность распознавания речи (STT) также не измеряет эффективность системы VAD напрямую, поскольку это вторичный процесс по отношению к тому, что обнаруживает VAD.

Ложноположительные и ложноотрицательные результаты

Ложноположительные результаты VAD — это шум, принятый за речь. Кашель, реверберация, лай собаки и любой другой внезапный фоновый шум могут активировать систему и быть ошибочно переданы как кадры речи.

Ложноотрицательные результаты — это речь, принятая за тишину. VAD ошибочно дает команду последующим сервисам игнорировать аудиокадры.

Стресс-тестирование в реальных условиях

Чтобы оценить сервис VAD, необходимо проверить, как он работает в условиях, где будет записываться аудио, и в реальных сценариях.

Например, если вы собираетесь использовать VAD для голосового агента, попробуйте протестировать его со стереоканалами, чтобы оценить, как это влияет на производительность агента. Могут возникнуть следующие вопросы:

  • Есть ли ложноотрицательные результаты, из-за которых агент перебивает клиентов?
  • Прекращает ли агент говорить, когда пользователь его перебивает?
  • Что произойдет, если звонящий говорит на иностранном языке?
  • Как система работает при прослушивании спикеров, звонящих из реальных условий?
  • Что произойдет, если клиент звонит из машины, но не выключает радио?
  • Как система справляется с фоновым шумом от домашних животных или маленьких детей?

Все эти условия вероятны при работе с клиентскими звонками. VAD должен быть протестирован и работать под нагрузкой.

Начните работу с ElevenAgents для обслуживания клиентов

ElevenAgents использует гибридную систему VAD и глубокого обучения для определения очереди высказываний, чтобы поддерживать естественный поток агентских диалогов.

Начните создавать нового агента службы поддержки с ElevenAgents уже сегодня. Зарегистрируйтесь, чтобы начать.

Часто задаваемые вопросы

О чём эта статья

Ещё в разделе «AI и машинное обучение»

Все →

Ещё от ElevenLabs