Коротко: Год спустя после выхода Precision-2 мы выпускаем Precision-3 — самую точную и настраиваемую модель диаризации из всех, что мы создавали. На наших 15 эталонных датасетах уровень ошибки диаризации снизился на 10,4% по сравнению с Precision-2 — с 16,02 до 14,35. Более половины этого улучшения достигается за счет того, что модель стала лучше различать спикеров: теперь она присваивает речь правильному спикеру на 18,7% чаще.
Коротко: Год спустя после выхода Precision-2 мы выпускаем Precision-3 — самую точную и настраиваемую модель диаризации из всех, что мы создавали. На наших 15 эталонных датасетах уровень ошибки диаризации снизился на 10,4% по сравнению с Precision-2 — с 16,02 до 14,35. Более половины этого улучшения достигается за счет того, что модель стала лучше различать спикеров: теперь она присваивает речь правильному спикеру на 18,7% чаще.
Точность перестала быть единственной проблемой
Каждое поколение серии Precision выпускалось с единственным показателем, который постоянно снижался. Precision-1 была на 20% точнее передовых разработок того времени, а Precision-2 срезала еще 14%. Уровень ошибки диаризации — хороший главный показатель, и мы продолжаем его улучшать, но год отзывов из промышленной эксплуатации прояснил одну вещь: наши клиенты не вкладывают одинаковый смысл в слова «диаризация была неверной».
Если поговорить с достаточным количеством клиентов, эти разногласия начинают казаться структурными, а не случайными. Команда, создающая обучающие корпусы для синтеза речи, хочет избавиться от любых следов наложения речи и предпочитает избыточно детектировать перекрестные разговоры и отбрасывать чистую аудиозапись, чем рисковать пропуском хотя бы одного загрязненного сегмента. Команда, производящая обучающие данные для клонирования голоса, преследует противоположную цель: уловить каждый короткий перерыв на тишину, даже если это приведет к избыточной сегментации аудио. Команда, создающая голосовые отпечатки для системы протоколирования встреч, не хочет ни того, ни другого; они предпочтут отбросить сомнительный сегмент, чем строить по нему голосовой отпечаток. Трое клиентов, три противоположных требования и ни одной фиксированной конфигурации, которая подошла бы всем.
Существует и вторая часть проблемы, которая проявляется уже после того, как модель выдала свой ответ. Диаризация находится в начале конвейера, поэтому любые ее ошибки наследуются всеми последующими этапами: расшифровкой с привязкой к спикерам, аналитикой на ее основе, логикой смены реплик голосового агента. Если все, что получает команда на выходе — это сегментация, у них нет способа отличить уверенную границу от сомнительной, и в итоге они пишут эвристики поверх решения, которое не могут реально проинспектировать. Точность важна, но сама по себе она не говорит вам, чему стоит доверять.
Precision-3 — наш ответ на обе эти проблемы. Это наша самая точная модель пакетной диаризации на сегодняшний день (относительное снижение DER на 10,4% по сравнению с Precision-2), и это первая модель Precision, которая открывает «изнанку» принятых ею решений: параметры чувствительности на входе, вероятности на уровне кадров на выходе и операционные режимы «скорость-точность» для локальных развертываний (on-premises). И все это по той же цене, что и Precision-2.
Что Precision-3 делает иначе
Новые входные параметры (в API и on-prem)
Теперь каждому клиенту доступны два параметра чувствительности.
Параметр
Диапазон
Эффект
vadSensitivity
От -5.0 до 5.0, по умолчанию 0
Регулирует чувствительность определения голосовой активности (VAD). Новинка в API.
crosstalkSensitivity
От -5.0 до 5.0, по умолчанию 0
Регулирует чувствительность к наложениям и перекрестным разговорам. Новинка в API.
Новые выходные оценки (в API и on-prem)
Каждая новая выходная оценка отвечает на один конкретный вопрос.
Результат
На что отвечает
Статус
speakerProbability
Насколько вероятно, что этот конкретный спикер активен в данном кадре
Новинка в API и on-prem. Заменяет устаревший выход confidence
crosstalkProbability
Насколько вероятно наличие перекрестного разговора в данном кадре
Новинка в API и on-prem
speechProbability
Насколько вероятно присутствие речи в данном кадре
Существовало в on-prem, теперь доступно в API
turnLevelConfidence
Уверенность модели в определении принадлежности сегмента конкретному спикеру
Без изменений
В результате оценка уверенности сегментации на уровне кадров объявлена устаревшей. Разделение голосовой активности, наложений и идентичности спикера также означает, что правило фильтрации, написанное вами сегодня, будет актуально и через шесть месяцев, поскольку каждый его термин соотносится с тем, что вы действительно можете наблюдать в аудио.
Режимы работы (только для on-premises)
Для локальных развертываний выбирается один профиль на инсталляцию
Средний DER — 15 датасетов
Режим
Precision-3
Precision-2
Прирост
Точность (Accuracy)
14.35
16.02
1.67 пункта, 10.4%
Баланс (Balance)
14.94
16.31
1.37 пункта, 8.4%
Скорость (Speed)
15.52
16.91
1.39 пункта, 8.2%
- 15 датасетов: NOTSOFAR, AVA-AVD, AliMeeting, INA, AMI, AMI-SDM, SBCSAE, MSDWILD, DIHARD, CALLHOME, ALLIES, RAMC, VoxConverse, VoxSRC2023, AISHELL.
15 датасетов: NOTSOFAR, AVA-AVD, AliMeeting, INA, AMI, AMI-SDM, SBCSAE, MSDWILD, DIHARD, CALLHOME, ALLIES, RAMC, VoxConverse, VoxSRC2023, AISHELL.
Время, необходимое для диаризации 1 часа аудио с использованием B200
Режим
Precision-3
Precision-2
Ускорение
Фактор реального времени
Точность (Accuracy)
3.05с
5.28с
1.73× (-42%)
681× → 1,181×
Баланс (Balance)
1.43с
3.33с
2.33× (−57%)
1,080× → 2,518×
Скорость (Speed)
0.97с
2.45с
2.51× (−60%)
1,471× → 3,700×
Precision-3 в режиме точности снижает DER на 1.67 пункта по сравнению с Precision-2, что дает относительное улучшение на 10.4%. Режимы баланса и скорости жертвуют частью этой точности ради задержки, обеспечивая ускорение до 2.5 раз, как описано ниже.
Где применяется Precision-3
Используйте входные параметры, чтобы сместить склонность модели к определенному типу ошибок.
- Извлечение чистых обучающих данных: Теперь есть два способа работы с наложениями, выберите тот, который подходит под ваш сценарий. Увеличьте crosstalkSensitivity для избыточного обнаружения наложений или отфильтруйте по crosstalkProbability после, чтобы удалить все пересекающиеся участки.
Извлечение чистых обучающих данных: Теперь есть два способа работы с наложениями, выберите тот, который подходит под ваш сценарий. Увеличьте crosstalkSensitivity для избыточного обнаружения наложений или отфильтруйте по crosstalkProbability после, чтобы удалить все пересекающиеся участки.
- Обнаружение большего объема речи: Увеличьте vadSensitivity, чтобы заполнить короткие паузы между соседними репликами и обнаружить односложные реплики, которые в противном случае могли бы быть пропущены.
Обнаружение большего объема речи: Увеличьте vadSensitivity, чтобы заполнить короткие паузы между соседними репликами и обнаружить односложные реплики, которые в противном случае могли бы быть пропущены.
Используйте выходные оценки, когда решение должно приниматься логикой вашего продукта, а не моделью.
- Создание высококачественных голосовых отпечатков: Оставляйте только те сегменты, которые превышают порог speakerProbability или turnLevelConfidence, жертвуя полнотой в пользу точности.
Создание высококачественных голосовых отпечатков: Оставляйте только те сегменты, которые превышают порог speakerProbability или turnLevelConfidence, жертвуя полнотой в пользу точности.
- Маршрутизация на ручную проверку: Помечайте сегменты, находящиеся ниже порога уверенности, вместо проверки всей стенограммы.
Маршрутизация на ручную проверку: Помечайте сегменты, находящиеся ниже порога уверенности, вместо проверки всей стенограммы.
- Мониторинг качества с течением времени: Отслеживайте распределение вероятностей по каждому аудиоисточнику, чтобы обнаружить деградацию (drift) до того, как она превратится в жалобы пользователей.
Мониторинг качества с течением времени: Отслеживайте распределение вероятностей по каждому аудиоисточнику, чтобы обнаружить деградацию (drift) до того, как она превратится в жалобы пользователей.
Используйте выходные оценки для более качественной транскрипции с привязкой к спикерам
Определить, какой именно спикер произнес то или иное слово, становится сложно в моменты наложения речи, поскольку большинство STT-движков транскрибируют речь только одного спикера за раз. Теперь мы предлагаем два способа решения этой проблемы: позвольте эксклюзивной диаризации сделать всю сложную работу за вас или используйте параметр speakerProbability, чтобы принять решение самостоятельно.
- Разрешение наложений в распознавании речи: используйте speakerProbability, чтобы определить, чей голос с наибольшей вероятностью транскрибируется.
Разрешение наложений в распознавании речи: используйте speakerProbability, чтобы определить, чей голос с наибольшей вероятностью транскрибируется.
Используйте режимы работы, когда развертывание ограничено бюджетом задержки.
Скорость для чувствительных к задержкам или высоконагруженных рабочих процессов, баланс для развертываний общего назначения и точность, когда качество диаризации является ключевым фактором для продукта. Это решения на уровне развертывания, а не для каждого запроса в отдельности, и теперь они ведут себя достаточно предсказуемо, чтобы вы могли настроить режим один раз и больше не возвращаться к нему.
Почему это лучше
Ошибка, которая исчезла — это та, которая причиняет больше всего боли
Коэффициент ошибок диаризации (DER) делится на три компонента: ложное срабатывание, пропущенная речь и путаница спикеров, а усреднение снижения по всем трем компонентам скрывает, какой из них на самом деле изменился.
Компонент DER
Precision-3
Precision-2
Изменение
Ложное срабатывание
4.21
4.41
-4.5%
Пропущенное обнаружение в зонах одного спикера
3.02
2.81
+7.5%
Пропущенное обнаружение в зонах перекличогов
3.30
4.09
-19.3%
Путаница спикеров в зонах одного спикера
2.57
3.13
-17.8%
Путаница спикеров в зонах перекличогов
1.26
1.59
-20.7%
Общий DER
14.35
16.02
-10.4%
Цифры в этой статье усреднены по 15 эталонным наборам данных: AISHELL, ALLIES, AliMeeting, AMI, AMI-SDM, AVA-AVD, CALLHOME, DIHARD, INA, MSDWILD, NOTSOFAR, RAMC, SBCSAE, VoxConverse и VoxSRC2023. Этот набор охватывает встречи, телефонные разговоры, вещание, чтенную речь и записи в реальных условиях как в одно-, так и в многомикрофонных конфигурациях, что делает среднее значение осмысленным для различных сценариев использования, а не оптимизированным под какой-то один из них.
Более половины улучшения достигается за счет снижения путаницы спикеров: модель стала лучше определять, кто говорит, а не только то, говорит ли кто-нибудь вообще. Это различие важнее, чем кажется на бумаге, потому что путаница спикеров — это ошибка, которая проявляется на последующих этапах: в виде неверных меток спикеров в стенограмме, нарушенной аналитики, голосового агента, отвечающего не тому участнику, и ее исправлять постфактум дороже всего. Пропущенную паузу можно восстановить по форме волны. Неверную метку спикера — нет.
Улучшенный мониторинг для проблемных случаев
Два самых частых вопроса в нашей поддержке связаны с избыточным обнаружением спикеров и назначением речи не тому спикеру. До сих пор оба разбирательства заканчивались одинаково: модель выдавала разметку, разметка была неверной, и не было никаких промежуточных сигналов, чтобы понять почему. Вероятности спикера, речи и перекрестной речи на уровне кадров меняют ситуацию, потому что теперь мы видим, сомневалась ли модель, где именно она сомневалась и была ли ошибка вызвана обнаружением голосовой активности или атрибуцией спикера. Обе эти категории как раз и демонстрируют наибольшее улучшение в Precision-3, поэтому данный релиз одновременно снижает частоту возникновения таких случаев и облегчает диагностику оставшихся.
Сравнение с аналогами
Средний коэффициент ошибок диаризации на четырех публичных бенчмарках; чем ниже, тем лучше.
По сравнению с конкурентом, показывающим лучшие результаты на каждом наборе данных, Precision-3 демонстрирует примерно на 47% меньшую ошибку на DIHARD, на 40% меньшую на AISHELL, в три раза лучше на AliMeeting, в 2,2 раза лучше на AMI и в 2,6 раза лучше на AMI SDM.
Интерфейс управления — это область, где разрыв проявляется сильнее всего. Каждый провайдер распознавания речи возвращает показатель уверенности для каждого слова, а некоторые добавляют поверх него показатель уверенности в языке. ElevenLabs и Speechmatics предоставляют настройки чувствительности к количеству спикеров. Но ни один из них не объединяет специфичные для диаризации вероятности с элементами управления чувствительностью входа на таком уровне детализации. Для нас это сочетание не просто галочка в списке функций; это та часть проблемы, над которой мы работали десятилетие — сначала в составе открытого инструментария pyannote.audio, а теперь и в серии Precision.
Начало работы
В API установите параметр "model": "precision-3". Существующие запросы продолжат работать так же, как и раньше, пока Precision-3 не станет моделью по умолчанию, и вам не нужно менять код, чтобы воспользоваться приростом точности. Новые параметры и выходные данные являются опциональными, поэтому вы можете внедрить улучшение точности уже сегодня и освоить новые элементы управления тогда, когда будете к этому готовы.
При локальном развертывании (on-premises) Precision-3 поставляется с обновлением пакета: новую версию необходимо развернуть, прежде чем модель станет доступна для ваших рабочих нагрузок. В API модель Precision-3 сначала появится как опциональная опция, затем станет стандартной, после чего поддержка Precision-2 будет прекращена.
Цены остаются прежними. Прирост точности, два параметра чувствительности и покадровые вероятности доступны по тарифу Precision-2.
Начните использовать Precision-3 в панели управления или ознакомьтесь с документацией по API.
Посмотрите наше видеоруководство, чтобы начать использовать новые возможности оптимизации.
Обучение Precision-3 проводилось с использованием вычислительных ресурсов суперкомпьютера HPC центра IDRIS в рамках распределений ресурсов A0201012177 и AD011016176R2, предоставленных агентством GENCI. Мы выражаем искреннюю благодарность IDRIS за исключительную вычислительную инфраструктуру, которая позволила раздвинуть границы возможного в точности диаризации речи.
Обучение Precision-3 проводилось с использованием вычислительных ресурсов суперкомпьютера HPC центра IDRIS в рамках распределений ресурсов A0201012177 и AD011016176R2, предоставленных агентством GENCI. Мы выражаем искреннюю благодарность IDRIS за исключительную вычислительную инфраструктуру, которая позволила раздвинуть границы возможного в точности диаризации речи.






