Коротко: Precision-3 снижает уровень ошибки диаризации на 10,4% по сравнению с Precision-2 и на 34,2% по сравнению с базовой моделью с открытым исходным кодом Community-1. По сравнению с сильнейшей коммерческой альтернативой разрыв составляет от 40% до 67%. В задаче транскрипции с привязкой к спикерам Precision-3 демонстрирует самый низкий штраф за атрибуцию среди всех протестированных систем, что означает сохранение точности транскриптов, когда важно знать не просто что было сказано, но и кто это сказал.
Коротко: Precision-3 снижает уровень ошибки диаризации на 10,4% по сравнению с Precision-2 и на 34,2% по сравнению с базовой моделью с открытым исходным кодом Community-1. По сравнению с сильнейшей коммерческой альтернативой разрыв составляет от 40% до 67%. В задаче транскрипции с привязкой к спикерам Precision-3 демонстрирует самый низкий штраф за атрибуцию среди всех протестированных систем, что означает сохранение точности транскриптов, когда важно знать не просто что было сказано, но и кто это сказал.
Обычная транскрипция в целом решена: любой серьезный движок преобразования речи в текст распознает слова с высокой точностью, и один лишь показатель частоты ошибок в словах больше редко определяет выбор провайдера. Диаризация — определение того, кто и что сказал в ходе сеанса с несколькими спикерами — это область, где по-прежнему сохраняется дифференциация. При правильном подходе это не функция, надстраиваемая поверх модели транскрипции, а фундаментальный этап конвейера, который определяет, можно ли доверять транскрипту, аналитике и голосовому агенту, созданному на их основе.
Это третья статья в нашей серии публикаций, посвященных запуску Precision-3. В первой была представлена сама модель и ее новые параметры оптимизации. Вторая была посвящена настройке этих параметров для различных акустических доменов с использованием DIHARD в качестве тестового стенда. Эта статья посвящена цифрам: тому, как Precision-3 показывает себя по сравнению с собственными предшественниками и остальным рынком как по уровню ошибок диаризации, так и по уровню ошибок транскрипции с привязкой к спикерам, и что эти цифры означают, когда диаризация встроена в производственный конвейер.
Как Precision-3 выглядит в сравнении по уровню ошибок диаризации
Уровень ошибок диаризации (DER) является стандартной метрикой для этой задачи. Он суммирует три типа ошибок, каждый из которых измеряется как процент от общего времени речи: ложные срабатывания (речь обнаружена там, где ее не было), пропущенная речь (необнаруженная речь, включая пропущенную перекрывающуюся речь) и путаница спикеров (речь обнаружена правильно, но приписана не тому спикеру). DER в 14% означает, что примерно четырнадцать секунд из каждых ста секунд речи неверно атрибутированы одним из этих трех способов. Меньше — значит лучше.
По сравнению с Precision-2 и Community-1 (8 датасетов)
В среднем по восьми датасетам показатель DER для Precision-3 снижается с 24,9% у Community-1 до 18,8% у Precision-2 и до 16,4% у Precision-3: это относительное снижение на 34,2% по сравнению с базовой моделью с открытым исходным кодом и на 12,7% по сравнению с предыдущим коммерческим поколением.
По сравнению с рынком
Сравнение Precision-3 с коммерческими альтернативами менее прямолинейно, поскольку большинство провайдеров объединяют диаризацию в единый конвейер преобразования речи в текст, а не предоставляют ее в виде отдельной оценки. Изоляция уровня ошибок диаризации на четырех широко используемых бенчмарках позволяет оценить этот разрыв:
Если сопоставлять с тем конкурентом, который показывает лучшие результаты на каждом конкретном датасете, а не со средним по больнице, то Precision-3 демонстрирует результаты примерно на 45% ниже на DIHARD, на 40% ниже на AISHELL, в три раза ниже на AliMeeting и в два с половиной раза ниже на AMI-SDM.
Полную разбивку по доменам, охватывающую все одиннадцать поддоменов DIHARD и остальной набор бенчмарков, смотрите на странице бенчмарков.
Самая важная ошибка: путаница спикеров
Метрика DER учитывает все три типа ошибок в равной степени, но они имеют разную стоимость исправления. Пропущенную паузу тишины или отрезок неразмеченной неречевой активности обычно можно исправить при повторном прослушивании аудио. Путаницу спикеров — отнесение фрагмента речи не к тому человеку — исправить таким же образом нельзя: если в транскрипте указано, что нечто сказал не тот участник, эта ошибка распространяется на все, что построено поверх нее (резюме встречи, аналитическую панель, логику реплик голосового агента), и в дальнейшем ее практически невозможно обнаружить простыми способами.
Именно здесь кроется основная часть улучшений Precision-3. На всем наборе из 15 датасетов путаница спикеров составляет 53% от общего улучшения DER по сравнению с Precision-2, пропущенная речь — 35%, а ложные срабатывания — оставшиеся 12%. В относительных величинах Precision-3 назначает речь не тому спикеру на 18,7% реже, чем Precision-2.
Результаты разбивки DER (15 датасетов)
Компонент
Precision-2
Precision-3
Изменение
Доля в улучшении
Ложное срабатывание
4.41
4.21
-4.5%
12%
Пропущенная речь
6.90
6.32
-8.4%
35%
Путаница спикеров
4.71
3.83
-18.7%
53%
DER
16.02
14.35
-10.4%
100%
На практике это разница между системой диаризации, которая изредка обрезает слишком много тишины, и той, которая изредка вкладывает ваши слова в чужие уста. Второй тип сбоев сильнее всего подрывает доверие к продукту на последующих этапах, и именно для сокращения таких сбоев создавалась Precision-3.
От ошибки диаризации к ошибке транскрипции: tcpWER и tcorcWER
Метрика DER оценивает диаризацию автономно, сравнивая полученную моделью сегментацию с эталонной. Это правильный подход, когда диаризацией является сам поставляемый результат. Но в большинстве голосовых ИИ-конвейеров это не так: диаризация подпитывает движок транскрипции, и до конечного пользователя доходит транскрипт с метками спикеров. Для измерения этого требуется метрика, оценивающая слова, а не время.
Частота ошибок в словах (WER) — стандартный вариант. Она подсчитывает количество вставленных, удаленных или замещенных системой слов, разделенное на количество реально произнесенных слов. Два варианта расширяют эту метрику на многоспикерное аудио, и разница между ними делает их полезными:
- tcpWER (ограниченная по времени частота ошибок в словах с минимальной перестановкой) проверяет, правильно ли система распознала слова и привязала их к нужному спикеру. Слово, расшифрованное безупречно, но приписанное не тому человеку, считается ошибкой.
tcpWER (ограниченная по времени частота ошибок в словах с минимальной перестановкой) проверяет, правильно ли система распознала слова и привязала их к нужному спикеру. Слово, расшифрованное безупречно, но приписанное не тому человеку, считается ошибкой.
- tcorcWER (ограниченная по времени частота ошибок в словах с оптимальной комбинацией эталонов) проверяет, правильно ли система распознала слова. Метки спикеров в основном игнорируются, поэтому правильно расшифрованное слово считается верным независимо от того, кому оно было назначено.
tcorcWER (ограниченная по времени частота ошибок в словах с оптимальной комбинацией эталонов) проверяет, правильно ли система распознала слова. Метки спикеров в основном игнорируются, поэтому правильно расшифрованное слово считается верным независимо от того, кому оно было назначено.
Обе метрики ограничены по времени, что означает: гипотетическое слово совпадает с эталонным только в том случае, если оно попадает в достаточно близкий временной интервал. Это мешает системе получать награду за правильные слова, произнесенные не вовремя.
Бенчмарк транскрипции с привязкой к спикерам
Результаты tcpWER (4 датасета)
Precision-3 показывает самый низкий tcpWER на трех из четырех бенчмарков. На AISHELL модель Pro 3.5 от AssemblyAI набирает чуть меньше — 35.3 против 36.6. В среднем по четырем бенчмаркам Precision-3 снижает tcpWER на 7.6% по сравнению с Precision-2, причем ни на одном отдельном датасете нет регрессии относительно его непосредственного предшественника.
Результаты tcorcWER (4 датасета)
tcorcWER, метрика без учета принадлежности к спикеру, рассказывает другую историю. На AMI-SDM у Soniox показатель составляет 20.2, а у ElevenLabs Scribe v2 — 16.7, что ниже 22.3 у Precision-3: если оценивать исключительно правильность слов, оба провайдера транскрибируют этот датасет точнее.
Для результатов pyannoteAI диаризация объединяется с готовой открытой транскрипцией (Faster-Whisper и NVIDIA NeMo Parakeet) без дополнительной настройки. Локальные клиенты (on-premises) могут использовать оркестрацию STT, чтобы объединить Precision-3 со своими собственными решениями, включая дообученные движки.
Штраф за атрибуцию и во сколько он вам обходится
Возьмем одну систему, один датасет и обе метрики. Относительный рост от tcorcWER к tcpWER представляет собой штраф за атрибуцию: долю частоты ошибок, которая проистекает не из ошибок распознавания слов, а из отнесения их не к тому спикеру.
На AMI-SDM показатель Precision-3 меняется с 22.3 на 23.6, увеличиваясь на 5.8%. У Soniox он возрастает с 20.2 до 58.0 (на 187%). У ElevenLabs Scribe v2 — с 16.7 до 45.1 (на 170%). Оба провайдера начинают с более точного исходного распознавания слов, чем Precision-3, но в итоге оказываются далеко позади него, поскольку их слова привязаны не к тем спикерам.
Эта закономерность сохраняется на всех четырех датасетах:
Датасет
Precision-3
Лучший из остальных провайдеров
Худший
AliMeeting
+2.1%
AssemblyAI Universal +8.4%
Speechmatics Standard +103.9%
AISHELL
+4.6%
AssemblyAI Universal +11.4%
Speechmatics Standard +158.1%
AMI-SDM
+5.8%
AssemblyAI Slam-1 +7.5%
Soniox +187.1%
NOTSOFAR
+15.4%
AssemblyAI Universal +14.4%
Community-1 +30.9%
Precision-3 демонстрирует самый низкий штраф среди всех протестированных систем на трех датасетах из четырех и второй по величине — на NOTSOFAR.
Точность распознавания слов и точность определения спикеров — это независимые возможности, поэтому бенчмарк, измеряющий только частоту ошибок в словах (WER), не может подсказать, за что именно вы платите: если ваш продукт считывает поле спикера, отличные слова со штрафом 170% принесут вам куда меньше пользы, чем более слабые слова со штрафом 6%.
Точность распознавания слов и точность определения спикеров — независимые возможности, и провайдер может силен в одном и слаб в другом. Бенчмарк распознавания речи, сообщающий только частоту ошибок в словах, не может подсказать, что именно вы приобретаете. Если ваш продукт считывает поле спикера, система с превосходным распознаванием слов и штрафом в 170% послужит вам хуже, чем система с чуть менее точными словами и штрафом в 6%.
Почему tcpWER — это главный показатель для конвейеров голосового ИИ
Эта тенденция сохраняется и на других бенчмарках: провайдеры с лучшим «сырым» распознаванием слов — это не те провайдеры, у которых лучше транскрипция с привязкой к спикерам. Сильный движок преобразования речи в текст в паре со слабой диаризацией все равно выдает транскрипт, в котором слова правильные, а метки спикеров — нет. Для любого продукта, которому нужно знать, кто и что сказал (будь то приложение для ведения заметок о встречах, инструмент аналитики колл-центра или голосовой агент, решающий, кому ответить), разрыв между tcorcWER и tcpWER является важнейшим показателем. Движок распознавания речи может показывать хорошие результаты исключительно по точности слов и все равно оставаться непригодным для сценариев использования, где важен учет спикеров, если лежащая в его основе диаризация слаба. Этот разрыв служит практическим аргументом в пользу того, чтобы рассматривать диаризацию как важнейший этап конвейера, а не как само собой разумеющийся побочный продукт транскрипции.
Оценка Precision-3 на вашем собственном аудио
Публичные бенчмарки — это ориентир, а не гарантия. DIHARD, AMI, AliMeeting и остальной набор покрывают совещания, вещание, телефонную речь и читаемый текст, но ни один отдельный домен из этого списка не будет в точности соответствовать вашим производственным аудиоданным. Кодек, настройки микрофона, количество спикеров и фоновый шум — все это влияет на цифры. Прежде чем внедрять изменения модели в продакшн, стоит провести аналогичную оценку на выборке ваших собственных аудиоматериалов.
Процесс точно такой же, как тот, что использовался для получения цифр в этой статье. Разметьте небольшой набор репрезентативных записей (в идеале от тридцати минут до нескольких часов) с помощью эталонного файла RTTM, в котором указано, кто и когда говорил. Запустите Precision-3 на том же аудио и вычислите DER (ошибку диаризации) по сравнению с эталоном с помощью стандартного инструмента оценки вроде pyannote.metrics. Если ваш конвейер включает этап транскрипции, вычислите tcpWER и tcorcWER тем же способом, используя инструмент оценки с ограничением по времени (например, meeteval), сравнивая с эталонным транскриптом с привязанными метками спикеров. Сравнение с вашей текущей моделью дает прямой результат «один к одному» на ваших собственных данных, а не вывод на основе усредненных показателей публичных бенчмарков.
Нескольких десятков минут размеченного аудио обычно достаточно, чтобы понять, имеет ли значение доменный разрыв для вашего сценария использования. Если ваши производственные аудиоданные напоминают чистый структурированный домен (например, вещание или телефонную речь), публичные цифры из этой статьи должны переноситься на них достаточно хорошо. Если же речь идет о более сложном домене (аудиозаписи встреч в дальнем поле, плотное наложение голосов, веб-видео «из дикой природы»), ожидайте, что абсолютные показатели ошибок будут выше для каждой системы, включая Precision-3, даже если относительное ранжирование между системами в целом сохранится.
Начало работы
Precision-3 уже доступна через API, если указать параметр "model": "precision-3" в запросе на диаризацию. Существующие интеграции продолжат работать без изменений до тех пор, пока Precision-3 не станет моделью по умолчанию, а цены останутся такими же, как для Precision-2. Локальные развертывания (on-premises) требуют обновления пакета, прежде чем модель станет доступна для рабочих нагрузок.
Две статьи, предшествующие этой в серии, охватывают остальные аспекты релиза: первая подробно знакомит с моделью, ее входными параметрами и выходными оценками, а вторая описывает настройку параметров vadSensitivity и crosstalkSensitivity для вашего собственного аудиодомена. Обе доступны в блоге pyannoteAI вместе с полными данными бенчмарка на сайте pyannote.ai/benchmark.






