Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Testirovanie precision 3 sravnenie s precision 2 community 1 i rynochnymi analog
Dev48

© 2026 · All rights reserved.

Тестирование Precision-3: Сравнение с Precision-2, Community-1 и рыночными аналогами — pyannoteAI Speaker Intelligence and Diarization

Источник: pyannoteAI

Тестирование Precision-3: Сравнение с Precision-2, Community-1 и рыночными аналогами — pyannoteAI Speaker Intelligence and Diarization

Источник: pyannoteAI

Precision-3 снижает уровень ошибок диаризации на 10.4% по сравнению с Precision-2 и на 34.2% по сравнению с Community-1, а также кардинально сокращает частоту ошибок в словах при распознавании речи с привязкой к спикерам (tcpWER) по сравнению со многими решениями на рынке. Ознакомьтесь с полными…

27 сентября 2026 г.•Обновлено: 27 сентября 2026 г.
Вкратце: Precision-3 снижает коэффициент ошибок диаризации (DER) на 10,4% по сравнению с Precision-2 и на 34,2% по сравнению с эталонной моделью с открытым исходным кодом Community-1. По сравнению с сильнейшим коммерческим аналогом разрыв составляет от 40% до 67%. В задачах транскрибации с атрибуцией спикеров Precision-3 демонстрирует самый низкий штраф за атрибуцию среди всех протестированных систем, что означает, что транскрипты остаются точными, когда вам нужно знать не только то, что было сказано, но и кто именно это сказал.

Вкратце: Precision-3 снижает коэффициент ошибок диаризации (DER) на 10,4% по сравнению с Precision-2 и на 34,2% по сравнению с эталонной моделью с открытым исходным кодом Community-1. По сравнению с сильнейшим коммерческим аналогом разрыв составляет от 40% до 67%. В задачах транскрибации с атрибуцией спикеров Precision-3 демонстрирует самый низкий штраф за атрибуцию среди всех протестированных систем, что означает, что транскрипты остаются точными, когда вам нужно знать не только то, что было сказано, но и кто именно это сказал.

Обычная транскрибация в значительной степени решена, поскольку каждый серьезный движок преобразования речи в текст транскрибирует слова с высокой точностью, и один лишь коэффициент ошибок распознавания слов (WER) уже редко является решающим фактором при выборе поставщика командой. Диаризация — понимание того, кто что сказал в ходе сессии с несколькими спикерами — это то, где до сих пор происходит дифференциация. При правильном подходе это не функция, добавленная поверх модели транскрибации: это фундаментальный этап конвейера, который определяет, можно ли доверять транскрипту, аналитике и голосовому агенту, построенному на его основе.

Это третья статья в нашей серии, посвященной запуску Precision-3. В первой мы представили модель и ее новые параметры оптимизации. Во второй мы разобрали настройку этих параметров для различных акустических доменов, используя DIHARD в качестве тестовой площадки. Эта статья посвящена цифрам: как Precision-3 работает по сравнению со своими предшественниками и остальным рынком, как по коэффициенту ошибок диаризации, так и по коэффициенту ошибок транскрибации с атрибуцией спикеров, и что эти цифры означают, когда диаризация встроена в производственный конвейер.

Как Precision-3 сравнивается по коэффициенту ошибок диаризации

Коэффициент ошибок диаризации (DER) является стандартной метрикой для этой задачи. Он суммирует три типа ошибок, каждая из которых измеряется как процент от общего времени речи: ложные срабатывания (речь обнаружена там, где ее не было), пропущенная речь (речь, которая осталась необнаруженной, включая пропущенную перекрывающуюся речь) и путаница спикеров (речь правильно обнаружена, но приписана не тому спикеру). DER, равный 14%, означает, что примерно четырнадцать секунд из каждых ста секунд речи неверно атрибутированы одним из этих трех способов. Чем ниже показатель, тем лучше.

Сравнение с Precision-2 и Community-1 (8 наборов данных)

В среднем по восьми наборам данных DER Precision-3 снижается с 24,9% для Community-1 до 18,8% для Precision-2 и до 16,4% для Precision-3: это относительное снижение на 34,2% по сравнению с эталоном с открытым исходным кодом и на 12,7% по сравнению с предыдущим коммерческим поколением.

Сравнение с рынком

Сравнение Precision-3 с коммерческими альтернативами менее прямолинейно, поскольку большинство поставщиков объединяют диаризацию в полный конвейер преобразования речи в текст, а не предоставляют ее как отдельную метрику. Изоляция коэффициента ошибок диаризации на четырех широко используемых бенчмарках позволяет оценить разрыв:

При сравнении с конкурентом, который показывает лучшие результаты на каждом наборе данных, а не со средним показателем по рынку, Precision-3 показывает результат примерно на 45% ниже на DIHARD, на 40% ниже на AISHELL, в три раза ниже на AliMeeting и в два с половиной раза ниже на AMI-SDM.

Полную разбивку по доменам, охватывающую все одиннадцать поддоменов DIHARD и остальную часть набора бенчмарков, смотрите на странице бенчмарков.

Ошибка, которая имеет наибольшее значение: путаница спикеров

DER учитывает все три типа ошибок в равной степени, но исправлять их стоит по-разному. Пропущенную паузу или участок неразмеченной неречевой активности обычно можно исправить, повторно прослушав аудио. Путаницу спикеров, когда фрагмент речи приписывается не тому человеку, исправить таким же образом невозможно: как только в транскрипте указано, что что-то сказал не тот участник, эта ошибка распространяется на все, что построено на его основе: резюме встречи, аналитическую панель, логику очередности реплик голосового агента, и после этого ее уже невозможно легко обнаружить.

Именно здесь кроется основная часть улучшений Precision-3. В рамках бенчмарка из 15 наборов данных путаница спикеров составляет 53% от общего улучшения DER по сравнению с Precision-2, пропущенная речь — 35%, а ложные срабатывания — оставшиеся 12%. В относительном выражении Precision-3 приписывает речь не тому спикеру на 18,7% реже, чем Precision-2.

Результаты разбивки DER (15 наборов данных)

Компонент

Precision-2

Precision-3

Изменение

Ложное срабатывание

4.41

4.21

-4.5%

12%

Пропущенная речь

6.90

6.32

-8.4%

35%

Путаница спикеров

4.71

3.83

-18.7%

53%

DER

16.02

14.35

-10.4%

100%

На практике это разница между системой диаризации, которая иногда обрезает слишком много тишины, и той, которая иногда вкладывает ваши слова в чужие уста. Второй тип ошибки — это то, что больше всего подрывает доверие к продукту, и именно его Precision-3 была призвана уменьшить.

От ошибки диаризации к ошибке транскрибации: tcpWER и tcorcWER

DER оценивает диаризацию саму по себе, сравнивая сегментацию, созданную моделью, с эталонной сегментацией. Это правильное измерение, когда диаризация является конечным продуктом. В большинстве конвейеров Voice AI это не так: диаризация подает данные на движок транскрибации, и то, что получает конечный пользователь, — это транскрипт с метками спикеров. Чтобы измерить это, нужна метрика, которая оценивает слова, а не время.

Коэффициент ошибок распознавания слов (WER) — обычная метрика. Она подсчитывает слова, которые система вставила, удалила или заменила, деленные на количество фактически произнесенных слов. Два варианта расширяют ее на аудио с несколькими спикерами, и разница между ними делает их полезными:

  • tcpWER (time-constrained minimum-permutation word error rate) проверяет, правильно ли система распознала слова и прикрепила ли их к нужному спикеру. Слово, транскрибированное идеально, но приписанное не тому человеку, считается ошибкой.

tcpWER (time-constrained minimum-permutation word error rate) проверяет, правильно ли система распознала слова и прикрепила ли их к нужному спикеру. Слово, транскрибированное идеально, но приписанное не тому человеку, считается ошибкой.

  • tcorcWER (time-constrained optimal reference combination word error rate) проверяет, правильно ли система распознала слова. Метки спикеров в значительной степени игнорируются, поэтому правильно транскрибированное слово считается верным, независимо от того, кому оно было назначено.

tcorcWER (time-constrained optimal reference combination word error rate) проверяет, правильно ли система распознала слова. Метки спикеров в значительной степени игнорируются, поэтому правильно транскрибированное слово считается верным, независимо от того, кому оно было назначено.

Обе метрики ограничены по времени, что означает, что гипотетическое слово совпадает с эталонным только в том случае, если оно попадает в достаточно близкий временной интервал. Это предотвращает ситуацию, когда система получает вознаграждение за правильные слова, произнесенные не в то время.

Бенчмарк транскрибации с атрибуцией спикеров

Результаты tcpWER (4 набора данных)

Precision-3 показывает самый низкий показатель tcpWER на трех из четырех бенчмарков. На AISHELL модель Pro 3.5 от AssemblyAI набирает чуть меньше: 35,3 против 36,6. В среднем по четырем бенчмаркам Precision-3 снижает tcpWER на 7,6% по сравнению с Precision-2, причем ни на одном отдельном датасете ухудшения по сравнению с непосредственным предшественником не наблюдается.

Результаты tcorcWER (4 датасета)

tcorcWER, версия метрики без учета диктозависимости, рассказывает другую историю. На AMI-SDM у Soniox результат составляет 20,2, а у ElevenLabs Scribe v2 — 16,7, что в обоих случаях ниже, чем 22,3 у Precision-3: если оценивать исключительно точность распознавания слов, оба провайдера транскрибируют этот датасет точнее.

В результатах pyannoteAI диаризация объединяется со стандартными открытыми моделями транскрипции Faster-Whisper и NVIDIA NeMo Parakeet без какой-либо настройки. Локальные (on-premises) клиенты могут использовать оркестрацию STT для объединения Precision-3 со своими собственными решениями, включая дообученные движки.

Штраф за атрибуцию и во сколько он вам обходится

Возьмите одну систему, один датасет и обе метрики. Относительное увеличение tcorcWER по сравнению с tcpWER — это штраф за атрибуцию: доля частоты ошибок, которая возникает не из-за расслышанных слов, а из-за их привязки не к тому спикеру.

На AMI-SDM показатель Precision-3 меняется с 22,3 на 23,6, увеличиваясь на 5,8%. У Soniox он вырастает с 20,2 до 58,0 (на 187%). У ElevenLabs Scribe v2 — с 16,7 до 45,1 (на 170%). Обе системы начинают с лучшего качества «сырой» транскрипции, чем Precision-3, но в итоге оказываются далеко позади, потому что их слова привязаны к неверным спикерам.

Эта закономерность сохраняется на всех четырех датасетах:

Датасет

Precision-3

Лучший из остальных провайдер

Худший

AliMeeting

+2,1%

AssemblyAI Universal +8,4%

Speechmatics Standard +103,9%

AISHELL

+4,6%

AssemblyAI Universal +11,4%

Speechmatics Standard +158,1%

AMI-SDM

+5,8%

AssemblyAI Slam-1 +7,5%

Soniox +187,1%

NOTSOFAR

+15,4%

AssemblyAI Universal +14,4%

Community-1 +30,9%

Precision-3 фиксирует наименьший штраф среди всех протестированных систем на трех датасетах из четырех и второй по величине — на NOTSOFAR.

Точность распознавания слов и точность определения спикеров — это две разные возможности, поэтому бенчмарк, измеряющий только частоту ошибок в словах, не может подсказать, что именно вы приобретаете: если ваш продукт считывает поле спикера, превосходное качество слов при штрафе в 170% принесет вам куда меньше пользы, чем более слабые слова со штрафом в 6%.

Точность распознавания слов и точность определения спикеров — это независимые возможности, и провайдер может быть силен в одной из них и слаб в другой. Бенчмарк распознавания речи, который сообщает только частоту ошибок в словах, не может подсказать, что именно вы покупаете. Если ваш продукт считывает поле спикера, система с превосходным качеством слов и штрафом в 170% послужит вам хуже, чем система с чуть более слабыми словами и штрафом в 6%.

Почему tcpWER — это показатель, который имеет значение для конвейеров голосового ИИ

Эта закономерность подтверждается и на других бенчмарках: провайдеры с лучшим качеством «сырой» транскрипции — это вовсе не те провайдеры, у которых лучше всего получается транскрипция с привязкой к спикерам. Мощный движок распознавания речи в сочетании со слабой диаризацией по-прежнему выдает транскрипт, в котором слова правильные, а метки спикеров — ошибочные. Для любого продукта, которому нужно знать, кто и что сказал (будь то инструмент для конспектирования встреч, аналитика для колл-центра или голосовой ассистент, определяющий, кому ответить), разрыв между tcorcWER и tcpWER — это тот самый показатель, за которым стоит следить. Движок распознавания речи может показывать хорошие результаты только по точности слов и при этом оставаться непригодным для сценариев использования, где важны спикеры, если лежащая в его основе диаризация слаба. Этот разрыв служит практическим аргументом в пользу того, чтобы рассматривать диаризацию как первоклассный этап конвейера, а не как само собой разумеющийся побочный продукт транскрипции.

Оценка Precision-3 на вашем собственном аудио

Публичные бенчмарки — это ориентир, а не гарантия. DIHARD, AMI, AliMeeting и остальной набор охватывают встречи, телетрансляции, телефонную речь и читанную речь, но ни один отдельный домен из этого списка не будет в точности соответствовать вашему рабочему аудио. Кодек, конфигурация микрофонов, количество спикеров и фоновый шум — всё это меняет цифры. Прежде чем переходить на новую модель в продакшене, стоит запустить аналогичную оценку на выборке вашего собственного аудио.

Процесс в точности повторяет тот, что использовался для получения цифр в этой статье. Разметьте небольшой набор репрезентативных записей (в идеале от тридцати минут до нескольких часов) с помощью эталонного файла RTTM, в котором отмечено, кто и когда говорил. Запустите Precision-3 на том же аудио и вычислите DER по отношению к эталону с помощью стандартного инструмента оценки, такого как pyannote.metrics. Если ваш конвейер включает этап транскрипции, вычислите tcpWER и tcorcWER тем же способом, используя средство оценки с ограничением по времени вроде meeteval, для сравнения с эталонным транскриптом, содержащим метки спикеров. Сравнение с вашей текущей моделью по методу «яблоки к яблокам» дает прямой результат на ваших собственных данных, а не выводы на основе средних показателей из публичных бенчмарков.

Несколько десятков минут размеченного аудио обычно достаточно, чтобы понять, имеет ли доменный разрыв значение для вашего сценария использования. Если ваше производственное аудио похоже на чистый, структурированный домен (например, телетрансляции или телефонная речь), публичные цифры из этой статьи должны переноситься на него вполне корректно. Если же оно напоминает более сложный домен (звук встреч в дальнем поле, плотные перекрестные помехи, «дикое» веб-видео), ожидайте, что абсолютные показатели ошибок будут выше для любой системы, включая Precision-3, даже если относительное ранжирование между системами, как правило, сохраняется.

С чего начать

Precision-3 уже доступна в API: для этого нужно установить параметр "model": "precision-3" в запросе на диаризацию. Существующие интеграции продолжают работать без изменений до тех пор, пока Precision-3 не станет моделью по умолчанию, а цены остаются такими же, как для Precision-2. Локальные развертывания (on-premises) требуют обновления пакета, прежде чем модель станет доступна для рабочих нагрузок.

Две статьи, предшествующие этой в серии, охватывают остальную часть релиза: первая подробно знакомит с моделью, ее входными параметрами и выходными оценками, а вторая описывает настройку vadSensitivity и crosstalkSensitivity для вашего собственного аудиодомена. Обе доступны в блоге pyannoteAI вместе с полными данными бенчмарков на странице pyannote.ai/benchmark.

← Все статьи

Ещё в разделе «Разработка ПО»

Все →
Обзор Sennheiser Momentum 5: великолепный звук, невероятное время автономной работы и минимум компромиссовПресса
Momentum

Обзор Sennheiser Momentum 5: великолепный звук, невероятное время автономной работы и минимум компромиссов

Boeing сообщает о программном сбое в 737 Max, затрагивающем некоторые функции автоматического захода на посадкуПресса
Boeing

Boeing сообщает о программном сбое в 737 Max, затрагивающем некоторые функции автоматического захода на посадку

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple Watch
Пресса
Apple

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple Watch

Компании выбирают САПР от PTC для разработки и проектирования продуктов
PTC

Компании выбирают САПР от PTC для разработки и проектирования продуктов

Clas Ohlson выбирает PTC FlexPLM для поддержки своей стратегии роста
PTC

Clas Ohlson выбирает PTC FlexPLM для поддержки своей стратегии роста

Canon ITS и PTC Japan запускают «Smart PLM Support Service» для поддержки трансформации рабочих процессов в сфере производства
PTC

Canon ITS и PTC Japan запускают «Smart PLM Support Service» для поддержки трансформации рабочих процессов в сфере производства

Ещё от pyannoteAI

Как настроить диаризацию речи для вашего аудиодомена: VAD и перекрестные помехи в DIHARD — pyannoteAI Speaker Intelligence and Diarization
pyannoteAI

Как настроить диаризацию речи для вашего аудиодомена: VAD и перекрестные помехи в DIHARD — pyannoteAI Speaker Intelligence and Diarization

Почему разговорный контекст — это настоящий драйвер производительности для вашего стека Voice AI? — pyannoteAI Speaker Intelligence and Diarization
pyannoteAI

Почему разговорный контекст — это настоящий драйвер производительности для вашего стека Voice AI? — pyannoteAI Speaker Intelligence and Diarization

Диаризация, распознавание и идентификация диктора: в чем разница? — pyannoteAI Speaker Intelligence and Diarization
pyannoteAI

Диаризация, распознавание и идентификация диктора: в чем разница? — pyannoteAI Speaker Intelligence and Diarization

Представляем Precision-3, нашу новую модель диаризации — pyannoteAI Speaker Intelligence and Diarization
pyannoteAI

Представляем Precision-3, нашу новую модель диаризации — pyannoteAI Speaker Intelligence and Diarization

Диаризация, распознавание и идентификация говорящих: в чем разница? — pyannoteAI Speaker Intelligence and Diarization
pyannoteAI

Диаризация, распознавание и идентификация говорящих: в чем разница? — pyannoteAI Speaker Intelligence and Diarization