Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Predstavlyaem precision 3 nashu novuyu model diarizatsii pyannoteai speaker inte 2
Dev48

© 2026 · All rights reserved.

Представляем Precision-3, нашу новую модель диаризации — pyannoteAI Speaker Intelligence and Diarization

Источник: pyannoteAI

Представляем Precision-3, нашу новую модель диаризации — pyannoteAI Speaker Intelligence and Diarization

Источник: pyannoteAI

Представляем Precision-3: снижение ошибки диаризации на 10,4%, новые параметры чувствительности, вероятности спикера на уровне кадров и режимы работы «скорость-точность».

27 сентября 2026 г.•Обновлено: 27 сентября 2026 г.
Коротко: Спустя год после выхода Precision-2 мы выпускаем Precision-3 — самую точную и гибко настраиваемую модель диаризации из всех, что мы создавали. На наших 15 бенчмарк-датасетах частота ошибок диаризации снизилась на 10,4% по сравнению с Precision-2 — с 16,02 до 14,35. Более половины этого улучшения достигается за счет того, что модель стала лучше различать спикеров: теперь она назначает речь правильному спикеру на 18,7% чаще.

Коротко: Спустя год после выхода Precision-2 мы выпускаем Precision-3 — самую точную и гибко настраиваемую модель диаризации из всех, что мы создавали. На наших 15 бенчмарк-датасетах частота ошибок диаризации снизилась на 10,4% по сравнению с Precision-2 — с 16,02 до 14,35. Более половины этого улучшения достигается за счет того, что модель стала лучше различать спикеров: теперь она назначает речь правильному спикеру на 18,7% чаще.

Точность перестала быть единственной проблемой

Каждое поколение серии Precision выпускалось с единственным уменьшающимся показателем. Precision-1 была на 20% точнее передовых решений того времени, а Precision-2 снизила этот показатель еще на 14%. Частота ошибок диаризации — хороший ключевой показатель, и мы продолжаем его улучшать, но год отзывов из промышленной эксплуатации прояснил одну вещь: не все наши клиенты имеют в виду одно и то же, когда говорят, что диаризация была выполнена неверно.

Если поговорить с достаточно большим числом пользователей, эти разногласия начинают казаться структурными, а не случайными. Команде, создающей обучающие корпусы для синтеза речи (TTS), нужно, чтобы любые следы накладывающейся речи исчезли, и они предпочтут избыточно детектировать перекрестные разговоры и отбросить чистый звук, чем рисковать пропуском хотя бы одного загрязненного сегмента. Команда, создающая обучающие данные для клонирования голоса, хочет прямо противоположного: уловить каждую короткую паузу тишины, даже если это означает избыточную сегментацию аудио. Команда, создающая голосовые отпечатки для протоколирования встреч, не хочет ни того, ни другого; они предпочтут отбросить сомнительный сегмент, чем строить по нему голосовой отпечаток. Три клиента, три противоположных требования и ни одной фиксированной конфигурации, которая подходила бы всем.

У этой проблемы есть вторая половина, и она проявляется уже после того, как модель вернула свой ответ. Диаризация располагается в самом начале конвейера, поэтому любые допущенные ею ошибки наследуются всем, что находится ниже по потоку: стенограммой с привязкой к спикерам, аналитикой на ее основе, логикой смены реплик голосового агента. Если все, что получает команда в ответ, — это сегментация, у них нет способа отличить уверенную границу от сомнительной, и в итоге они пишут эвристики поверх решения, которое не могут реально проинспектировать. Точность важна, но сама по себе она не говорит вам, чему стоит доверять.

Precision-3 — наш ответ на обе эти проблемы. Это наша самая точная модель пакетной диаризации на сегодняшний день, демонстрирующая относительное сокращение DER на 10,4% по сравнению с Precision-2, и это первая модель Precision, которая раскрывает механизмы, стоящие за принятием решений: параметры чувствительности на входе, вероятности на уровне кадров на выходе и рабочие режимы «скорость-точность» для локальных развертываний (on-premises). И все это по той же цене, что и Precision-2.

Что Precision-3 делает иначе

Новые входные параметры для API и локальных версий

Каждому клиенту теперь доступны два параметра чувствительности.

Параметр

Диапазон

Эффект

vadSensitivity

От -5.0 до 5.0, по умолчанию 0

Регулирует чувствительность обнаружения голосовой активности. Новинка для API.

crosstalkSensitivity

От -5.0 до 5.0, по умолчанию 0

Регулирует чувствительность к наложениям и перекрестным разговорам. Новинка для API.

Новые выходные показатели для API и локальных версий

Каждый новый выходной показатель отвечает на один конкретный вопрос.

Выходные данные

На что отвечает

Статус

speakerProbability

Насколько вероятно, что этот конкретный спикер активен в данном кадре

Новинка для API и локальной версии. Заменяет устаревший показатель уверенности (confidence)

crosstalkProbability

Насколько вероятно наличие перекрестного разговора в данном кадре

Новинка для API и локальной версии

speechProbability

Насколько вероятно наличие речи в данном кадре

Существовало для локальной версии, теперь доступно и в API

turnLevelConfidence

Насколько модель уверена в атрибуции спикера для данного сегмента

Без изменений

В результате показатель уверенности сегментации на уровне кадров объявляется устаревшим. Разделение речевой активности, наложений и идентичности спикера также означает, что правило фильтрации, написанное вами сегодня, будет иметь смысл и через шесть месяцев, поскольку каждый входящий в него термин соответствует тому, что вы действительно можете наблюдать в аудио.

Режимы работы, только для локальных развертываний

Локальные развертывания выбирают профиль для каждого развертывания

Средний DER — 15 датасетов

Режим

Precision-3

Precision-2

Прирост

Точность (Accuracy)

14.35

16.02

1,67 пункта, 10,4%

Баланс (Balance)

14.94

16.31

1,37 пункта, 8,4%

Скорость (Speed)

15.52

16.91

1,39 пункта, 8,2%

  • 15 датасетов: NOTSOFAR, AVA-AVD, AliMeeting, INA, AMI, AMI-SDM, SBCSAE, MSDWILD, DIHARD, CALLHOME, ALLIES, RAMC, VoxConverse, VoxSRC2023, AISHELL.

15 датасетов: NOTSOFAR, AVA-AVD, AliMeeting, INA, AMI, AMI-SDM, SBCSAE, MSDWILD, DIHARD, CALLHOME, ALLIES, RAMC, VoxConverse, VoxSRC2023, AISHELL.

Время, требуемое для диаризации 1 часа аудио с использованием чипов B200

Режим

Precision-3

Precision-2

Ускорение

Фактор реального времени

Точность (Accuracy)

3,05 с

5,28 с

1,73× (−42%)

681× → 1 181×

Баланс (Balance)

1,43 с

3,33 с

2,33× (−57%)

1 080× → 2 518×

Скорость (Speed)

0,97 с

2,45 с

2,51× (−60%)

1 471× → 3 700×

Precision-3 в режиме точности снижает DER на 1,67 пункта по сравнению с Precision-2, что представляет собой относительное улучшение на 10,4%. Режимы баланса и скорости жертвуют частью этой точности ради уменьшения задержки, обеспечивая ускорение до 2,5 раз, как описано ниже.

Где применяется Precision-3

Используйте входные параметры, чтобы сместить склонность модели к определенному типу ошибок.

  • Извлечение чистых обучающих данных: теперь есть два способа обработки наложений, поэтому выберите тот, который подходит для вашего сценария использования. Увеличьте crosstalkSensitivity для избыточного обнаружения наложений или отфильтруйте данные по crosstalkProbability позже, чтобы удалить каждый перекрывающийся участок.

Извлечение чистых обучающих данных: теперь есть два способа обработки наложений, поэтому выберите тот, который подходит для вашего сценария использования. Увеличьте crosstalkSensitivity для избыточного обнаружения наложений или отфильтруйте данные по crosstalkProbability позже, чтобы удалить каждый перекрывающийся участок.

  • Обнаружение большего количества речи: увеличьте vadSensitivity, чтобы заполнить короткие паузы между соседними репликами и обнаружить односложные реплики, которые в противном случае могли бы быть пропущены.

Обнаружение большего количества речи: увеличьте vadSensitivity, чтобы заполнить короткие паузы между соседними репликами и обнаружить односложные реплики, которые в противном случае могли бы быть пропущены.

Используйте выходные показатели, когда решение принимает логика вашего продукта, а не модель.

  • Создание высококачественных голосовых отпечатков: сохраняйте только те сегменты, которые превышают порог speakerProbability или turnLevelConfidence, жертвуя полнотой в пользу точности.

Создание высококачественных голосовых отпечатков: сохраняйте только те сегменты, которые превышают порог speakerProbability или turnLevelConfidence, жертвуя полнотой в пользу точности.

  • Маршрутизация на проверку человеком: отмечайте сегменты, находящиеся ниже порога уверенности, вместо того чтобы проверять всю стенограмму целиком.

Маршрутизация на проверку человеком: отмечайте сегменты, находящиеся ниже порога уверенности, вместо того чтобы проверять всю стенограмму целиком.

  • Мониторинг качества с течением времени: отслеживайте распределения вероятностей для каждого аудиоисточника, чтобы обнаружить дрейф до того, как он проявится в жалобах пользователей.

Мониторинг качества с течением времени: отслеживайте распределения вероятностей для каждого аудиоисточника, чтобы обнаружить дрейф до того, как он проявится в жалобах пользователей.

Используйте выходные показатели для получения более качественной транскрипции с привязкой к спикерам

Определить, какой спикер произнес то или иное слово, становится трудно в тот момент, когда речь пересекается, поскольку большинство STT-движков транскрибируют только одного спикера за раз. Теперь мы предлагаем два способа справиться с этим: позвольте эксклюзивной диаризации сделать за вас сложную работу или используйте speakerProbability, чтобы принять решение самостоятельно.

  • Разрешение пересечений для распознавания речи: используйте speakerProbability, чтобы определить, какого спикера транскрибируют с наибольшей вероятностью.

Разрешение пересечений для распознавания речи: используйте speakerProbability, чтобы определить, какого спикера транскрибируют с наибольшей вероятностью.

Используйте режимы работы, когда развертывание ограничено бюджетом задержки.

Скорость для чувствительных к задержкам или высоконагруженных рабочих нагрузок, баланс для развертываний общего назначения и точность, когда качество диаризации определяет продукт. Это решения на уровне развертывания, а не для каждого запроса в отдельности, и теперь они ведут себя достаточно предсказуемо, чтобы вы могли настроить один раз и не возвращаться к этому.

Почему это лучше

Ошибка, которая исчезла, — это та, которая причиняет боль

Уровень ошибок диаризации делится на три компонента: ложная тревога, пропущенная речь и путаница спикеров, а усреднение сокращения по всем трем скрывает, какой из них действительно изменился.

Компонент DER

Precision-3

Precision-2

Изменение

Ложная тревога

4.21

4.41

-4.5%

Пропущенное обнаружение в зонах одного спикера

3.02

2.81

+7.5%

Пропущенное обнаружение в зонах перекрестной речи

3.30

4.09

-19.3%

Путаница спикеров в зонах одного спикера

2.57

3.13

-17.8%

Путаница спикеров в зонах перекрестной речи

1.26

1.59

-20.7%

Общий DER

14.35

16.02

-10.4%

Показатели в этой публикации усреднены по 15 эталонным наборам данных: AISHELL, ALLIES, AliMeeting, AMI, AMI-SDM, AVA-AVD, CALLHOME, DIHARD, INA, MSDWILD, NOTSOFAR, RAMC, SBCSAE, VoxConverse и VoxSRC2023. Этот набор охватывает совещания, телефонные разговоры, вещание, чтеную речь и записи в естественных условиях как в условиях одного, так и нескольких микрофонов, что делает среднее значение значимым для разных сценариев использования, а не настроенным только под один из них.

Более половины улучшения приходится на путаницу спикеров: модель стала лучше определять, кто говорит, а не только то, говорит ли кто-нибудь вообще. Это различие имеет большее значение, чем кажется на бумаге, потому что путаница спикеров — это ошибка, которая всплывает на последующих этапах в виде неверных меток спикеров в стенограмме, нарушенной аналитики, голосового агента, отвечающего не тому участнику, и ее дороже всего исправлять постфактум. Пропущенную паузу тишины можно восстановить по форме волны. Неверную метку спикера — нет.

Лучшая детализация для случаев, когда что-то идет не так

Два самых частых вопроса в нашей поддержке касаются избыточного обнаружения спикеров и отнесения речи не к тому спикеру. До сих пор оба расследования заканчивались одинаково: модель создавала сегментацию, сегментация была неверной, и не было промежуточного сигнала, на который можно было бы посмотреть, чтобы понять почему. Вероятности спикера, речи и перекрестной речи на уровне кадров меняют это, потому что теперь мы можем видеть, сомневалась ли модель, где именно она сомневалась и была ли ошибка вызвана обнаружением активности голоса или атрибуцией спикера. Обе эти категории как раз сильнее всего улучшаются в Precision-3, поэтому данный выпуск одновременно снижает частоту таких случаев и упрощает диагностику оставшихся.

Сравнение

Средний уровень ошибок диаризации на четырех публичных бенчмарках; чем ниже, тем лучше.

По сравнению с любым конкурентом, показывающим лучшие результаты на каждом наборе данных, показатель Precision-3 примерно на 47% ниже на DIHARD, на 40% ниже на AISHELL, в три раза лучше на AliMeeting, в 2.2 раза лучше на AMI и в 2.6 раза лучше на AMI SDM.

Интерфейс управления — это то место, где разрыв увеличивается сильнее всего. Каждый поставщик речевых технологий возвращает оценку уверенности для каждого слова, а некоторые дополнительно добавляют оценку уверенности для языка. ElevenLabs и Speechmatics предоставляют функции чувствительности к количеству спикеров. Но ни один из них не объединяет специфичные для диаризации вероятности с элементами управления чувствительностью входа на таком уровне детализации, и для нас такое сочетание — не просто галочка в списке функций; это та часть проблемы, над которой мы работали десятилетие, сначала в открытом исходном коде pyannote.audio toolkit, а теперь и в серии Precision.

Начало работы

В API установите параметр "model": "precision-3". Существующие запросы будут работать по-прежнему, пока Precision-3 не станет стандартной моделью, и вам не нужно менять никакой код, чтобы получить прирост точности. Новые параметры и выходные данные доступны по выбору, поэтому вы можете оценить улучшение точности уже сегодня и использовать новые элементы управления, когда будете готовы.

При локальном развертывании (on-premises) Precision-3 поставляется с обновлением пакета: новую версию необходимо развернуть, прежде чем модель станет доступна для ваших нагрузок. В API Precision-3 сначала появится как опция по выбору, затем станет стандартной моделью, и в конечном итоге поддержка Precision-2 будет прекращена.

Цены остались прежними. Прирост точности, два параметра чувствительности и вероятности на уровне кадров — все это доступно по тарифу Precision-2.

Начните использовать Precision-3 в панели управления или прочитайте документацию по API.

Ознакомьтесь с нашим видеоуроком с пошаговыми инструкциями, чтобы начать использовать новые возможности оптимизации.

Обучение Precision-3 проводилось с использованием ресурсов HPC организации IDRIS в рамках распределений A0201012177 и AD011016176R2, предоставленных GENCI. Мы выражаем искреннюю благодарность IDRIS за исключительную вычислительную инфраструктуру, которая позволила раздвинуть границы возможного в точности диаризации спикеров.

Обучение Precision-3 проводилось с использованием ресурсов HPC организации IDRIS в рамках распределений A0201012177 и AD011016176R2, предоставленных GENCI. Мы выражаем искреннюю благодарность IDRIS за исключительную вычислительную инфраструктуру, которая позволила раздвинуть границы возможного в точности диаризации спикеров.

← Все статьи

Ещё в разделе «Разработка ПО»

Все →
Обзор Sennheiser Momentum 5: великолепный звук, невероятное время автономной работы и минимум компромиссовПресса
Momentum

Обзор Sennheiser Momentum 5: великолепный звук, невероятное время автономной работы и минимум компромиссов

Boeing сообщает о программном сбое в 737 Max, затрагивающем некоторые функции автоматического захода на посадкуПресса
Boeing

Boeing сообщает о программном сбое в 737 Max, затрагивающем некоторые функции автоматического захода на посадку

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple Watch
Пресса
Apple

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple Watch

Компании выбирают САПР от PTC для разработки и проектирования продуктов
PTC

Компании выбирают САПР от PTC для разработки и проектирования продуктов

Clas Ohlson выбирает PTC FlexPLM для поддержки своей стратегии роста
PTC

Clas Ohlson выбирает PTC FlexPLM для поддержки своей стратегии роста

Canon ITS и PTC Japan запускают «Smart PLM Support Service» для поддержки трансформации рабочих процессов в сфере производства
PTC

Canon ITS и PTC Japan запускают «Smart PLM Support Service» для поддержки трансформации рабочих процессов в сфере производства

Ещё от pyannoteAI

Как настроить диаризацию речи для вашего аудиодомена: VAD и перекрестные помехи в DIHARD — pyannoteAI Speaker Intelligence and Diarization
pyannoteAI

Как настроить диаризацию речи для вашего аудиодомена: VAD и перекрестные помехи в DIHARD — pyannoteAI Speaker Intelligence and Diarization

Тестирование Precision-3: Сравнение с Precision-2, Community-1 и рыночными аналогами — pyannoteAI Speaker Intelligence and Diarization
pyannoteAI

Тестирование Precision-3: Сравнение с Precision-2, Community-1 и рыночными аналогами — pyannoteAI Speaker Intelligence and Diarization

Почему разговорный контекст — это настоящий драйвер производительности для вашего стека Voice AI? — pyannoteAI Speaker Intelligence and Diarization
pyannoteAI

Почему разговорный контекст — это настоящий драйвер производительности для вашего стека Voice AI? — pyannoteAI Speaker Intelligence and Diarization

Диаризация, распознавание и идентификация диктора: в чем разница? — pyannoteAI Speaker Intelligence and Diarization
pyannoteAI

Диаризация, распознавание и идентификация диктора: в чем разница? — pyannoteAI Speaker Intelligence and Diarization

Диаризация, распознавание и идентификация говорящих: в чем разница? — pyannoteAI Speaker Intelligence and Diarization
pyannoteAI

Диаризация, распознавание и идентификация говорящих: в чем разница? — pyannoteAI Speaker Intelligence and Diarization