Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Predstavlyaem precision 3 nashu novuyu model diarizatsii pyannoteai speaker inte
Dev48

© 2026 · All rights reserved.

Представляем Precision-3, нашу новую модель диаризации — pyannoteAI Speaker Intelligence and Diarization

Источник: pyannoteAI

Представляем Precision-3, нашу новую модель диаризации — pyannoteAI Speaker Intelligence and Diarization

Источник: pyannoteAI

Представляем Precision-3: снижение ошибки диаризации на 10,4%, новые параметры чувствительности, вероятности спикеров на уровне кадров и режимы работы «скорость-точность».

25 сентября 2026 г.
Коротко: Год спустя после выхода Precision-2 мы выпускаем Precision-3 — самую точную и настраиваемую модель диаризации из всех, что мы создавали. На наших 15 эталонных датасетах уровень ошибки диаризации снизился на 10,4% по сравнению с Precision-2 — с 16,02 до 14,35. Более половины этого улучшения достигается за счет того, что модель стала лучше различать спикеров: теперь она присваивает речь правильному спикеру на 18,7% чаще.

Коротко: Год спустя после выхода Precision-2 мы выпускаем Precision-3 — самую точную и настраиваемую модель диаризации из всех, что мы создавали. На наших 15 эталонных датасетах уровень ошибки диаризации снизился на 10,4% по сравнению с Precision-2 — с 16,02 до 14,35. Более половины этого улучшения достигается за счет того, что модель стала лучше различать спикеров: теперь она присваивает речь правильному спикеру на 18,7% чаще.

Точность перестала быть единственной проблемой

Каждое поколение серии Precision выпускалось с единственным показателем, который постоянно снижался. Precision-1 была на 20% точнее передовых разработок того времени, а Precision-2 срезала еще 14%. Уровень ошибки диаризации — хороший главный показатель, и мы продолжаем его улучшать, но год отзывов из промышленной эксплуатации прояснил одну вещь: наши клиенты не вкладывают одинаковый смысл в слова «диаризация была неверной».

Если поговорить с достаточным количеством клиентов, эти разногласия начинают казаться структурными, а не случайными. Команда, создающая обучающие корпусы для синтеза речи, хочет избавиться от любых следов наложения речи и предпочитает избыточно детектировать перекрестные разговоры и отбрасывать чистую аудиозапись, чем рисковать пропуском хотя бы одного загрязненного сегмента. Команда, производящая обучающие данные для клонирования голоса, преследует противоположную цель: уловить каждый короткий перерыв на тишину, даже если это приведет к избыточной сегментации аудио. Команда, создающая голосовые отпечатки для системы протоколирования встреч, не хочет ни того, ни другого; они предпочтут отбросить сомнительный сегмент, чем строить по нему голосовой отпечаток. Трое клиентов, три противоположных требования и ни одной фиксированной конфигурации, которая подошла бы всем.

Существует и вторая часть проблемы, которая проявляется уже после того, как модель выдала свой ответ. Диаризация находится в начале конвейера, поэтому любые ее ошибки наследуются всеми последующими этапами: расшифровкой с привязкой к спикерам, аналитикой на ее основе, логикой смены реплик голосового агента. Если все, что получает команда на выходе — это сегментация, у них нет способа отличить уверенную границу от сомнительной, и в итоге они пишут эвристики поверх решения, которое не могут реально проинспектировать. Точность важна, но сама по себе она не говорит вам, чему стоит доверять.

Precision-3 — наш ответ на обе эти проблемы. Это наша самая точная модель пакетной диаризации на сегодняшний день (относительное снижение DER на 10,4% по сравнению с Precision-2), и это первая модель Precision, которая открывает «изнанку» принятых ею решений: параметры чувствительности на входе, вероятности на уровне кадров на выходе и операционные режимы «скорость-точность» для локальных развертываний (on-premises). И все это по той же цене, что и Precision-2.

Что Precision-3 делает иначе

Новые входные параметры (в API и on-prem)

Теперь каждому клиенту доступны два параметра чувствительности.

Параметр

Диапазон

Эффект

vadSensitivity

От -5.0 до 5.0, по умолчанию 0

Регулирует чувствительность определения голосовой активности (VAD). Новинка в API.

crosstalkSensitivity

От -5.0 до 5.0, по умолчанию 0

Регулирует чувствительность к наложениям и перекрестным разговорам. Новинка в API.

Новые выходные оценки (в API и on-prem)

Каждая новая выходная оценка отвечает на один конкретный вопрос.

Результат

На что отвечает

Статус

speakerProbability

Насколько вероятно, что этот конкретный спикер активен в данном кадре

Новинка в API и on-prem. Заменяет устаревший выход confidence

crosstalkProbability

Насколько вероятно наличие перекрестного разговора в данном кадре

Новинка в API и on-prem

speechProbability

Насколько вероятно присутствие речи в данном кадре

Существовало в on-prem, теперь доступно в API

turnLevelConfidence

Уверенность модели в определении принадлежности сегмента конкретному спикеру

Без изменений

В результате оценка уверенности сегментации на уровне кадров объявлена устаревшей. Разделение голосовой активности, наложений и идентичности спикера также означает, что правило фильтрации, написанное вами сегодня, будет актуально и через шесть месяцев, поскольку каждый его термин соотносится с тем, что вы действительно можете наблюдать в аудио.

Режимы работы (только для on-premises)

Для локальных развертываний выбирается один профиль на инсталляцию

Средний DER — 15 датасетов

Режим

Precision-3

Precision-2

Прирост

Точность (Accuracy)

14.35

16.02

1.67 пункта, 10.4%

Баланс (Balance)

14.94

16.31

1.37 пункта, 8.4%

Скорость (Speed)

15.52

16.91

1.39 пункта, 8.2%

  • 15 датасетов: NOTSOFAR, AVA-AVD, AliMeeting, INA, AMI, AMI-SDM, SBCSAE, MSDWILD, DIHARD, CALLHOME, ALLIES, RAMC, VoxConverse, VoxSRC2023, AISHELL.

15 датасетов: NOTSOFAR, AVA-AVD, AliMeeting, INA, AMI, AMI-SDM, SBCSAE, MSDWILD, DIHARD, CALLHOME, ALLIES, RAMC, VoxConverse, VoxSRC2023, AISHELL.

Время, необходимое для диаризации 1 часа аудио с использованием B200

Режим

Precision-3

Precision-2

Ускорение

Фактор реального времени

Точность (Accuracy)

3.05с

5.28с

1.73× (-42%)

681× → 1,181×

Баланс (Balance)

1.43с

3.33с

2.33× (−57%)

1,080× → 2,518×

Скорость (Speed)

0.97с

2.45с

2.51× (−60%)

1,471× → 3,700×

Precision-3 в режиме точности снижает DER на 1.67 пункта по сравнению с Precision-2, что дает относительное улучшение на 10.4%. Режимы баланса и скорости жертвуют частью этой точности ради задержки, обеспечивая ускорение до 2.5 раз, как описано ниже.

Где применяется Precision-3

Используйте входные параметры, чтобы сместить склонность модели к определенному типу ошибок.

  • Извлечение чистых обучающих данных: Теперь есть два способа работы с наложениями, выберите тот, который подходит под ваш сценарий. Увеличьте crosstalkSensitivity для избыточного обнаружения наложений или отфильтруйте по crosstalkProbability после, чтобы удалить все пересекающиеся участки.

Извлечение чистых обучающих данных: Теперь есть два способа работы с наложениями, выберите тот, который подходит под ваш сценарий. Увеличьте crosstalkSensitivity для избыточного обнаружения наложений или отфильтруйте по crosstalkProbability после, чтобы удалить все пересекающиеся участки.

  • Обнаружение большего объема речи: Увеличьте vadSensitivity, чтобы заполнить короткие паузы между соседними репликами и обнаружить односложные реплики, которые в противном случае могли бы быть пропущены.

Обнаружение большего объема речи: Увеличьте vadSensitivity, чтобы заполнить короткие паузы между соседними репликами и обнаружить односложные реплики, которые в противном случае могли бы быть пропущены.

Используйте выходные оценки, когда решение должно приниматься логикой вашего продукта, а не моделью.

  • Создание высококачественных голосовых отпечатков: Оставляйте только те сегменты, которые превышают порог speakerProbability или turnLevelConfidence, жертвуя полнотой в пользу точности.

Создание высококачественных голосовых отпечатков: Оставляйте только те сегменты, которые превышают порог speakerProbability или turnLevelConfidence, жертвуя полнотой в пользу точности.

  • Маршрутизация на ручную проверку: Помечайте сегменты, находящиеся ниже порога уверенности, вместо проверки всей стенограммы.

Маршрутизация на ручную проверку: Помечайте сегменты, находящиеся ниже порога уверенности, вместо проверки всей стенограммы.

  • Мониторинг качества с течением времени: Отслеживайте распределение вероятностей по каждому аудиоисточнику, чтобы обнаружить деградацию (drift) до того, как она превратится в жалобы пользователей.

Мониторинг качества с течением времени: Отслеживайте распределение вероятностей по каждому аудиоисточнику, чтобы обнаружить деградацию (drift) до того, как она превратится в жалобы пользователей.

Используйте выходные оценки для более качественной транскрипции с привязкой к спикерам

Определить, какой именно спикер произнес то или иное слово, становится сложно в моменты наложения речи, поскольку большинство STT-движков транскрибируют речь только одного спикера за раз. Теперь мы предлагаем два способа решения этой проблемы: позвольте эксклюзивной диаризации сделать всю сложную работу за вас или используйте параметр speakerProbability, чтобы принять решение самостоятельно.

  • Разрешение наложений в распознавании речи: используйте speakerProbability, чтобы определить, чей голос с наибольшей вероятностью транскрибируется.

Разрешение наложений в распознавании речи: используйте speakerProbability, чтобы определить, чей голос с наибольшей вероятностью транскрибируется.

Используйте режимы работы, когда развертывание ограничено бюджетом задержки.

Скорость для чувствительных к задержкам или высоконагруженных рабочих процессов, баланс для развертываний общего назначения и точность, когда качество диаризации является ключевым фактором для продукта. Это решения на уровне развертывания, а не для каждого запроса в отдельности, и теперь они ведут себя достаточно предсказуемо, чтобы вы могли настроить режим один раз и больше не возвращаться к нему.

Почему это лучше

Ошибка, которая исчезла — это та, которая причиняет больше всего боли

Коэффициент ошибок диаризации (DER) делится на три компонента: ложное срабатывание, пропущенная речь и путаница спикеров, а усреднение снижения по всем трем компонентам скрывает, какой из них на самом деле изменился.

Компонент DER

Precision-3

Precision-2

Изменение

Ложное срабатывание

4.21

4.41

-4.5%

Пропущенное обнаружение в зонах одного спикера

3.02

2.81

+7.5%

Пропущенное обнаружение в зонах перекличогов

3.30

4.09

-19.3%

Путаница спикеров в зонах одного спикера

2.57

3.13

-17.8%

Путаница спикеров в зонах перекличогов

1.26

1.59

-20.7%

Общий DER

14.35

16.02

-10.4%

Цифры в этой статье усреднены по 15 эталонным наборам данных: AISHELL, ALLIES, AliMeeting, AMI, AMI-SDM, AVA-AVD, CALLHOME, DIHARD, INA, MSDWILD, NOTSOFAR, RAMC, SBCSAE, VoxConverse и VoxSRC2023. Этот набор охватывает встречи, телефонные разговоры, вещание, чтенную речь и записи в реальных условиях как в одно-, так и в многомикрофонных конфигурациях, что делает среднее значение осмысленным для различных сценариев использования, а не оптимизированным под какой-то один из них.

Более половины улучшения достигается за счет снижения путаницы спикеров: модель стала лучше определять, кто говорит, а не только то, говорит ли кто-нибудь вообще. Это различие важнее, чем кажется на бумаге, потому что путаница спикеров — это ошибка, которая проявляется на последующих этапах: в виде неверных меток спикеров в стенограмме, нарушенной аналитики, голосового агента, отвечающего не тому участнику, и ее исправлять постфактум дороже всего. Пропущенную паузу можно восстановить по форме волны. Неверную метку спикера — нет.

Улучшенный мониторинг для проблемных случаев

Два самых частых вопроса в нашей поддержке связаны с избыточным обнаружением спикеров и назначением речи не тому спикеру. До сих пор оба разбирательства заканчивались одинаково: модель выдавала разметку, разметка была неверной, и не было никаких промежуточных сигналов, чтобы понять почему. Вероятности спикера, речи и перекрестной речи на уровне кадров меняют ситуацию, потому что теперь мы видим, сомневалась ли модель, где именно она сомневалась и была ли ошибка вызвана обнаружением голосовой активности или атрибуцией спикера. Обе эти категории как раз и демонстрируют наибольшее улучшение в Precision-3, поэтому данный релиз одновременно снижает частоту возникновения таких случаев и облегчает диагностику оставшихся.

Сравнение с аналогами

Средний коэффициент ошибок диаризации на четырех публичных бенчмарках; чем ниже, тем лучше.

По сравнению с конкурентом, показывающим лучшие результаты на каждом наборе данных, Precision-3 демонстрирует примерно на 47% меньшую ошибку на DIHARD, на 40% меньшую на AISHELL, в три раза лучше на AliMeeting, в 2,2 раза лучше на AMI и в 2,6 раза лучше на AMI SDM.

Интерфейс управления — это область, где разрыв проявляется сильнее всего. Каждый провайдер распознавания речи возвращает показатель уверенности для каждого слова, а некоторые добавляют поверх него показатель уверенности в языке. ElevenLabs и Speechmatics предоставляют настройки чувствительности к количеству спикеров. Но ни один из них не объединяет специфичные для диаризации вероятности с элементами управления чувствительностью входа на таком уровне детализации. Для нас это сочетание не просто галочка в списке функций; это та часть проблемы, над которой мы работали десятилетие — сначала в составе открытого инструментария pyannote.audio, а теперь и в серии Precision.

Начало работы

В API установите параметр "model": "precision-3". Существующие запросы продолжат работать так же, как и раньше, пока Precision-3 не станет моделью по умолчанию, и вам не нужно менять код, чтобы воспользоваться приростом точности. Новые параметры и выходные данные являются опциональными, поэтому вы можете внедрить улучшение точности уже сегодня и освоить новые элементы управления тогда, когда будете к этому готовы.

При локальном развертывании (on-premises) Precision-3 поставляется с обновлением пакета: новую версию необходимо развернуть, прежде чем модель станет доступна для ваших рабочих нагрузок. В API модель Precision-3 сначала появится как опциональная опция, затем станет стандартной, после чего поддержка Precision-2 будет прекращена.

Цены остаются прежними. Прирост точности, два параметра чувствительности и покадровые вероятности доступны по тарифу Precision-2.

Начните использовать Precision-3 в панели управления или ознакомьтесь с документацией по API.

Посмотрите наше видеоруководство, чтобы начать использовать новые возможности оптимизации.

Обучение Precision-3 проводилось с использованием вычислительных ресурсов суперкомпьютера HPC центра IDRIS в рамках распределений ресурсов A0201012177 и AD011016176R2, предоставленных агентством GENCI. Мы выражаем искреннюю благодарность IDRIS за исключительную вычислительную инфраструктуру, которая позволила раздвинуть границы возможного в точности диаризации речи.

Обучение Precision-3 проводилось с использованием вычислительных ресурсов суперкомпьютера HPC центра IDRIS в рамках распределений ресурсов A0201012177 и AD011016176R2, предоставленных агентством GENCI. Мы выражаем искреннюю благодарность IDRIS за исключительную вычислительную инфраструктуру, которая позволила раздвинуть границы возможного в точности диаризации речи.

← Все статьи

Ещё в разделе «Разработка ПО»

Все →
Microsoft объединяет бизнес-ИИ в единое приложение в стремлении конкурировать с AnthropicПресса
Microsoft

Microsoft объединяет бизнес-ИИ в единое приложение в стремлении конкурировать с Anthropic

Интеллектуальная обработка документов, выходящая за рамки шаблонов: на базе AWS Agentic AI
HCLTech

Интеллектуальная обработка документов, выходящая за рамки шаблонов: на базе AWS Agentic AI

Lightspeed планирует привлечь $250 млн для нового фонда в Индии, делая ставку на ИИ на ранних стадиях
Пресса
Lightspeed

Lightspeed планирует привлечь $250 млн для нового фонда в Индии, делая ставку на ИИ на ранних стадиях

Инженерные услуги в области медицинской полупроводниковой техники
HCLTech

Инженерные услуги в области медицинской полупроводниковой техники

Будущее контакт-центров: баланс между автоматизацией на базе ИИ и человеческим опытом
HCLTech

Будущее контакт-центров: баланс между автоматизацией на базе ИИ и человеческим опытом

IFS — единственный поставщик, признанный «Выбором клиентов 2025 года» (Customers’ Choice) в категории управления выездным обслуживанием (Field Service Management) по версии отчета Gartner® Peer Insights™
IFS

IFS — единственный поставщик, признанный «Выбором клиентов 2025 года» (Customers’ Choice) в категории управления выездным обслуживанием (Field Service Management) по версии отчета Gartner® Peer Insights™

Ещё от pyannoteAI

Как настроить диаризацию речи для вашего аудиодомена: VAD и перекрестные помехи в DIHARD — pyannoteAI Speaker Intelligence and Diarization
pyannoteAI

Как настроить диаризацию речи для вашего аудиодомена: VAD и перекрестные помехи в DIHARD — pyannoteAI Speaker Intelligence and Diarization

Сравнение Precision-3: сопоставление с Precision-2, Community-1 и рынком — pyannoteAI Speaker Intelligence and Diarization
pyannoteAI

Сравнение Precision-3: сопоставление с Precision-2, Community-1 и рынком — pyannoteAI Speaker Intelligence and Diarization

Почему речевой контекст является главным драйвером производительности для вашего голосового ИИ-стека? — Анализ речи и диаризация от pyannoteAI
pyannoteAI

Почему речевой контекст является главным драйвером производительности для вашего голосового ИИ-стека? — Анализ речи и диаризация от pyannoteAI

Диаризация, распознавание и идентификация говорящих: в чем разница? — pyannoteAI Speaker Intelligence and Diarization
pyannoteAI

Диаризация, распознавание и идентификация говорящих: в чем разница? — pyannoteAI Speaker Intelligence and Diarization