Сквозная потоковая архитектура
Диаризация спикеров сегментирует аудиопоток по времени выступления каждого отдельного говорящего, выводит временные метки для каждого голоса и присваивает каждому отрезку согласованную метку спикера. В сочетании с транскрипцией диаризация позволяет соотнести транскрибированные слова с тем, кто их произнес в ходе беседы.
Модель NVIDIA Nemotron 3 Diarization имеет архитектуру на базе трансформеров с примерно 100 млн параметров, созданную на основе NVIDIA Streaming Sortformer. Она преобразует аудио с частотой 16 кГц в кадры длительностью 10 мс и выдает матрицу T×8 с вероятностями речевой активности спикеров.
Состояние беседы между фрагментами поддерживается с помощью двух элементов: кеша спикеров в порядке их появления (speaker_0 — первый услышанный голос, и этот статус сохраняется за ним) и FIFO-буфера («первым пришел — первым вышел») недавних кадров, причем для неограниченной длины аудио не требуются вложения или кластеризация.
Настройка задержки для различных вариантов использования
В то время как предыдущие модели диаризации требуют сложной настройки нескольких различных параметров или вообще не поддерживают множество профилей задержки, одна и та же контрольная точка Nemotron 3 Diarization может обслуживать каждый запрос с четырьмя значениями алгоритмической задержки в диапазоне от 0,32 до 30,4 секунды, что определяет объем будущих аудиоданных, который модель анализирует перед фиксацией метки. Чтобы удовлетворить разнообразные требования приложений — от взаимодействия с голосовыми агентами в реальном времени до пакетной обработки мультимедиа — Nemotron 3 Diarization поддерживает гибкие настройки алгоритмической задержки в рамках единой универсальной контрольной точки.
Профили задержки для одной контрольной точки.
На рисунке 1 показано, как эти профили задержки напрямую сопоставляются с размерами фрагментов и окнами упреждения вправо (right-context lookahead windows). Переход от сверхнизкого профиля к стандартному низкому профилю обеспечивает непрерывный прирост качества ценой небольшого увеличения задержки буфера. Такая предсказуемость позволяет разработчикам динамически настраивать размеры буферов для каждого запроса без необходимости повторного развертывания базовых экземпляров модели.
Высокое качество во всех четырех настраиваемых профилях задержки
Мы приводим показатель частоты ошибок диаризации (DER) с учетом наложения речи и без использования зоны допуска (collar). Nemotron 3 Diarization сохраняет точность при снижении задержки. Переход от автономного профиля (30 секунд) к сверхнизкому профилю (0,32 секунды) увеличивает DER всего на 1–2 пункта по сравнению с предварительно записанным аудио, причем качество сохраняется при количестве спикеров более четырех. На датасете AISHELL-4 для «низкого» профиля мы зафиксировали DER на уровне 9,8% против 27,2% у Streaming Sortformer v2.1, что является значительным улучшением по сравнению с предшественником этой модели.
Чтобы оценить стандартную точность диаризации в различных акустических условиях и при разном количестве спикеров, мы измерили DER на эталонных наборах данных без применения временной зоны допуска.
Nemotron 3 Diarization обеспечивает ведущую производительность по всем трем профилям задержки.
Результаты бенчмаркинга подчеркивают стабильность работы на различных эталонных наборах данных на разных языках, таких как NOTSOFAR, AMI, CALLHOME и AISHELL. Модель превосходит Meta Muse Voice Transcribe на всех датасетах даже при конфигурации со сверхнизкой задержкой и уступает pyannote Community-1 только на датасете AMI. Даже в конфигурациях со сверхнизкой задержкой уровень ошибок остается в узких пределах по сравнению с автономными базовыми показателями, что подтверждает надежность определения спикеров в условиях жестких ограничений реального времени. Потоковая диаризация на платформе Baseten демонстрирует качество, близкое к предварительно записанному аудио, во всех протестированных профилях задержки.
Активность спикеров как сигнал речевой активности и смены реплик
Временные сегменты с привязкой к спикерам — это лишь один из способов использования Nemotron 3 Diarization. По своей сути модель отслеживает речевую активность каждого спикера с шагом 10 мс. Эти сырые данные могут использоваться голосовыми приложениями для реализации трех ключевых возможностей:
- Определение речевой активности: объединяя данные по всем аудиоканалам, модель определяет речь напрямую из аудиопотока, а не полагается на уровни громкости.
Определение речевой активности: объединяя данные по всем аудиоканалам, модель определяет речь напрямую из аудиопотока, а не полагается на уровни громкости.
- Определение завершения реплики конкретным спикером: модель отслеживает моменты, когда определенный спикер перестает говорить в течение заданного времени. Это помогает голосовому ИИ-агенту отличать завершение предложения основным пользователем от фоновой болтовни кого-то другого в комнате.
Определение завершения реплики конкретным спикером: модель отслеживает моменты, когда определенный спикер перестает говорить в течение заданного времени. Это помогает голосовому ИИ-агенту отличать завершение предложения основным пользователем от фоновой болтовни кого-то другого в комнате.
- Смена реплик и прерывания: порядок появления голосов позволяет идентифицировать основного спикера. Если начинает говорить второй голос, модель фиксирует прерывание; если оба говорят одновременно, она помечает наложение речи, реагируя примерно за 300 мс при настройках сверхнизкой задержки.
Смена реплик и прерывания: порядок появления голосов позволяет идентифицировать основного спикера. Если начинает говорить второй голос, модель фиксирует прерывание; если оба говорят одновременно, она помечает наложение речи, реагируя примерно за 300 мс при настройках сверхнизкой задержки.
Поддержка «из коробки» для предварительно записанной, потоковой и привязанной к спикерам транскрипции
Для упрощения развертывания при различных архитектурных решениях аудиоинфраструктуры Baseten предоставляет модель через три специализированных пресета обслуживания. На рисунке 3 представлен архитектурный обзор этих пресетов, а также их целевые рабочие нагрузки и характеристики пропускной способности.
Три пресета на платформе Baseten.
Эти модульные пресеты позволяют голосовым приложениям выбирать между пакетными запросами без сохранения состояния, постоянными потоками WebSocket для отслеживания спикеров в реальном времени или совместными сквозными конвейерами транскрипции, напрямую удовлетворяя требования бэкенд-инфраструктуры.
Каждый уровень задержки работает как собственный готовый к использованию экземпляр, поэтому вы можете легко выбирать скорость для каждого запроса без повторного развертывания. Опция транскрипции в реальном времени объединяет трекер спикеров с 600-миллионной англоязычной моделью распознавания речи от NVIDIA — NVIDIA Parakeet V2 ASR, которая также входит в семейство речевых моделей Nemotron. Используя данные об активности спикеров для направления транскрипции в том же аудиопотоке, система точно фиксирует обе стороны беседы, даже когда люди перебивают друг друга.
Сочетание распознавания речи с диаризацией обычно требует управления раздельными конвейерами моделей и последующего выравнивания стенограмм. Наша система реального времени напрямую учитывает признаки активности спикеров в модели ASR во время первого прямого прохода. Передавая векторы активности для каждого спикера непосредственно в начальные слои кодировщика Parakeet V2, конвейер транскрибирует перекрывающиеся аудиоканалы за один проход, исключая дублирование этапов извлечения признаков и сохраняя временное выравнивание между словами и спикерами.
Производительность Nemotron 3 Diarization на платформе Baseten
Нагрузка создавалась утилитой k6 внутри кластера с однопоточным контролем на неактивной реплике в каждом запуске; каждый серверный кадр архивируется.
Чтобы установить надежные пределы производительности для производственной инфраструктуры, мы провели бенчмаркинг общей пропускной способности потоковой передачи на один графический процессор в условиях непрерывных тестов нагрузки. На рисунке 4 показана зависимость производительности от задержки при разном количестве одновременных потоков на одном NVIDIA RTX PRO 6000.
На платформе Baseten модель Nemotron 3 Diarization может поддерживать до 500 потоков на RTX-6000 в режиме с низкой задержкой.
Результаты стресс-тестирования демонстрируют линейное (без роста задержки) масштабирование вплоть до точек максимальной загрузки оборудования. За счет строгого управления аппаратными ресурсами в рамках прогнозируемых границ использования GPU системная задержка остается стабильной и близкой к базовым значениям для одного потока до достижения жестких пределов емкости.
Используя идентичные файлы и аппаратное обеспечение, оптимизированный пресет обслуживания Baseten обеспечил примерно в 1,35 раза более высокую пропускную способность пакетной обработки по сравнению с эталонной установкой NVIDIA, использовавшейся в наших тестах. Через HTTP-соединение один GPU может непрерывно обрабатывать 200 шестиминутных аудиофайлов каждую минуту, сохраняя при этом стабильное время отклика.
Для живой транскрипции потоковые и пакетные настройки обеспечивают практически одинаковую точность, успешно восстанавливая расшифровки с разметкой спикеров непосредственно из модели распознавания речи.
Разверните Nemotron 3 Diarization уже сегодня
Nemotron 3 Diarization доступна на Hugging Face и в библиотеке моделей Baseten в качестве пресетов для пакетной, потоковой и транскрипции с диаризацией в реальном времени. Разверните модель в пару кликов, выберите профиль задержки для каждого запроса и объедините ее с уже используемой системой ASR — или свяжитесь с нашими инженерами, чтобы узнать, как мы можем оптимизировать вашу голосовую рабочую нагрузку.










