Сквозная потоковая архитектура
Диаризация спикеров сегментирует аудиопоток по временным интервалам речи каждого отдельного говорящего, выдает временные метки для каждого уникального голоса и присваивает каждому отрезку постоянную метку спикера. В сочетании с транскрипцией диаризация позволяет связать транскрибированные слова с тем, кто именно их произнес в ходе беседы.
Модель NVIDIA Nemotron 3 Diarization имеет архитектуру на базе трансформеров с примерно 100 млн параметров, созданную на основе NVIDIA Streaming Sortformer. Она преобразует аудио с частотой 16 кГц в кадры длительностью 10 мс и выдает матрицу вероятностей активности спикеров размера T×8.
Два элемента состояния переносят контекст разговора между фрагментами: кэш спикеров в порядке появления (speaker_0 — это первый услышанный голос, и он сохраняет этот статус) и FIFO («первым пришел — первым ушел») очередь недавних кадров, при этом для неограниченной длины аудио не требуются ни эмбеддинги, ни кластеризация.
Настройка задержки для разнообразных сценариев использования
В то время как предыдущие модели диаризации требуют сложной настройки нескольких различных параметров или вообще не поддерживают профили с разной задержкой, одна и та же контрольная точка Nemotron 3 Diarization может обслуживать каждый запрос с четырьмя алгоритмическими задержками в диапазоне от 0.32 до 30.4 секунды, которые определяют, сколько будущего аудио модель анализирует перед выдачей метки. Чтобы удовлетворить различные требования приложений — от взаимодействия с агентами в реальном времени до пакетной обработки медиаданных, — Nemotron 3 Diarization поддерживает гибкие настройки алгоритмической задержки в рамках одной унифицированной контрольной точки.
Профили задержки единой контрольной точки.
На рисунке 1 показано, как эти профили задержки напрямую сопоставляются с размерами фрагментов и окнами опережения правого контекста. Переход от сверхнизкого профиля к стандартному низкому профилю обеспечивает непрерывный рост качества за счет умеренного увеличения задержки буфера. Такая предсказуемость позволяет разработчикам динамически настраивать размеры буфера для каждого запроса без необходимости повторного развертывания базовых экземпляров модели.
Высокое качество при четырех настраиваемых профилях задержки
Мы приводим показатель частоты ошибок диаризации (DER) с учетом наложений и без ограничения (collar). Nemotron 3 Diarization сохраняет точность при снижении задержки. Переход от автономного профиля (30 секунд) к сверхнизкому профилю (0.32 секунды) увеличивает DER всего на 1–2 пункта по сравнению с предварительно записанным аудио, причем качество сохраняется даже при наличии более четырех спикеров. На датасете AISHELL-4 в «низком» профиле мы зафиксировали DER на уровне 9.8% по сравнению с 27.2% у Streaming Sortformer v2.1, что является значительным улучшением по сравнению с предшественником этой модели.
Чтобы оценить стандартную точность диаризации в различных акустических условиях и при разном количестве спикеров, мы измерили DER на бенчмарк-датасетах без применения временного ограничения (collar).
Nemotron 3 Diarization обеспечивает ведущую производительность во всех трех профилях задержки.
Результаты бенчмаркинга подчеркивают стабильность работы на различных тестовых наборах данных на разных языках, таких как NOTSOFAR, AMI, CALLHOME и AISHELL: модель превосходит Meta Muse Voice Transcribe на всех датасетах даже в конфигурации со сверхнизкой задержкой и уступает pyannote Community-1 только на датасете AMI. Даже в конфигурациях со сверхнизкой задержкой уровень ошибок остается в узких пределах по сравнению с автономными базовыми показателями, что подтверждает надежность определения спикеров в условиях реального времени. Потоковая диаризация на Baseten сохраняет качество, близкое к предварительно записанному аудио, во всех протестированных профилях задержки.
Активность спикеров как сигнал речевой активности и смены реплик
Временные сегменты с привязкой к спикерам — это лишь один из способов использования Nemotron 3 Diarization. По своей сути модель отслеживает речевую активность каждого спикера с шагом 10 мс. Эти сырые данные могут использоваться голосовыми приложениями для реализации трех ключевых возможностей:
- Определение речевой активности: комбинируя данные по всем аудиоканалам, модель определяет речь напрямую из аудиопотока, не полагаясь на уровень громкости.
Определение речевой активности: комбинируя данные по всем аудиоканалам, модель определяет речь напрямую из аудиопотока, не полагаясь на уровень громкости.
- Определение окончания реплики конкретного спикера: модель отслеживает, когда конкретный спикер перестает говорить в течение заданного времени. Это помогает голосовому ИИ-агенту отличать завершение предложения основным пользователем от фонового шума других людей в комнате.
Определение окончания реплики конкретного спикера: модель отслеживает, когда конкретный спикер перестает говорить в течение заданного времени. Это помогает голосовому ИИ-агенту отличать завершение предложения основным пользователем от фонового шума других людей в комнате.
- Смена реплик и прерывания: порядок появления голосов позволяет идентифицировать основного спикера. Если начинает говорить второй голос, модель фиксирует прерывание; если оба говорят одновременно, она отмечает наложение речи, реагируя примерно за 300 мс в режиме сверхнизкой задержки.
Смена реплик и прерывания: порядок появления голосов позволяет идентифицировать основного спикера. Если начинает говорить второй голос, модель фиксирует прерывание; если оба говорят одновременно, она отмечает наложение речи, реагируя примерно за 300 мс в режиме сверхнизкой задержки.
Поддержка из коробки для предварительно записанной, потоковой и атрибутированной по спикерам транскрипции
Для оптимизации развертывания в рамках различных архитектур аудиоинфраструктуры Baseten предоставляет модель через три специализированных пресета обслуживания. На рисунке 3 приводится архитектурный обзор этих пресетов, а также их целевые рабочие нагрузки и характеристики пропускной способности.
Три пресета на Baseten.
Эти модульные пресеты позволяют голосовым приложениям выбирать между пакетными запросами без сохранения состояния, постоянными потоками WebSocket для отслеживания спикеров в реальном времени или совместными сквозными конвейерами транскрипции, точно отвечая требованиям бэкенд-инфраструктуры.
Каждый уровень задержки работает как отдельный готовый к использованию экземпляр, поэтому вы можете легко выбирать скорость для каждого запроса без повторного развертывания. Функция транскрипции в реальном времени объединяет трекер спикеров с моделью распознавания английской речи NVIDIA на 600 млн параметров, NVIDIA Parakeet V2 ASR, которая также входит в семейство моделей Nemotron. Используя данные об активности спикеров для направления транскрипции в том же аудиопотоке, модель точно фиксирует обе стороны разговора, даже когда люди перебивают друг друга.
Сочетание распознавания речи с диаризацией обычно требует управления раздельными конвейерами моделей и последующего выравнивания транскриптов. Наша система реального времени напрямую передает признаки активности спикеров в модель распознавания речи (ASR) в рамках первичного прямого прохода. Подавая векторы активности каждого спикера непосредственно в начальные слои энкодера Parakeet V2, конвейер транскрибирует перекрывающиеся аудиоканалы за один проход, устраняя дублирование шагов извлечения признаков и сохраняя временное выравнивание между словами и спикерами.
Производительность Nemotron 3 Diarization на Baseten
Нагрузка создавалась с помощью k6 внутри кластера с однопоточным контролем на неактивной реплике в каждом запуске; каждый кадр сервера архивируется.
Чтобы установить надежные пределы производительности для производственной инфраструктуры, мы провели бенчмаркинг общей пропускной способности потоковой передачи на один графический процессор в условиях непрерывного тестирования под нагрузкой. На рисунке 4 показана зависимость задержки от разного числа одновременных потоков на одном NVIDIA RTX PRO 6000.
На Baseten модель Nemotron 3 Diarization способна поддерживать до 500 потоков на RTX-6000 в режиме с низкой задержкой.
Результаты стресс-тестирования демонстрируют линейное (без роста) масштабирование задержки вплоть до точек максимального насыщения оборудования. За счет строгого управления аппаратными ресурсами в рамках предсказуемых границ использования GPU задержка системы остается стабильной и близкой к базовым значениям для одного потока вплоть до достижения жестких пределов емкости.
Используя идентичные файлы и аппаратное обеспечение, оптимизированный пресет обслуживания Baseten обеспечил примерно в 1,35 раза более высокую пропускную способность пакетной обработки по сравнению с эталонной установкой NVIDIA, использовавшейся в наших тестах. По соединению HTTP один GPU может непрерывно обрабатывать 200 шестиминутных аудиофайлов каждую минуту, поддерживая стабильное время отклика.
Для живой транскрипции потоковые и пакетные настройки обеспечивают практически одинаковую точность, успешно воссоздавая стенограммы с тегами спикеров напрямую из модели распознавания речи.
Разверните Nemotron 3 Diarization уже сегодня
Nemotron 3 Diarization доступна на Hugging Face и в библиотеке моделей Baseten в виде пресетов пакетной, потоковой и диаризованной транскрипции в реальном времени. Разверните ее в пару кликов, выберите профиль задержки для каждого запроса и объедините ее с уже используемой вами системой распознавания речи (ASR) — или проконсультируйтесь с нашими инженерами о том, как мы можем оптимизировать вашу голосовую рабочую нагрузку.











