TLDR 👉 новый рейтинг TTS, ориентированный на открытый исходный код и многоязычность
Темпы выпуска моделей синтеза речи (TTS) с открытым исходным кодом потрясают воображение. На Hugging Face Hub (по состоянию на 30 сентября 2026 г.) доступно более 8 тыс. моделей TTS 🚀
Однако оценка не поспевает за этим: она остается фрагментированной и не стандартизированной. Золотым стандартом являются оценки человеческих предпочтений, такие как MOS или MUSHRA (подробнее об этом на metrics). С этой целью несколько рейтингов на основе арен зарекомендовали себя как полезные ориентиры для сообщества:
- TTS Arena v2
- Artificial Analysis
- Voice Arena
Эти арены сравнивают модели, предлагая пользователям результаты TTS от двух моделей и прося выбрать одну из них. После сбора достаточного количества голосов для ранжирования моделей вычисляется оценка Elo, обычно с помощью модели Брэдли — Терри (см. методологию Voice Arena).
Хотя человеческие предпочтения являются решающим фактором, арены не могут масштабироваться так, чтобы успевать за темпами выхода TTS. Отчасти это может объяснять, почему модели с открытым исходным кодом представлены на рейтингах арена-стиля недостаточно: по состоянию на 30 сентября 2026 г. только 16 из 92 моделей на Artificial Analysis имеют открытые веса, аналогичный перекос наблюдается и в Voice Arena. Вероятно, это отражает практические факторы: для добавления API-модели требуется лишь ключ API, в то время как открытую модель должен разместить и обслуживать оператор арены, а у коммерческих провайдеров больше причин добиваться своего размещения, чем у авторов с открытым исходным кодом. Еще одним ограничением оценки на основе арен является постоянство голосующих: ни одна арена не может гарантировать, что одни и те же голосующие с теми же критериями «лучшего» смогут последовательно оценивать модели с течением времени. Даже предпочтения одного человека со временем меняются («Нельзя войти в одну реку дважды», как гласит известное изречение Гераклита).
С этой целью мы создали Open TTS Leaderboard, в котором используются объективные метрики для оценки моделей по взаимодополняющим аспектам производительности:
- Понятность: частота ошибок по словам/символам (WER и CER) между подсказкой и расшифровкой сгенерированного аудио с использованием Qwen3 ASR (лучшая модель с открытым исходным кодом в рейтинге Open ASR Leaderboard).
- Скорость: обратный коэффициент реального времени (RTFx) для пакетного автономного вывода на GPU H200 и время до первого аудио (TTFA) для измерения задержки потоковой передачи при размере батча 1 на GPU H200 и CPU.
- Сходство голосов путем вычисления косинусного сходства (SIM) между эмбеддингами спикера WavLM сгенерированного аудио и эталонного клипа.
Благодаря опоре на объективные метрики время оценки модели сокращается с пары недель (на сбор голосов) до пары часов ⚡
Важно отметить, что Open TTS Leaderboard не заменяет ранжирование по человеческим предпочтениям. WER на основе ASR служит прокси-оценкой понятности, а сходство голосов оценивает сохранение идентичности голоса. Ни то, ни другое напрямую не измеряет естественность, выразительность или предпочтения слушателя. Тем не менее они могут подсказать рейтингам на основе голосования, какие модели следует включить в их оценки.
Мы задумываемся этот рейтинг так, чтобы он формировался сообществом; мы хотим услышать ваши отзывы, чтобы оценки оставались актуальными и информативными. В следующих нескольких разделах приводится обзор основных функций Open TTS Leaderboard.
Многоязычная оценка и оценка клонирования голоса
В представлении рейтинга по умолчанию модели ранжируются по макросреднему WER на английских сплитах Seed TTS Eval (статья) и CV3 Eval (zero shot) (статья).
hexgrad/Kokoro-82M, Supertone/supertonic-3 и fishaudio/s2-pro лидируют по показателю WER для английского языка при усреднении по этим двум сплитам, в то время как графики Парето визуализируют, какие модели обеспечивают хороший баланс между WER, пакетным выводом (RTFx) и размером.
Производительность на английском языке необязательно переносится на другие языки. Можно переключать несколько языков для ранжирования моделей по многоязычной производительности. Seed TTS Eval содержит аудио только для английского и китайского языков, поэтому для других языков используются просто оценки на CV3 Eval (zero shot). Обратите внимание, что китайский, японский и корейский языки являются иероглифическими, поэтому для них указывается частота ошибок по символам (CER), а «Средний WER» по языкам представляет собой макросреднее значение по языкам.
k2-fsa/OmniVoice, fishaudio/s2-pro и FunAudioLLM/Fun-CosyVoice3-0.5B-2512 являются мощными многоязычными моделями.
Переключив параметр «Voice cloning», можно сравнить модели, поддерживающие эту функциональность (на выбранных языках).
Более того, в таблице теперь появляется столбец SIM для сходства голосов, а также еще два графика Парето для визуализации компромисса между SIM, пакетным выводом и размером.
Средний WER некоторых моделей, таких как bosonai/higgs-tts-3-4b и openbmb/VoxCPM2, улучшается при клонировании голоса, а именно при предоставлении эталонного аудио.
Сравнение результатов TTS и голосование
Цифры отражают лишь часть картины, и, как упоминалось ранее, решающим фактором являются человеческие предпочтения. На вкладке «Listen» вы можете сравнить сгенерированные результаты, стоящие за метриками, чтобы найти модель или модели, которые вам нравятся больше всего!
Выберите интересующий вас язык/набор данных, укажите, нужно ли сравнивать клонирование голоса, и при желании выберите модели или прослушайте результаты из случайной выборки.
Вкладка «Listen» заполняет важный пробел в существующих рейтингах TTS: это пространство для изучения результатов работы различных моделей.
Вы даже можете оставить отзыв о сгенерированных результатах. По мере сбора новых голосов сообщества мы можем включить эти данные в рейтинг. Так что голосуйте! Но, пожалуйста, войдите в свою учетную запись HF, чтобы помочь нам отфильтровать спам и ботов.
Потоковая производительность
На вкладке «Streaming» сравниваются возможности потоковой передачи. Модели ранжируются по TTFA (времени до первого аудио), которое определяет, сколько времени пользователь ждет после запроса к модели, чтобы получить воспроизводимый звук. Это важно для голосовых ассистентов и других интерактивных приложений.
Для потоковых моделей (значок ✅ в поле «Streaming API») это время до прибытия первого аудиофрагмента. Для непотоковых моделей это время до генерации всего высказывания, так как воспроизведение не может начаться раньше. Каждая модель обрабатывает по одному аудио за раз (размер батча 1) на одних и тех же 50 английских подсказках из CV3-Eval, на том же оборудовании и с голосом по умолчанию. Мы отбрасываем первые 3 запуска в качестве «прогрева» и сообщаем медианное значение TTFA по остальным.
Вид по умолчанию сравнивает производительность на GPU H200. Результаты также доступны для CPU для небольшого (но растущего) набора моделей!
kyutai/pocket-tts — отличная модель для потоковой передачи как на GPU, так и на CPU!
Заключение
Цель Open TTS Leaderboard состоит не только в том, чтобы не отставать от невероятных темпов выхода моделей TTS, но и в том, чтобы развиваться под влиянием сообщества; мы хотим услышать ваши отзывы, чтобы оценки оставались актуальными и информативными. Дайте нам знать, какие наборы данных, модели и метрики вы хотели бы увидеть!
На данный момент мы сосредоточились на следующих аспектах:
- Модели с открытым исходным кодом, чтобы продвинуть множество замечательных моделей, которые были обделены вниманием в оценках арена-стиля.
- Многоязычность, поскольку производительность на английском языке не является подходящим прокси для других языков.
Скоро мы откроем исходный код скриптов оценки, во многом похожий на Open ASR Leaderboard repo, чтобы вы могли напрямую оставлять свои отзывы и предложения через GitHub Issues и PR! Давайте формировать будущее оценки систем синтеза речи (TTS) вместе 🤗










