HeyGen Voice против Qwen-Audio-3.0-TTS: за что вы платите в Elo и какую версию Qwen вы на самом деле тестировали

Источник: OrcaRouter•

HeyGen Voice против Qwen-Audio-3.0-TTS: за что вы платите в Elo и какую версию Qwen вы на самом деле тестировали

HeyGen Voice набирает 1202 балла при цене $30 за 1 млн символов; Qwen-Audio-3.0-TTS-Plus набирает 1123 балла при заявленной цене $19,30. Выбор версии Qwen имеет значение.

Сначала давайте посчитаем, потому что ситуация не такая однозначная, как кажется на первый взгляд. Qwen-Audio-3.0-TTS-Plus стоит $19,30 за миллион символов на платформе Model Studio — это тариф, который публикует сам вендор. HeyGen Voice оценивается в $30,00 за миллион символов согласно собственной ценовой таблице Artificial Analysis; эта цифра получена сайтом на основе стоимости кредитов HeyGen, поскольку на официальной странице цен HeyGen продаются кредиты без указания того, сколько их расходуется на генерацию голоса. Тем временем разрыв в Elo между ними при контролируемом тестировании голоса составляет 79 баллов: HeyGen Voice набрал 1202 балла на арене, где все восемь эталонных голосов остаются неизменными, а Qwen-Audio-3.0-TTS-Plus — 1123 балла. Таким образом, более дешевая модель значительно отстает от более качественной, соотношение между ними составляет примерно 1,55x, и только одна из этих двух цен — это цифра, под которой подписался продающий её вендор.

Ловушка в названии

Прежде всего, правильно выбирайте версию, потому что это семейство моделей, которое с радостью позволит вам протестировать не ту модель. Здесь важны два продукта Alibaba, и они не взаимозаменяемы.

Qwen-Audio-3.0-TTS-Plus — это модель, с которой сравнивается данная статья. Она набирает 1123 балла в контролируемом тесте — седьмое место из сорока двух — и 1264 балла в таблице Provider Voices, где она занимает шестое место из девяноста шести. Это реальный, актуальный продукт для потокового TTS с опубликованным тарифом $19,30 за миллион символов.

Qwen-Audio-3.1-TTS-Plus — это следующая версия, которая занимает второе место в контролируемом тесте с результатом 1186 баллов; именно эта модель была ближе всего к тому, чтобы обойти HeyGen Voice при дебюте. Её тариф указан на том же уровне $19,30, хотя документация Alibaba предупреждает, что разные версии моделей требуют соответствующих голосов, поэтому «та же цена, более новая версия» не означает «полную совместимость».

Любой, кто прочитает «№1 опережает Qwen» и затем протестирует Qwen-Audio-3.0-TTS, будет проверять модель, которая на 63 балла Elo слабее той, о которой шла речь в заголовке. Эта путаница с версиями стоит 63 балла, что больше, чем разрыв между HeyGen Voice и третьим местом.

Таблица результатов

• Elo контролируемого голоса (те же 8 клонированных голосов) — HeyGen Voice: 1202, №1 из 42. Qwen-Audio-3.0-TTS-Plus: 1123, №7.

• Elo голосов провайдера (родные голоса) — Qwen-Audio-3.0-TTS-Plus: 1264, №6 из 96. HeyGen Voice: не ранжирован.

• Цена за 1 млн символов — Qwen-Audio-3.0-TTS-Plus: $19,30, опубликовано вендором на Alibaba Cloud. HeyGen Voice: $30,00 согласно конвертации кредитов самой ареной; HeyGen не публикует тариф на голос.

• Стоимость 100 часов озвучки — Qwen-Audio-3.0-TTS-Plus: примерно $926 при ~480 000 символов в час речи. HeyGen Voice: примерно $1440 по конвертации арены в $30,00 — это расчетная, а не официальная цена.

• Управление голосом — Qwen-Audio-3.0-TTS-Plus: параметр инструкций, теги эмоций и языка, клонирование голоса и дизайн голоса. HeyGen Voice: создание голоса из текста по описанию до 1000 символов, мгновенное клонирование, профессиональное клонирование на основе 20+ минут записи.

• Вывод — Qwen-Audio-3.0-TTS-Plus: PCM, WAV, MP3 и Opus до 48 кГц с регулируемой скоростью, высотой тона, громкостью и битрейтом. HeyGen Voice: скорость 0,5–1,5 и высота тона ±50 полутонов на запрос.

Что на самом деле дает инженерия Alibaba

Семейство Qwen-Audio-3.0-TTS — это потоковый продукт, и документация составлена соответствующим образом. Запросы передаются по протоколу WebSocket, общему с CosyVoice, с потоком событий run-task, continue-task и finish-task, а также ответами task-started, result-generated, task-finished и task-failed. Отмена поддерживается для каждой модели Qwen-Audio-TTS в регионах Пекин и Сингапур через streaming_cancel(). Вывод достигает 48 кГц, а форматы включают Opus, что важно, если вы передаете аудио в браузер или телефонный вызов, а не в файл WAV.

Две детали в этой документации легко упустить, но дорого обнаружить слишком поздно. Теги эмоций и расширенные языковые теги применяются только к версиям Plus и Flash — а не ко всему семейству — и работают только в режиме однонаправленной потоковой передачи. Кроме того, ключи API различаются для регионов Сингапур и Пекин, а рабочие области адресуются по URL вида wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference. Региональные ключи — это деталь настройки до того дня, пока они не станут причиной сбоя.

Сторона HeyGen — это продукт другого типа: API в стиле REST v3, где POST /v3/voices/speech генерирует речь, GET /v3/voices выводит каталог с фильтром движка, а дизайн голоса возвращает до трех ранжированных вариантов на основе текстовой подсказки с начальным числом (seed) для воспроизводимости. Документация также показывает, что фильтр движка принимает значения за пределами собственных решений HeyGen — так что HeyGen с радостью направит вас к стороннему голосовому движку через свой API. Вендор, который поставляет модель конкурента в качестве выбираемой опции, дает вам понять, в чем он видит свою собственную силу.

Куда уходят 79 баллов Elo

Разрыв в 79 баллов на контролируемой доске существенен — он больше, чем 16-балльный отрыв, отделяющий HeyGen Voice от второго места, и примерно равен расстоянию между третьим и восьмым местом в этом списке. К тому же он измерен только по одной оси.

Контролируемая арена клонирует восемь голосов и оставляет их неизменными. Она ничего не говорит о поверхности управления на основе инструкций, которую предоставляет Qwen, ничего о 48 кГц Opus через отменяемый WebSocket и ничего о региональном развертывании. Это инженерные свойства, и именно поэтому команда, создающая контакт-центр на китайском языке, не перейдет на модель, которая набирает на 79 баллов больше на восьми английских эталонных голосах.

Что контролируемый результат действительно говорит, так это более узкая, но все еще полезная вещь: когда обоим движкам дают один и тот же клонированный голос, слушатели предпочли рендеринг HeyGen Voice. Если ваш продукт клонирует голоса, это ваша ось. Если ваш продукт выбирает голос из каталога и транслирует его в вызов, таблица провайдеров ближе к вашей реальности — и там HeyGen Voice вообще не имеет рейтинга, в то время как Qwen-Audio-3.0-TTS-Plus занимает шестое место из девяноста шести.

Аргумент о цене, если рассматривать его всерьез

При цене $19,30 за миллион символов Qwen-Audio-3.0-TTS-Plus стоит примерно вдвое меньше, чем тариф ElevenLabs в $40, и около 40% от цены Cartesia Sonic 3.6 в $49. Для объема в 100 часов озвучки — около 48 миллионов символов при типичной скорости речи — это составляет около $926. Тот же объем на Eleven v4 Turbo обошелся бы примерно в $1920, а на Sonic 3.6 — около $2352. HeyGen Voice, при цене арены в $30,00, обходится примерно в $1440: между дешевым уровнем и двумя лидерами рынка, ближе к середине, чем к вершине.

Этот расчет содержит оговорку, которая не требуется для других. $19.30 — это официальный тариф Alibaba. $30.00 — это конвертация системы кредитов от Artificial Analysis, которую HeyGen никогда не переводил в символы, поэтому это добросовестная оценка, а не котировка. Если реальное соотношение символов на кредит хуже, чем предполагает график, то преимущество в 79 Elo обходится дороже, чем подразумеваемые 1.55×; если лучше — то дешевле. Модель, цену которой приходится вычислять, — это модель, которую вы тестируете на ограниченном объеме трафика, а не та, которую вы делаете стандартом. Это не критика движка, а описание информации, доступной на 10 октября 2026 года.

Принятие решения

Выбирайте Qwen-Audio-3.0-TTS-Plus, если решение зависит от стоимости и инфраструктуры потоковой передачи. Цена менее $20 за миллион символов, отменяемый WebSocket с выводом Opus 48 кГц, параметр инструкций и теги эмоций, а также шестое место в рейтинге провайдеров делают его самым экономичным и высокооцененным голосом в этом сравнении. Выбирайте версию 3.1, если вам нужна модель, которая фактически заняла второе место в контролируемом тестировании, и обязательно проверьте список голосов, прежде чем предполагать, что замена будет бесплатной.

Тестируйте HeyGen Voice, если продукт требует высокой точности клонирования. Один диктор, множество реплик, голос, который должен звучать *именно так* каждый раз — это тот критерий, который измеряет контролируемый тест, и именно в нем он лидирует среди всех участников. Заложите бюджет на период измерений, потому что модель кредитов означает, что вы узнаете свою реальную стоимость, прогнав собственный текст, а не изучая прайс-лист.

И полностью игнорируйте сравнение, если ваша рабочая нагрузка связана с китайским языком и реальным временем. Ни один из показателей Elo не измерялся на ваших голосах, на вашем языке и при ваших требованиях к задержке.

Сохранение доступа к обоим вариантам

Это одна из тех пар, где уровень маршрутизации оправдывает свое существование, а не является просто дополнением. Единый API-ключ, охватывающий обоих поставщиков — с передачей официальной цены провайдера без наценок, так что вы платите $19.30, как у Alibaba, а изменение цены Qwen вступает в силу в тот же день — избавляет от необходимости выбирать победителя до получения доказательств. Автоматическое переключение при сбоях страхует от очевидного риска в голосовом конвейере, когда прерванный поток становится слышен слушателю, а DSL маршрутизации позволяет отправлять массовое повествование на дешевый движок, а критически важные для клонирования реплики — на тот, который набирает на 79 баллов больше, без необходимости использовать две клиентские библиотеки и иметь два договора на оплату. Ценность OrcaRouter здесь не в том, что он хостит голосовую модель, а в том, что он делает стоимость выяснения того, что именно вам нужно, практически нулевой.

Открытые вопросы

Три вещи могли бы прояснить ситуацию. Тариф на голос на собственной странице цен HeyGen превратил бы $30.00, полученные ареной, в число, которое можно проверить. Запись HeyGen в таблице Provider Voices показала бы нам, сохраняется ли лидерство клонированного голоса по сравнению с нативными голосами — тест, который Qwen-Audio-3.0-TTS-Plus проходит, занимая шестое место из девяноста шести. А результат контролируемого тестирования голоса для Qwen-Audio-3.1-TTS-Plus против HeyGen Voice после получения большего количества голосов показал бы, является ли разница в 16 Elo стабильным порядком. До тех пор: Qwen — это вариант с известной ценой, потоковой передачей и хорошим рейтингом; HeyGen Voice — это вариант с более высоким баллом, но непредсказуемой ценой; и уровень, который вы тестируете, важнее, чем заголовок, который вы прочитали.

О чём эта статья

Ещё в разделе «AI и машинное обучение»

Все →

Ещё от OrcaRouter