Пользователь диктует сообщение, и сырая транскрипция приходит ровно так, как было сказано: слова-паразиты, произнесенная пунктуация, поправка на полпути — «6 из 8 — ой нет, 5 из 8». Прежде чем слова появятся на экране, что-то должно превратить их в чистый форматированный текст. Это переписывание выполняется для каждого высказывания и во многом определяет задержку, которую ощущают пользователи.
Сегодня многие команды выполняют эту простую задачу на моделях, созданных для гораздо более сложных проблем. Крупные универсальные модели справляются с ней хорошо, но добавляют задержку и стоимость, которые этой задаче не нужны, — а небольшие открытые модели, подходящие для нее, трудно найти.
Именно поэтому сегодня мы добавляем модель Qwen3.5 4B на LLM Gateway: она размещена AssemblyAI на наших собственных GPU и обслуживается в конфигурации с оптимизированной задержкой и контекстом 32k.
Она создана именно для такой работы — очистки диктовки, переписывания транскриптов и других быстрых интерактивных голосовых функций, — и на этих задачах она показала среднее время 612 мс, что в 1,9 раза быстрее, чем GPT-4.1, при стоимости на 94% ниже за час аудио. Модель уже доступна в AssemblyAI API — протестируйте её на своих голосовых задачах, без необходимости вводить данные карты.
1,9× быстрее
Среднее время ответа по сравнению с GPT-4.1 на задачах переписывания голосовых данных
94% дешевле
Стоимость за час аудио по сравнению с GPT-4.1
$0.10 / $0.50
За миллион токенов (промпт / завершение), оптимизировано и размещено AssemblyAI
Правильная модель для переписывания голосовых данных
Ценность небольшой модели не видна на общем лидерборде, который усредняет результаты по задачам, для которых она никогда не создавалась. Она проявляется на конкретной задаче, для которой модель была построена. Модель qwen3.5-4b-32k-fast, размещенная AssemblyAI, специально создана для одного класса задач: быстрого переписывания голосовых данных.
- Очистка диктовки — удаление слов-паразитов, добавление пунктуации, разрешение самокоррекций
- Переписывание транскрипта — преобразование сырого вывода распознавания речи в электронные письма, заметки или сообщения
- Живое форматирование — применение правил форматирования к потоковому выводу, пока пользователь еще говорит
- Суммаризация реплики — сжатие реплики диалога в строку, с которой может работать следующая система
Фронтирные модели становятся все лучше, но не каждой задаче нужна такая модель. Для голосовых задач клиенты все чаще выбирают небольшие, быстрые и недорогие модели, а выбор небольшой модели означает четкое понимание компромисса: qwen3.5-4b-32k-fast поддерживает только max_tokens, temperature и stream.
Как выглядит переписывание
Продиктованное резюме, один проход переписывания
Сырой вывод распознавания речи
После Qwen3.5 4B
Привет, Марисса, краткое резюме по итогам обзора поставщиков за Q3. Мы прошли пять из восьми оценок. Последние три ждут одобрения службы безопасности. Главное — цены оказались выше, чем мы моделировали, примерно на 15%. Думаю, нам нужно пересмотреть статью бюджета, прежде чем мы на что-то согласимся. Не могла бы ты достать первоначальный прогноз? Я поставлю 30 минут в календарь.
622 мс · $0.00011
Обратите внимание, что сделало переписывание: убраны слова-паразиты, обе поправки в середине предложения приведены к конечному намерению говорящего — «6 из 8 — ой нет, 5 из 8» стало «пять из восьми», а «между 12 — нет, 15%» стало «15%» — и резюме переформатировано в чистые абзацы. Цифры в углу реальны: этот конкретный аудиофайл прошел через конвейер, описанный ниже, и переписывание вернулось за 622 мс при стоимости около одной сотой цента.
Как Qwen3.5 4B показывает себя в бенчмарках на задачах переписывания голосовых данных
Мы проводим бенчмарки каждой модели на нашем LLM Gateway на той задаче, для которой она создана, и для qwen3.5-4b-32k-fast этой задачей является переписывание голосовых данных. Очистка диктовки, переписывание транскриптов, форматирование и суммаризация реплик измеряются на репрезентативных голосовых данных, а не на универсальных бенчмарк-промптах.
Для создания функций диктовки
Если вы создаете диктовку — голосовой ввод, продиктованные заметки и сообщения, голосовые команды, превращающиеся в чистый текст, — рекомендуемый нами паттерн — это цикл из двух шагов: наш Sync API для быстрого преобразования аудио в сырые слова с флагманской точностью — 1,59% ошибок на коротких аудиофрагментах при медиане около 134 мс, — а затем проход переписывания для превращения сырых слов в чистый форматированный текст с помощью qwen3.5-4b-32k-fast.
Вот весь конвейер — тот же двухшаговый цикл, который мы используем сами, — примерно в 30 строках. Один API-ключ покрывает оба вызова. На входе речь, на выходе чистый форматированный текст.
Запрос
Для живого форматирования передавайте переписывание в потоковом режиме и отображайте токены по мере их поступления:
Потоковый запрос
Для создания голосовых агентов
Голосовые агенты предъявляют к своей модели другие требования: вызов инструментов, многошаговые рассуждения и точность в рамках бюджета задержки живого разговора. Поскольку Qwen3.5 4B не поддерживает вызов инструментов, она здесь не подходит. Для задач агентов мы рекомендуем qwen3-next-80b-a3b, которая сильна в другом измерении: точность на задачах агентов по сравнению с проприетарными моделями среднего уровня при доле их стоимости.
Использование аналогично Qwen3.5 4B: укажите вашему chat-completions клиенту адрес llm-gateway.assemblyai.com и задайте модель qwen3-next-80b-a3b. Вызов инструментов и полный цикл агента работают через стандартный OpenAI-совместимый интерфейс, поэтому существующие фреймворки агентов подключаются без специальной настройки.
Цены и бесплатные кредиты
Использование LLM Gateway списывает ваши кредиты по прейскурантной цене каждой модели, поэтому этих кредитов хватает надолго на модели 4B: при цене $0,10/$0,50 за миллион токенов очистка диктовки стоит долю цента.
LLM Gateway — это уровень инференса для Voice AI, и семейство Qwen находится рядом с фронтирными моделями, от которых уже зависит ваш продукт: Claude, GPT и Gemini доступны через тот же эндпоинт и тот же API-ключ. Быстрые открытые модели для высоконагруженного пути переписывания, фронтирные модели для пути рассуждений, одна интеграция для обоих. Полный список моделей и цены находятся в открытом доступе, авторизация не требуется.
Начните работу
Создайте бесплатный аккаунт, получите свой API-ключ, и в кратком руководстве LLM Gateway по умолчанию используется qwen3.5-4b-32k-fast — ваше первое переписывание в одной curl-команде. Если вы предпочитаете начать без написания кода, вы можете протестировать распознавание речи и переписывание вместе на своем аудио в Playground.
Часто задаваемые вопросы
Это открытая модель Qwen3.5 4B, работающая как развертывание, размещенное AssemblyAI на наших собственных GPU, в конфигурации с оптимизированной задержкой и контекстным окном на 32k токенов. Мы создали это развертывание для выполнения шага переписывания в нашем собственном конвейере диктовки, и оно доступно всем разработчикам через LLM Gateway.
Новые аккаунты получают бесплатные кредиты без необходимости вводить данные карты, и использование списывает эти кредиты по прейскурантной цене модели: $0,10 за миллион промпт-токенов и $0,50 за миллион токенов завершения. Это бесплатные кредиты, а не бесплатная модель, но при ценах на 4B этих кредитов хватит на серьезный объем тестирования.
Она лучше всего подходит для работы по переписыванию голосовых данных: очистка диктовки, переписывание транскриптов, форматирование и суммаризация реплик. Она не подходит для агентов или структурированного извлечения — модель поддерживает только max_tokens, temperature и stream, без вызова инструментов и структурированного вывода. Для задач агентов мы рекомендуем qwen3-next-80b-a3b или фронтирную модель на LLM Gateway.
Нет. «Оптимизировано и размещено AssemblyAI» относится к развертыванию: мы самостоятельно размещаем модель с открытым исходным кодом на нашей собственной GPU-инфраструктуре в конфигурации обслуживания, оптимизированной для быстрых голосовых AI-нагрузок. Веса модели — это релиз Qwen3.5 4B с открытым исходным кодом.
Они показывают пиковые результаты в разных задачах. Qwen3.5 4B (qwen3.5-4b-32k-fast) — выбор по скорости и стоимости для задач переписывания и не поддерживает вызов инструментов. Qwen 80B (qwen3-next-80b-a3b) — выбор для агентов: он набрал 0,800 в бенчмарке tau2 retail agent, опередив Claude Haiku 4.5 (0,733) и GPT-4.1 (0,700), при цене $0,15/$1,20 за миллион токенов.
Да. LLM Gateway — это единая конечная точка, совместимая с OpenAI, для передовых и открытых моделей: Claude, GPT и Gemini остаются полностью доступными с тем же API-ключом, который вы используете для моделей Qwen и для распознавания речи. Полный список см. в справочнике доступных моделей в нашей документации.
Методология
Мы транскрибировали надиктованные аудиофрагменты (35–66 секунд) с помощью асинхронного распознавания речи universal-3-5-pro от AssemblyAI, затем пропустили каждую транскрипцию через каждую модель-кандидата на AssemblyAI LLM Gateway с использованием одинакового промпта для очистки, выполняя нестриминговые последовательные вызовы и фиксируя задержку по реальному времени и количество токенов, возвращенных в каждом ответе. Назад к бенчмаркам












