Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Predstavlyaem qwen35 4b v llm gateway optimizirovano assemblyai dlya reraytinga
Представляем Qwen3.5 4B в LLM Gateway — оптимизировано AssemblyAI для рерайтинга голосовых данных

Источник: AssemblyAI

Представляем Qwen3.5 4B в LLM Gateway — оптимизировано AssemblyAI для рерайтинга голосовых данных

Источник: AssemblyAI

qwen3.5-4b-32k-fast, быстрая открытая модель, оптимизированная и размещенная на собственном хостинге AssemblyAI для рабочих нагрузок голосового ИИ, теперь доступна в LLM Gateway. Протестируйте очистку диктовки и рерайтинг транскриптов с помощью бесплатных кредитов — данные кредитной карты не требуются.

25 сентября 2026 г.

Пользователь надиктовывает сообщение, и «сырой» транскрипт поступает точно так, как было произнесено: слова-паразиты, произнесенная вслух пунктуация, исправление на ходу — «6 из 8 — о нет, 5 из 8». Прежде чем слова появятся на экране, нечто должно превратить их в чистый, отформатированный текст. Этот рерайтинг выполняется при каждом высказывании и вносит большой вклад в задержку, воспринимаемую пользователями.

Сегодня многие команды выполняют эту простую задачу на моделях, созданных для гораздо более сложных проблем. Крупные универсальные модели справляются с ней хорошо, но добавляют ненужные задаче задержки и стоимость, в то время как подходящие для нее небольшие открытые модели трудно найти.

Именно поэтому сегодня мы добавляем модель Qwen3.5 4B в LLM Gateway: она хостится AssemblyAI на наших собственных графических процессорах и предоставляется в конфигурации с оптимизированной задержкой и контекстом 32k.

Она создана ровно для этой работы — очистки диктовки, рерайтинга транскриптов и других быстрых интерактивных голосовых функций. В этих задачах она показала среднее время ответа в 612 мс, что в 1,9 раза быстрее, чем GPT-4.1, при снижении стоимости часа аудио на 94%. Модель уже доступна в API AssemblyAI — протестируйте ее на собственных голосовых задачах, кредитная карта не требуется.

в 1,9 раза быстрее

Среднее время ответа по сравнению с GPT-4.1 в задачах рерайтинга голоса

на 94% дешевле

Стоимость часа аудио по сравнению с GPT-4.1

$0.10 / $0.50

За миллион токенов (запрос / ответ), оптимизировано и размещено AssemblyAI

Правильная модель для рерайтинга голоса

Ценность небольшой модели не отображается в общих таблицах лидеров, которые усредняют показатели по задачам, для которых она никогда не проектировалась. Она проявляется в конкретной задаче, для которой модель была создана. Модель qwen3.5-4b-32k-fast на хостинге AssemblyAI специально разработана для одного класса задач: быстрого рерайтинга голосовых данных.

  • Очистка диктовки — удаление слов-паразитов, добавление пунктуации, разрешение самоисправлений
  • Рерайтинг транскрипта — преобразование «сырого» вывода распознавания речи в электронные письма, заметки или сообщения
  • Живое форматирование — применение правил форматирования к потоковому выводу, пока пользователь все еще говорит
  • Суммаризация реплик — сжатие разговорной реплики в строку, с которой может работать следующая система

Передовые модели продолжают улучшаться, но не каждая задача требует их применения. Для голосовых задач клиенты все чаще выбирают небольшие, быстрые и недорогие модели. Выбор небольшой модели означает четкое понимание компромисса: qwen3.5-4b-32k-fast поддерживает только max_tokens, temperature и stream.

Как выглядит рерайтинг

Надиктованный дайджест, один проход рерайтинга

«Сырой» вывод распознавания речи

После Qwen3.5 4B

Привет, Марисса! Краткий итог по тому, к чему мы пришли с обзором поставщиков за Q3. Мы прошли пять из восьми оценок. Последние три ждут согласования по безопасности. Самое главное — цены оказались выше, чем мы моделировали, примерно на 15%. Я думаю, нам нужно пересмотреть строку бюджета, прежде чем на что-то подписываться. Можешь поднять для меня исходный прогноз? Я поставлю встречу на 30 минут в календаре.

622 мс · $0.00011

Обратите внимание на то, с чем справился рерайтинг: слова-паразиты удалены, оба исправления в середине предложений разрешены в соответствие с конечным намерением спикера — «6 из 8 — о нет, 5 из 8» превратилось в «пять из восьми», а «между 12 — нет, 15%» превратилось в «15%», а дайджест был переформатирован в аккуратные абзацы. Цифры в углу реальны: это самое аудио прошло через указанный ниже конвейер, и рерайтинг вернулся за 622 мс при стоимости около сотой доли цента.

Результаты бенчмарков Qwen3.5 4B в задачах голосового рерайтинга

Мы тестируем каждую модель в нашем LLM Gateway на той задаче, для которой она создана, и для qwen3.5-4b-32k-fast этой задачей является рерайтинг голоса. Очистка диктовки, рерайтинг транскрипта, форматирование и суммаризация реплик измеряются на репрезентативных голосовых данных, а не на общецелевых тестовых запросах.

Для создания функций диктовки

Если вы создаете функцию диктовки — голосовой ввод, надиктованные заметки и сообщения, голосовые команды, превращающиеся в чистый текст, — мы рекомендуем следующий двухшаговый цикл: наш Sync API для быстрого преобразования аудио в «сырые» слова с максимальной точностью (частота ошибок в словах 1,59% на коротких аудио при медианном времени ~134 мс), а затем проход рерайтинга для превращения «сырых» слов в чистый, отформатированный текст с помощью qwen3.5-4b-32k-fast.

Вот весь конвейер — тот же двухшаговый цикл, который мы используем сами — примерно в 30 строках кода. Один ключ API покрывает оба вызова. На входе — речь, на выходе — чистый отформатированный текст.

Запрос

Для живого форматирования запускайте рерайтинг в режиме стриминга и отрисовывайте токены по мере их поступления:

Потоковый запрос

Для создания голосовых агентов

Голосовые агенты предъявляют к своей модели иные требования: вызов функций (tool calling), многошаговые рассуждения и точность в рамках ограничений задержки живого разговора. Поскольку Qwen3.5 4B не поддерживает вызов функций, он здесь не подходит. Для рабочих нагрузок агентов мы рекомендуем qwen3-next-80b-a3b, которая сильна в другом измерении: точность в агентских задачах по сравнению с проприетарными моделями среднего уровня за долю их стоимости.

Использование модели представляет собой ту же интеграцию, что и для Qwen3.5 4B: укажите ваш клиент chat-completions на llm-gateway.assemblyai.com и установите модель qwen3-next-80b-a3b. Вызов функций и полный цикл агента работают через стандартный интерфейс, совместимый с OpenAI, поэтому существующие фреймворки агентов подключаются без специальной обработки.

Цены и бесплатные кредиты

Использование LLM Gateway списывает кредиты по прейскурантной цене каждой модели, поэтому эти кредиты расходуются очень экономно на модели с 4 млрд параметров: при цене $0.10 / $0.50 за миллион токенов очистка диктовки стоит доли цента.

LLM Gateway — это уровень инференса для голосового ИИ, а семейство Qwen соседствует с передовыми моделями, от которых уже зависит ваш продукт: Claude, GPT и Gemini доступны через ту же конечную точку и тот же ключ API. Быстрые открытые модели для высоконагруженных задач рерайтинга, передовые модели для задач рассуждения, одна интеграция для обоих случаев. Полный список моделей и цены находятся в открытом доступе, авторизация не требуется.

Начало работы

Создайте бесплатную учетную запись, получите ключ API, и в быстром старте LLM Gateway по умолчанию будет выбрана модель qwen3.5-4b-32k-fast — ваш первый рерайтинг находится на расстоянии одной команды curl. Если вы предпочитаете начать без написания кода, вы можете протестировать распознавание речи и рерайтинг вместе на собственном аудио в Playground.

Часто задаваемые вопросы

Это модель с открытым исходным кодом Qwen3.5 4B, работающая в виде развертывания от AssemblyAI на наших собственных графических процессорах, в конфигурации с оптимизированной задержкой и окном контекста 32k токенов. Мы создали это развертывание для выполнения этапа рерайтинга в нашем собственном конвейере диктовки, и оно доступно всем разработчикам через LLM Gateway.

Новые учетные записи получают бесплатные кредиты без необходимости привязывать кредитную карту, и использование расходует эти кредиты по прейскурантной цене модели: $0.10 за миллион токенов промпта и $0.50 за миллион токенов ответа. Это бесплатные кредиты, а не бесплатная модель, но при ценообразовании для модели в 4B эти кредиты покрывают серьезный объем тестирования.

Она лучше всего подходит для задач рерайтинга голосовых данных: очистки диктовки, рерайтинга транскриптов, форматирования и суммаризации реплик. Она не предназначена для агентов или структурированного извлечения данных — модель поддерживает только max_tokens, temperature и stream, без вызова функций и структурированного вывода. Для агентских рабочих нагрузок мы рекомендуем qwen3-next-80b-a3b или передовую модель в LLM Gateway.

Нет. «Оптимизировано и размещено на AssemblyAI» относится к развертыванию: мы самостоятельно размещаем модель с открытым исходным кодом на собственной GPU-инфраструктуре в конфигурации обслуживания, оптимизированной для быстрых рабочих нагрузок голосового ИИ. Веса модели соответствуют релизу с открытым исходным кодом Qwen3.5 4B.

Они показывают пиковые результаты на разных задачах. Qwen3.5 4B (qwen3.5-4b-32k-fast) — это выбор для задач переписывания по критериям скорости и стоимости, который не поддерживает вызов инструментов. Qwen 80B (qwen3-next-80b-a3b) — это выбор для агентов: он набрал 0,800 в бенчмарке ритейл-агентов tau2, опередив Claude Haiku 4.5 (0,733) и GPT-4.1 (0,700), при стоимости $0,15 / $1,20 за миллион токенов.

Да. LLM Gateway представляет собой единую конечную точку, совместимую с OpenAI, как для передовых, так и для открытых моделей — Claude, GPT и Gemini остаются полностью доступными с тем же ключом API, который вы используете для моделей Qwen и распознавания речи. Полный список доступных моделей см. в справочнике в нашей документации.

Методология

1 Мы расшифровали надиктованные аудиофрагменты (35–66 секунд) с помощью универсальной асинхронной системы распознавания речи universal-3-5-pro от AssemblyAI, затем пропустили каждую расшифровку через каждую модель-кандидат на AssemblyAI LLM Gateway, используя идентичный промпт для очистки, выполняя не потоковые последовательные вызовы и регистрируя реальную задержку (wall-clock latency) и количество токенов, возвращенных в каждом ответе. Вернуться к бенчмаркам

← Все статьи
Dev48

© 2026 · All rights reserved.