Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Predstavlyaem dictation api pervyy api sozdannyy spetsialno dlya diktovki
Представляем Dictation API: первый API, созданный специально для диктовки

Источник: AssemblyAI

Представляем Dictation API: первый API, созданный специально для диктовки

Источник: AssemblyAI

Голосовой ввод для любого приложения. Ваши пользователи говорят, а Dictation API возвращает готовый к отправке текст: без слов-паразитов, с исправленными самоисправлениями и правильно написанными именами. Быстро, точно и на 19 языках.

25 сентября 2026 г.

Пользователь надиктовывает сообщение в ваше приложение и отправляет его вместе со всеми «эм». Другой меняет свое мнение на середине предложения, и в тексте остаются обе половины. Третий видит, как имя коллеги пишется тремя разными способами в трех разных сообщениях. Ни одно из этого не является крайним случаем. Это происходит потому, что модели транскрипции по своей природе дословны: они фиксируют то, что было сказано, полностью и точно, но сказанное — это вовсе не то, что кто-либо хочет отправить.

Вот трехсекундный фрагмент аудио, обработанный через модель транскрипции и через Dictation API:

Транскрипция

эм так может мы ээ перенесем вст встреча на четверг я думаю в пятницу лучше на самом деле

Dictation API

Можем перенести встречу на пятницу? Так будет лучше.

Сегодня мы выпускаем Dictation API — наш первый API, созданный специально для диктовки. Он принимает одно речевое высказывание и возвращает текст, готовый к отправке в то поле ввода, с которым работает ваш пользователь. Самоисправления сводятся к тому, на чем остановился говорящий. Слова-паразиты удаляются, а тон сохраняется. Имена и термины, важные для вашего пользователя, возвращаются в том написании, которое он использует. А когда вашему приложению требуется текст в определенном формате, вы указываете это в запросе, и результат приходит именно в таком виде. Он работает на Universal-3.5 Pro, нашей флагманской модели распознавания речи, поддерживает 19 языков и стоит $0,62 в час.

Результат, который ваши пользователи могут отправить без предварительного редактирования

Большинство команд, создающих функции диктовки сегодня, начинают с готовой стенограммы и пытаются самостоятельно сгладить шероховатости. Эта задача сложнее, чем кажется. Понимание того, что «во вторник, нет погодите, в среду» означает «в среду», требует понимания намерений говорящего, как и понимание того, что заминка в середине предложения должна исчезнуть, в то время как формулировка человека сохраняется. Dictation API выполняет эту работу в рамках одного запроса:

  • Проверить контракт
  • Написать юристам
  • Забронировать выездное мероприятие

Первые две строки обрабатываются по умолчанию. Третья — это то, что команды недооценивают: имя, с которым модель никогда не сталкивалась, — самая заметная ошибка при диктовке, потому что пользователь всегда замечает ее и часто не может исправить быстрее, чем перепечатать все сообщение. Передайте слова, важные для вашего пользователя, в параметре keyterms_prompt, и распознавание будет смещено в сторону их правильного написания. Коллеги, клиенты, названия продуктов, внутренний жаргон — слова, которые универсальная модель неизменно коверкает.

Universal-3.5 Pro демонстрирует высокую точность «из коробки», а контекстные подсказки — это способ улучшить результаты в тех случаях, когда это необходимо. Dictation API полностью наследует эту возможность. Передайте модели описание того, что она сейчас услышит, в параметре stt_prompt (ваше приложение, ваш домен, особенности речи ваших пользователей), и она использует его для направления процесса транскрипции. В этом и заключается разница между стенограммой, которая в целом верна, и стенограммой, которая точно отражает словарный запас вашего пользователя.

Четвертая строка — это то, что вы задаете самостоятельно. Диктовка сообщения в Slack и диктовка клинической заметки требуют разного текста из одного и того же предложения, и параметр llm_instruction позволяет провести эту границу:

Если оставить его пустым, вы получите очистку по умолчанию. В любом случае рядом с ним возвращается дословная стенограмма в поле text, так что у вас всегда есть оба варианта.

Меньше секунды от отпускания клавиши до готового текста

Dictation API

0.36с

0 0.5с 1с

Типичные короткие фрагменты возвращаются менее чем за секунду. Вам не нужно верить этому на слово: каждый ответ содержит поле request_time_ms, поэтому задержку, которую вы видите в продакшене, вы можете логировать начиная с самого первого запроса.

Вы также можете начать запрос до того, как пользователь закончил говорить. API принимает аудио фрагментами по мере их записи, при этом конфигурация должна поступать первой, поэтому к моменту, когда пользователь отпускает клавишу, большая часть его высказывания уже загружена.

Запросы ограничены пятью секундами. По истечении этого лимита API возвращает статус 200 с дословным текстом и ошибкой llm_error: "timeout" вместо ошибки, с которой должен справляться ваш клиент, а это значит, что в худшем случае пользователь увидит более простой текст, чем обычно. Это совсем не то же самое, что смотреть на индикатор загрузки и потерять мысль, которую они диктовали.

Создано на базе Universal-3.5 Pro, потому что неверное слово невозможно исправить

Неправильно расслышанное название лекарства, исковерканное название продукта или неверная цифра в адресе переживают любые последующие улучшения и отправляются прямо в сообщении вашего пользователя. Форматирование поддается исправлению. Ошибки транскрипции — нет.

Именно поэтому Dictation API работает на базе Universal-3.5 Pro — той же флагманской модели, которая используется в наших асинхронных, реалтайм и синхронных интерфейсах. Она занимает первое место по точности в независимых бенчмарках и демонстрирует средний нормализованный коэффициент ошибок в словах (WER) на уровне 3,87% на коротких аудиозаписях, что соответствует реальному профилю аудио для диктовки.

AssemblyAI Universal-3.5 Pro Realtime

3.87%

Speechmatics Enhanced Realtime

4.69%

Smallest Pulse

5.41%

Azure Realtime STT

5.54%

xAI Grok Streaming

5.81%

Speechmatics Standard Realtime

6.41%

Deepgram Flux EN

6.53%

Mistral Voxtral Mini Realtime

6.61%

Deepgram Nova-3

7.46%

19 языков из коробки

Ваши пользователи говорят не только по-английски, и именно они первыми откажутся от функции диктовки, которая работает наполовину. Dictation API распознает 19 языков — тот же набор, который поддерживается Universal-3.5 Pro. Передайте поддерживаемые вашим приложением языки в параметре language_codes (по умолчанию используется английский).

Как это работает

Установите SDK, опишите, что модель должна услышать, и отправьте аудиофрагмент. Функция диктовки принимает до 120 секунд аудио за один вызов.

Под капотом это один POST-запрос с двумя частями multipart: JSON-объектом конфигурации и аудио, поэтому любой язык программирования с HTTP-клиентом может обращаться к нему одинаково. Метод transcribe_live() также принимает итератор аудиофрагментов, а open_live() принимает аудио, поступающее из callback-функции, что позволяет начать загрузку, пока пользователь еще говорит, вместо того чтобы ждать окончания записи. Оба метода описаны в документации по диктовке.

Цены

$0,62 за час аудио, всё включено. Одна строчка в вашем счете покрывает весь запрос, поэтому вам не нужно рассчитывать второй тариф или заниматься математикой токенов при прогнозировании стоимости диктовки для вашего объема. Скидки за объем применяются на любом уровне.

Blurt — опенсорсное приложение для диктовки на базе нашего API

Мы создали приложение для диктовки на базе этого API и открыли его исходный код. Blurt распространяется бесплатно, под лицензией MIT и является нативным для macOS: удерживайте правую клавишу ⌘, говорите, и готовый текст появляется в том приложении, которое находится в фокусе. Вы используете свой собственный ключ API, бесплатный тариф включен.

Это также самый быстрый способ увидеть работу API в реальном приложении. Каждая функция из этой статьи где-то задействована в коде, поэтому, если вы разбираетесь, как внедрить диктовку в собственный продукт, начните с этого, а не с нуля.

Начало работы

Dictation API уже доступен по адресу https://dictation.assemblyai.com/v1/transcribe/live с вашим текущим ключом API. Отправьте высказывание, прочитайте llm_response, вставьте его в позицию курсора. Когда вы будете готовы идти дальше, тот же запрос может принимать параметры stt_prompt для описания вашего домена, keyterms_prompt для имен, написание которых критически важно для ваших пользователей, и llm_instruction, если вывод по умолчанию не соответствует формаю, требуемому вашему приложению.

Часто задаваемые вопросы

Sync API возвращает дословную стенограмму в рамках одного запроса: что было сказано и именно так, как это было сказано. Dictation API принимает ту же реплику и возвращает то, что говорящий имел в виду, с исправленными оговорками и удаленными словами-паразитами. Оба решения работают на базе Universal-3.5 Pro. Выбирайте Sync, когда вам нужна сама стенограмма, и Dictation, когда текст отправляется напрямую туда, куда пишет ваш пользователь.

Да. Передайте параметр llm_instruction с нужной вам структурой, и результат придет в соответствующем виде, будь то список задач с маркерами, клиническая заметка или сообщение в чате. Если оставить его пустым, вы получите стандартную очистку текста. Дословная стенограмма в любом случае возвращается в текстовом виде, так что у вас всегда есть оба варианта.

[TODO] Транскрипция охватывает все 19 языков: передайте поддерживаемые вашим приложением языки в параметре language_codes, по умолчанию используется английский. Поддержка формирования структуры вывода ожидает подтверждения от продукта — не отвечайте на эту часть, пока она не будет внедрена.

Вы получаете статус 200 с дословным текстом и параметром llm_error, установленным в значение "timeout", а не ошибку, с которой должен разбираться ваш клиент. Худшее, с чем столкнется ваш пользователь, — это более простой текст, чем обычно, что сильно отличается от ситуации, когда приходится смотреть на индикатор загрузки и терять мысль, которую он диктовал. В SDK свойство result.final_text уже реализует этот резервный вариант: переписанный текст, если он есть, или стенограмму, если его нет.

Передайте важные слова в параметре keyterms_prompt (имена коллег, клиентов, названия продуктов, внутренний жаргон), и распознавание будет смещаться в сторону их написания. Для более широкого контекста параметр stt_prompt описывает то, что модель сейчас услышит, позволяя ей опираться на вашу предметную область, а не на общий словарь.

Да, для Python: pip install assemblyai, затем aai.DictationTranscriber().transcribe_live(). Библиотека сама обрабатывает многокомпонентное обрамление и пошаговую загрузку. JavaScript SDK пока нет, поэтому на всех остальных языках вызывайте его по протоколу HTTP — один POST-запрос с частью конфигурации и частью аудио, что может сделать любой HTTP-клиент.

Весь запрос за час аудио: транскрипция и готовый результат отображаются одной строкой в вашем счете. Нет второго тарифа для модели и не нужно заниматься расчетом токенов при прогнозировании стоимости диктовки при вашем объеме. Скидки за объем применяются на любом уровне.

← Все статьи
Dev48

© 2026 · All rights reserved.