Ручное ведение заметок на встречах — утомительный и подверженный ошибкам процесс, особенно если совещание длится дольше часа. Это тратит время и отвлекает участников от обсуждения. Даже при наличии аудиозаписи сопоставить конкретные реплики с отдельными спикерами бывает непросто.
API расшифровки встреч позволяет превратить живые или записанные совещания в текст с временными метками и именами спикеров прямо внутри вашего продукта. Вы отправляете аудио и получаете структурированную стенограмму, избавляя себя от необходимости самостоятельно создавать речевую модель.
В этой статье объясняется, как работает API расшифровки встреч, сравниваются транскрипция в реальном времени и пакетная обработка, а также показывается, как создавать приложения с использованием Eleven Scribe v2 и Eleven Scribe v2 Realtime.
Резюме
- API расшифровки встреч преобразует аудиозаписи совещаний в стенограммы с временными метками и именами спикеров.
- Транскрипция в реальном времени обеспечивает субтитры с низкой задержкой прямо во время встречи, в то время как пакетная транскрипция обрабатывает аудиозаписи после окончания совещания.
- Точность расшифровки встреч зависит от качества звука, особенностей голоса спикеров и используемой голосовой модели.
- ElevenLabs предоставляет модели Scribe v2 и Scribe v2 Realtime, которые позволяют инженерным командам создавать высокоточные продукты для транскрипции встреч.
Что делает API расшифровки встреч и кому он нужен
API расшифровки встреч принимает аудиозапись встречи на вход и возвращает текст. Он берет на себя распознавание речи, диаризацию спикеров и простановку временных меток, предоставляя вам готовый к работе инструмент. По сравнению с ручным ведением заметок, преобразование речи в текст для встреч дает участникам доступ к поиску по записям, к которым можно вернуться в любой момент.
По мере того как все больше команд внедряют ИИ-агентов, письменные отчеты о встречах становятся доступным для поиска контекстом. Внутренний агент может искать детали в стенограммах, извлекать информацию, которая снижает изолированность данных и улучшает доступ к информации между командами.
Многие коммерческие инструменты предлагают функцию транскрипции, однако они не всегда полностью удовлетворяют требования организации.
Для продуктовых инженерных команд создание собственного приложения STT для встреч или добавление этой возможности в существующий инструмент порой является более жизнеспособным вариантом. Имея собственное ПО для расшифровки встреч, вы получаете контроль над следующими аспектами:
- Конфиденциальность: ElevenLabs предлагает режим нулевого хранения (Zero Retention Mode) для корпоративных пользователей, что дополнительно отвечает требованиям безопасности в определенных регионах.
- Пользовательский словарь: вы предоставляете модели дополнительный контекст, позволяя ей понимать и расшифровывать термины, специфичные для вашей компании, продукта и отрасли.
- Индивидуальный рабочий процесс: вместо того чтобы ограничиваться стандартными процессами конкретного вендора, вы создаете инструмент расшифровки встреч, который интегрируется с вашей внутренней базой данных, CRM и корпоративным ПО.
ElevenLabs предоставляет передовые речевые и аудиомодели, которые помогают создавать приложения для расшифровки встреч. Используя наш API расшифровки встреч, вы можете точно фиксировать сказанное на встрече в виде текстовых заметок. Наши модели поддерживают более 90 языков, что позволяет транскрибировать речь на английском, французском, мандаринском и десятках других языков.
Преобразование речи в текст для встреч: в реальном времени или пакетно — как выбрать
Транскрипция в реальном времени захватывает аудиопотоки по мере их произнесения и превращает их в живые субтитры. Вы используете транскрипцию в реальном времени для текстовой поддержки во время встречи или для запуска действий прямо в ходе сессии с помощью активного бота. Пакетная транскрипция обрабатывает всю запись целиком после завершения встречи, чтобы предоставить более лаконичную и структурированную стенограмму. Пакетная транскрипция помогает создавать послемодерационные заметки, вести архив и сохранять проверяемые отчеты.
При выборе между преобразованием речи в текст в реальном времени или пакетной обработкой важно понимать технические и финансовые последствия.
Ниже приведено краткое сравнение обоих подходов.
Характеристики
Транскрипция в реальном времени
Пакетная транскрипция
Технические операции
Захватывает аудиопотоки в живом режиме по мере их произнесения. Требует активного соединения с голосовой моделью.
Обрабатывает всю аудиозапись после встречи. Может работать в асинхронном режиме.
Точность
Стандартная. Обрабатывает звук «на лету» без полного контекста.
Более высокая. Имеет достаточно времени для анализа полного контекста беседы.
Варианты использования
Субтитры в реальном времени на встрече, бот для встреч.
Заметки после встречи, ведение записей.
Стоимость
Выше, так как требуется постоянное соединение.
Ниже за счет эффективности пакетной обработки.
В конечном итоге ваш выбор зависит от приоритетов. Если вы создаете ассистента для живых встреч, вам необходима транскрипция в реальном времени. В противном случае используется пакетная транскрипция, которая имеет преимущества в стоимости и точности.
Как настроить API расшифровки встреч с помощью Scribe v2
ElevenLabs Speech to Text позволяет расшифровывать встречи с помощью Scribe v2 Realtime и Scribe v2. Обе голосовые модели обучены точно определять спикеров с учетом различных акцентов, диалектов и качества звука. Scribe v2 Realtime позволяет мгновенно расшифровывать живую речь, в то время как Scribe v2 превращает аудиозаписи в высокоточные стенограммы.
Вы можете получить доступ к обеим моделям с помощью предоставляемого нами API. Ниже мы подробно рассмотрим каждую модель, выделив ключевые функции, архитектуру API и способы интеграции с вашим решением для транскрипции.
Вариант 1: Транскрипция в реальном времени (живая)
Транскрипция в реальном времени позволяет обрабатывать беседы во время встречи и превращать их в текст по мере того, как говорят участники. Между звучащей и расшифрованной речью практически нет заметных пауз.
Для транскрипции в реальном времени используется модель Scribe v2 Realtime, которая обеспечивает низкую задержку на уровне 150 мс между аудиовходом и текстовым выводом (почти мгновенные частичные стенограммы). Это означает, что при интеграции модели в ваше приложение для транскрипции вы получите субтитры без разрывов.
Созданная для поддержки живого общения, модель Scribe v2 Realtime подходит для сценариев использования, требующих живых субтитров, создания заметок о встрече в реальном времени или передачи живого текста в ИИ-ассистент для дополнительных триггеров. Кроме того, модель поддерживает до 50 ключевых терминов для промптинга.
Как выполнять транскрипцию с помощью Scribe v2 Realtime
Чтобы запустить транскрипцию в реальном времени, подключите ваш продукт к Scribe v2 Realtime с помощью ElevenAPI.
- Сначала откройте WebSocket, чтобы ваш продукт мог получать стенограммы от модели Scribe v2 Realtime.
- Затем отправьте потоки живого разговора с встречи в модель.
- Наконец, получайте частичные и окончательные стенограммы в течение 150 мс.
В своем коде вы создаете обработчики для событий API, которые происходят на протяжении всего процесса транскрипции. Например, ваш код обрабатывает события при отправке аудиоданных и получении зафиксированной стенограммы.
Методы потоковой передачи для Scribe v2 Realtime
В примере ниже на вашем бэкенде создается одноразовый токен. Ваш клиент может передавать аудио встречи в API расшифровки без раскрытия вашего ключа API.
В зависимости от архитектуры вашего приложения, вы можете транслировать живые беседы с помощью Scribe v2 Realtime из клиентского приложения или бэкенд-сервера.
- Потоковая передача на стороне клиента: при этом методе вы передаете аудиовход в аудиомодель напрямую с микрофона или с помощью нарезки на фрагменты (чанки). Для подключения к API вы проходите валидацию с помощью одноразового токена, что предотвращает раскрытие вашего ключа API.
- Потоковая передача на стороне сервера: Этот метод позволяет передавать аудио напрямую из URL-адреса, загруженных файлов или аудиопотока. Вместо одноразового токена вы используете свой API-ключ ElevenLabs.
Выбор стратегии фиксации для Scribe v2 Realtime
В примере ниже настраивается обнаружение голосовой активности. API будет фиксировать сегмент расшифровки всякий раз, когда говорящий делает паузу.
Итоговая стенограмма содержит документальные подтверждения, которые точно фиксируют то, о чем говорится на встрече. Существует два способа фиксации итоговых стенограмм: вручную или с помощью функции обнаружения голосовой пакетной активности (VAD).
- Ручная фиксация: По умолчанию вы должны вручную фиксировать сегмент стенограммы в своем коде. Мы рекомендуем выполнять фиксацию каждые 20–30 секунд для достижения оптимальной задержки. Если вы беспокоитесь о потере контекста, вы можете отправить предыдущий текст вместе с обрабатываемым аудиосегментом.
- Обнаружение голосовой активности: Кроме того, вы можете использовать VAD, который обнаруживает паузы в аудиопотоке для запуска транскрипции.
Вариант 2: Пакетная транскрипция (после встречи)
Пакетная транскрипция — это эффективный способ преобразования часов записей встреч в текстовый формат. Она обеспечивает создание лаконичных, контекстно релевантных стенограмм с разделением по говорящим в больших масштабах.
Scribe v2 — это модель преобразования речи в текст от ElevenLabs, которая поддерживает динамическую разметку аудио. Вы можете точно извлекать данные разговоров, а также неречевые события, такие как смех и шаги.
В отличие от транскрипции в реальном времени, Scribe v2 создана для заметок встреч после их записи. Например, вы записываете встречи на таких платформах, как Zoom, Teams и Google Meet. Затем вы загружаете аудиофайлы в Scribe v2 после сеанса для пакетной транскрипции.
Как выполнять пакетную транскрипцию с помощью Scribe v2
Транскрипция с помощью Scribe v2 происходит асинхронно через REST API. Вам не нужно поддерживать активное соединение с голосовой моделью. Вместо этого вы используете вебхук, чтобы получать уведомления о готовности стенограммы.
Ниже представлен логический процесс преобразования аудиозаписей в стенограмму.
- Сначала вы создаете вебхук на панели управления ElevenLabs для получения результатов транскрипции.
- Затем создайте обработчики событий в своем коде для обработки возвращенной транскрипции.
- После этого загрузите аудиофайлы в конечную точку REST API Scribe v2.
Как только транскрипция завершится, настроенный вами обработчик событий будет вызван.
Подсказки по ключевым словам для Scribe v2
Scribe v2 (пакетный режим) поддерживает до 1000 терминов для подсказок по ключевым словам. Когда вы отправляете аудиофайл на транскрипцию, вы можете включить эти термины в вызов API. В отличие от списка словаря, Scribe v2 сравнивает ключевые термины с контекстом беседы, чтобы определить правильную транскрипцию.
Это позволяет модели уделять особое внимание ситуации, когда кто-то произносит определенные термины, и точно их расшифровывать.
В примере ниже в запросе передаются термины компании и продукта, что означает, что API правильно расшифрует их в контексте.
Например, слово «ElevenLabs» расшифровывается, когда вы произносите его в контексте как бренд или компанию.
Многоканальная транскрипция для Scribe v2
Многоканальная транскрипция позволяет модели Scribe v2 расшифровывать отдельные каналы в аудиофайле с речью разных говорящих. Эта функция полезна, если вы создаете инструмент транскрипции для конференций, судебных заседаний или подкастов.
Каждый канал будет помечен уникальным идентификатором, представляющим говорящего.
Частые проблемы при транскрипции встреч и то, как API справляется с ними
При транскрипции встреч инженерные команды часто сталкиваются с рядом проблем.
Накладывающиеся разговоры
Когда несколько людей говорят одновременно, становится трудно понять, что именно говорится. Чтобы различать говорящих, используйте диаризацию или многоканальную транскрипцию, которые предлагает Scribe v2. Таким образом, вы получаете отдельные стенограммы, привязанные к соответствующим говорящим.
Неверные интерпретации
Другая проблема, с которой сталкиваются инструменты транскрипции, — это точное обнаружение и интерпретация конкретных продуктов, брендов или отраслевых терминов. Например, термин «DevOps», знакомый разработчикам программного обеспечения, может быть ошибочно расшифрован как «dev ops». С помощью API транскрипции встреч ElevenLabs вы можете направить модель на правильную интерпретацию с помощью подсказок по ключевым словам.
Многоязычные спикеры
Некоторые встречи проводятся на разных языках, причем участники переключаются между двумя или более языками, которыми они владеют. Стандартным голосовым моделям сложно интерпретировать контекст и содержание речи, что приводит к низкому качеству транскрипции. Scribe v2 обеспечивает многоязычную транскрипцию на более чем 90 языках, точно фиксируя беседы по мере их развития.
Живые субтитры и стенограмма после записи
Некоторым командам необходимо выводить живые субтитры и генерировать стенограмму после встречи. К сожалению, не каждый готовый инструмент транскрипции предлагает обе функции. API ElevenLabs позволяет делать и то, и другое с помощью Scribe v2 и Scribe v2 Realtime.
Начало работы с API транскрипции встреч
ElevenAPI предоставляет вам доступ к ведущим моделям преобразования речи в текст для создания инструментов транскрипции встреч. Настроить среду сборки очень просто. Вы получаете ключ API и устанавливаете SDK для Python или Node.js. Затем вы интегрируете Scribe v2 или Scribe v2 Realtime со своим продуктом, используя предоставленный API.
Получите доступ к ElevenLabs и отправьте свой первый запрос API прямо сейчас.







