Сегодня мы выпускаем Grok Voice Transcribe 2.0, нашу новейшую модель преобразования речи в текст. Согласно нашим оценкам в реальных условиях, Grok Voice Transcribe 2.0 является одной из самых точных моделей транскрибации, доступных на сегодняшний день, и в два раза точнее, чем Grok Voice Transcribe 1.0, при той же стоимости.
Grok Voice Transcribe 2.0 построена на базе фундаментальной аудиомодели, лежащей в основе Grok Voice. Grok Voice уже ежедневно обрабатывает десятки тысяч звонков в службу поддержки, транскрибирует миллионы часов видеоповествования и управляет голосовыми агентами в физических продуктах, включая помощника Grok в автомобилях Tesla. Модель обучена на уникальном наборе данных, состоящем из «живого», зашумленного, многоязычного аудио, записанного в самых разных условиях, и доработана с помощью пост-обучения.
Результатом стала одна из самых точных моделей транскрибации речи для реальных условий эксплуатации.
Точность
Большинство моделей транскрибации хорошо справляются с чистым аудио с одним спикером. Реальные аудиозаписи сложнее: помехи на телефонных линиях, накладывающиеся голоса, местные акценты, а также зачитанные вслух номера телефонов или адреса электронной почты. Мы создали Grok Voice Transcribe 2.0 для работы с самыми сложными аудиозаписями в любых условиях и средах.
В публичном рейтинге Artificial Analysis модель Grok Voice Transcribe 2.0 занимает первое место по точности среди 32 потоковых моделей.
Внутренние оценки
Помимо публичных бенчмарков, мы измеряем частоту ошибок в словах (WER) на четырех внутренних наборах данных, полученных из производственного трафика: телефонное аудио из звонков в службу поддержки, разговоры с Grok, произнесенные учетные данные, такие как коды доступа и адреса электронной почты, а также короткие многоязычные голосовые команды. Grok Voice Transcribe 2.0 превосходит Grok Voice Transcribe 1.0 по всем четырем показателям, а в телефонии она лидирует среди всех протестированных нами моделей.
Многоязычность
Grok Voice Transcribe 2.0 транскрибирует десятки языков, автоматически определяет язык и распознает переключения между языками во время записи за один проход. Точность многоязычного распознавания — это самое значительное улучшение по сравнению с Grok Voice Transcribe 1.0.
Короткие фразы, например, команды в автомобиле, дают модели мало контекста для определения языка. На нашем наборе коротких фраз частота ошибок в словах снизилась с 20,6% до 6,8%.
Функции
Grok Voice Transcribe 2.0 поддерживает расширенную конфигурацию и элементы управления. Существующие интеграции API Speech-to-Text получают повышение точности без необходимости внесения изменений в код:
- Пакетная и потоковая обработка. Транскрибируйте записанные файлы и URL-адреса или транскрибируйте аудиопоток в режиме реального времени.
- Временные метки на уровне слов. Каждое слово имеет точное время начала/окончания и показатели достоверности.
- Диаризация спикеров. Маркируйте каждого спикера в транскрипте без дополнительной оплаты.
- Многоканальная транскрибация. Транскрибируйте до 8 каналов независимо.
- Приоритизация ключевых терминов. Передавайте до 100 доменных терминов на запрос, таких как названия продуктов или медицинская лексика.
- Форматирование текста. Числа, даты, валюты, номера телефонов и адреса электронной почты возвращаются в письменном виде.
- Удаление слов-паразитов. Исключайте из транскрипта такие слова, как «эм» и «э-э».
- Умное определение реплик. Определяйте конец реплики спикера для голосовых агентов.
Grok Voice расширяет возможности Atlassian Loom
Atlassian Loom широко используется для записи и обмена записями экрана. В Atlassian обнаружили, что Grok Voice Transcribe 2.0 более точен, чем их существующее решение для транскрибации видео Loom. Точные транскрипты открывают новые рабочие процессы с использованием ИИ: запишите план действий в Loom, передайте транскрипт в Cursor, и он внесет изменения в код напрямую.
«Мы всегда верили, что лучший способ продвигать работу вперед — это зафиксировать контекст один раз и позволить ему распространяться везде. Благодаря тому, что Grok обеспечивает преобразование речи в текст для Loom, а Cursor превращает это в код, мы замыкаем цикл от контекста к коду: запишите то, что вы имеете в виду, и работа будет сделана. Это взгляд на то, куда движется разработка с помощью ИИ».
Цена
Стоимость Grok Voice Transcribe 2.0 идентична стоимости Grok Voice Transcribe 1.0. Пакетная транскрибация по-прежнему стоит $0,10 за час аудио, а потоковая — $0,20 за час, включая диаризацию, временные метки и ключевые термины.
Grok Voice Transcribe 2.0 скоро станет стандартом по умолчанию в API Speech-to-Text, а Grok Voice Transcribe 1.0 будет выведен из эксплуатации в ближайшие недели. Чтобы остаться на нем во время перехода, закрепите версию grok-voice-transcribe-1.0.
Начните разработку с Grok Voice Transcribe
Попробуйте вживуюПосмотреть документацию










