Сегодня мы выпускаем Grok Voice Transcribe 2.0, нашу новейшую модель преобразования речи в текст. Согласно результатам наших реальных оценок, Grok Voice Transcribe 2.0 является одной из самых точных моделей транскрипции на сегодняшний день и в два раза точнее Grok Voice Transcribe 1.0 при той же цене.
Grok Voice Transcribe 2.0 создана на базе аудио-основы модели Grok Voice. Grok Voice уже обслуживает десятки тысяч звонков в службу поддержки клиентов ежедневно, расшифровывает миллионы часов видеозаписей и управляет голосовыми агентами в физических продуктах, включая ассистент Grok в автомобилях Tesla. Она обучена на уникальном наборе данных живого, зашумленного, многоязычного аудио, записанного в самых разных условиях, и доработана с помощью пострефлексивного обучения.
В результате получается одна из самых точных моделей транскрипции речи в реальных условиях.
Точность
Большинство моделей транскрипции хорошо справляются с чистым аудио с одним спикером. Реальный аудиопоток сложнее: ненадежные телефонные линии, конкурирующие голоса, местные акценты, а также зачитываемые вслух телефонные номера или адреса электронной почты. Мы создали Grok Voice Transcribe 2.0 для работы с самым сложным аудио в любых условиях и средах.
В публичном рейтинге Artificial Analysis модель Grok Voice Transcribe 2.0 занимает первое место по точности среди 32 потоковых моделей.
Внутренние оценки
В дополнение к публичным бенчмаркам мы измеряем частоту ошибок в словах на четырех внутренних наборах, полученных из производственного трафика: телефонные аудиозаписи звонков в службу поддержки, разговоры с Grok, произносимые учетные данные, такие как коды учетных записей и адреса электронной почты, а также короткие многоязычные голосовые команды. Grok Voice Transcribe 2.0 превосходит Grok Voice Transcribe 1.0 во всех четырех категориях, а в телефонии лидирует среди всех протестированных нами моделей.
Многоязычность
Grok Voice Transcribe 2.0 расшифровывает десятки языков, автоматически определяет язык и учитывает смену языка прямо во время записи за один проход. Многоязычная точность — это ее главное улучшение по сравнению с Grok Voice Transcribe 1.0.
Короткие фразы, такие как команды в автомобиле, дают модели мало контекста для определения языка. В нашем наборе коротких фраз частота ошибок в словах снижается с 20,6% до 6,8%.
Функции
Grok Voice Transcribe 2.0 поддерживает расширенную настройку и управление. Существующие интеграции Speech-to-Text API получают прирост точности без изменения кода:
- Пакетная и потоковая обработка. Расшифровывайте записанные файлы и URL-адреса или транскрибируйте аудиопоток в реальном времени.
- Временные метки на уровне слов. Каждое слово имеет точное время начала/окончания и оценки уверенности.
- Диаризация спикеров. Помечайте каждого спикера в транскрипции без дополнительной оплаты.
- Многоканальная транскрипция. Расшифровывайте до 8 каналов независимо друг от друга.
- Учет ключевых терминов. Передавайте до 100 предметных терминов на запрос, таких как названия продуктов или медицинская лексика.
- Форматирование текста. Числа, даты, валюты, телефонные номера и адреса электронной почты возвращаются в письменном виде.
- Удаление слов-паразитов. Исключайте из транскрипции такие слова-паразиты, как «эм» и «ээ».
- Интеллектуальное определение реплик. Определяйте конец реплики спикера для голосовых агентов.
Grok Voice расширяет возможности Atlassian Loom
Atlassian Loom широко используется для записи и обмена записями экрана. В Atlassian обнаружили, что Grok Voice Transcribe 2.0 точнее их существующего решения для транскрипции видео Loom. Точные расшифровки открывают новые рабочие процессы на базе ИИ: запишите план действий в Loom, передайте расшифровку в Cursor, и он внесет изменения в код напрямую.
«Мы всегда верили, что лучший способ продвигать работу вперед — это зафиксировать контекст один раз и пустить его повсюду. Благодаря тому, что Grok управляет преобразованием речи в текст в Loom, а Cursor превращает это в код, мы замыкаем цикл от контекста к коду: запишите то, что вы имеете в виду, и работа будет выполнена. Это проблеск того, куда движется разработка с помощью ИИ».
Цена
Цены на Grok Voice Transcribe 2.0 идентичны ценам на Grok Voice Transcribe 1.0. Пакетная транскрипция по-прежнему стоит 0,10 доллара за час аудио, а потоковая — 0,20 доллара за час, включая диаризацию, временные метки и ключевые термины.
Grok Voice Transcribe 2.0 скоро станет стандартным инструментом в Speech-to-Text API, а Grok Voice Transcribe 1.0 будет устаревшим в ближайшие недели. Чтобы оставаться на ней во время перехода, закрепите версию grok-voice-transcribe-1.0.
Начало работы с Grok Voice Transcribe
Попробовать вживую Посмотреть документацию










