Последние два года все передовые лаборатории развивали интеллект одним и тем же способом: позволяли моделям думать дольше. Модели рассуждения теперь тратят тысячи токенов на «размышления» (философствование, обдумывание, безделье), прежде чем произнести хоть слово. При доминирующей парадигме авторегрессионного декодирования каждый из этих токенов генерируется последовательно, и для каждого требуется полный проход модели. Во время разговора с голосовым агентом это время генерации (декодирования) накапливается до такой степени, что проще просто повесить трубку.
Результатом стал странный раскол в индустрии. Передовой край интеллектуальных рассуждений рванул вперед, в то время как интеллект реального времени застыл на месте. Голосовое взаимодействие — одна из немногих вертикалей, где GPT 5.x, Claude Sonnet и Gemini Pro просто не дотягивают до нужного уровня, потому что никто не хочет ждать 3 секунды каждый раз, когда нужно ответить на вопрос о записи к стоматологу.
Mercury 2 — это первая в мире диффузионная языковая модель с функцией рассуждения, декодирующая более 1000 токенов в секунду на стандартных графических процессорах NVIDIA. Этого достаточно, чтобы выполнить полный цикл рассуждения и начать говорить в рамках бюджета задержки естественного разговора. Мы сокращаем стоимость рассуждения с 3 секунд тишины до всего лишь 300 миллисекунд.
Голосовые агенты застряли в апреле 2025 года
Клиенты, использующие голосовые технологии, говорят нам, что сквозная задержка LLM должна быть менее ~500 мс, иначе разговор перестает казаться человеческим.
Модель рассуждения, которая выдает 500 токенов цепочки рассуждений при типичной авторегрессионной скорости 60–100 токенов/сек, превышает этот бюджет на пять-восемь секунд. Поэтому разработчикам голосовых систем приходится выбирать между умной моделью, которая звучит «сломанной», или быстрой моделью, которая не может следовать инструкциям.
Большинство из них решили эту проблему одинаково: GPT 4.1, самая умная модель OpenAI без функции рассуждения — из апреля 2025 года(!) — остается «мозгом» по умолчанию для большинства производственных голосовых агентов. Это одна из немногих моделей, сочетающая строгое следование инструкциям и вызов инструментов с задержкой реального времени по цене, которая масштабируется до тысяч звонков в день. Но GPT 4.1 планируется к выводу из эксплуатации у многих провайдеров позднее в этом году, а это значит, что индустрия голосовых агентов вот-вот лишится своей стандартной модели, и ни одна из передовых моделей рассуждения не сможет занять ее место.
Один из путей отхода — экзотическое оборудование: использование Cerebras или Groq позволяет добиться авторегрессионного декодирования на впечатляющих скоростях. Но мощности на специализированных чипах дефицитны и часто забронированы на 12+ месяцев вперед; масштабная многолетняя сделка Cerebras с OpenAI заблокировала большую часть их ресурсов, вытесняя мелкие контракты. Поэтому настоящий вопрос звучит так: что, если бы вы могли получить скорость декодирования специализированных чипов на графических процессорах NVIDIA, которые уже есть у всех?
Почему диффузии не нужно идти по одному токену за раз
Узкое место в каждой авторегрессионной LLM носит структурный характер. Последовательное декодирование означает, что каждый выходной токен требует полного прямого прохода, а каждый прямой проход означает передачу весов всей модели из HBM графического процессора в SRAM на чипе. При малых размерах пакетов, которые требуются для чувствительных к задержке сервисов, большая часть арифметической пропускной способности графического процессора простаивает.
Модели Mercury — это диффузионные большие языковые модели (dLLM), использующие архитектуру, которая генерирует токены параллельно.
Как мы подробно описываем в нашем техническом отчете, генерация работает через пару процессов. Прямой процесс берет чистый текст и постепенно искажает его в шум в течение серии шагов. Модель — стандартный трансформер — обучена выполнять это в обратном порядке: получив зашумленную латентную последовательность, она предсказывает чистый текст, и она обучена с помощью задачи шумоподавления делать это для всех позиций в последовательности одновременно.
Каждый проход шумоподавления затрагивает множество токенов, поэтому арифметическая интенсивность генерации намного выше, чем при декодировании по одному токену, т.е. одни и те же веса, загруженные из памяти, выполняют полезные вычисления для многих токенов. Результат — более 1000 токенов в секунду на NVIDIA H100 — пропускная способность, ранее возможная только на специализированных чипах — при качестве, сопоставимом с небольшими передовыми моделями, такими как GPT Mini и Claude Haiku.
Математика рассуждений в реальном времени
При скорости 1000+ токенов в секунду цепочка рассуждений из 300 токенов завершается менее чем за 300 мс. Это означает, что обдумывание, которое делает модели рассуждения эффективными в выборе инструментов, соблюдении политик и многошаговых рабочих процессах, теперь укладывается в один ход, незаметно для звонящего.
Mercury 2 использует регулятор reasoning_effort с четырьмя настройками — мгновенная, низкая, средняя и высокая — чтобы разработчики могли выбирать уровень в соответствии с интеллектом, необходимым для их приложения.
Мы протестировали мгновенный, низкий и средний уровни на IFBench (следование инструкциям) и Tau3Bench Telecom (реалистичный многоходовой вызов инструментов для агентов службы поддержки), измеряя задержку на реальных производственных промптах от OpenCall.
«В OpenCall мы используем Mercury 2 для работы наших производственных голосовых агентов, обрабатывающих сложные звонки пациентов. В ходе нашего тестирования Mercury 2 превзошла GPT OSS 120B на Cerebras по следованию инструкциям, использованию инструментов и рассуждениям в многошаговых рабочих процессах. Она дает нам качество рассуждений, которое нам нужно, не жертвуя задержкой, необходимой для естественного телефонного разговора».
Оливер Сильверстайн, генеральный директор OpenCall
Мгновенный режим жертвует интеллектом ради скорости рефлексов, что делает его подходящим для подтверждений, фоновых ответов и ходов, не требующих вызова инструментов. Низкий уровень уже превосходит GPT 4.1 по следованию инструкциям при доле задержки. А средний уровень — это главный козырь, превосходящий GPT 4.1 на 27 пунктов в IFBench и на 24 пункта в Tau3Bench Telecom, оставаясь при этом быстрее, чем декодирование GPT 4.1 без рассуждений:
Почему каскадные конвейеры все еще выигрывают у speech-to-speech
Вы можете подумать: зачем вообще оптимизировать LLM в каскадном конвейере, когда существуют модели speech-to-speech? Несмотря на естественность полнодуплексных голосовых моделей, почти все производственные голосовые агенты в 2026 году по-прежнему работают по схеме ASR → LLM → TTS по четырем причинам:
Гибкость. При работе с голосовыми агентами в разных регионах и с разными акцентами вы можете менять модели транскрипции и голоса для каждого рынка.
Наблюдаемость. Каскадные конвейеры создают текстовые расшифровки, а не тысячи часов непрозрачного аудио, что позволяет масштабировать контроль качества и аудит.
Интеллект. Современные модели speech-to-speech все еще отстают по производительности при работе с длинным контекстом, многоходовой связности и точности вызова инструментов.
Стоимость. При цене $32/$64 за миллион токенов ценообразование GPT Realtime 2 не выдерживает столкновения с объемами колл-центров. Mercury 2 стоит $0.25 за миллион входных токенов и $0.75 за миллион выходных, что составляет примерно полцента за минуту разговора.
Предположим профиль производственного голосового агента: ~4 диалоговых хода в минуту; ~2000 токенов системного промпта плюс растущая история разговора, повторно отправляемая на каждом ходу (~20 000 входных токенов на минуту разговора); ~600 выходных токенов в минуту, включая токены рассуждения (~50 токенов речевого ответа и ~100 токенов рассуждения на ход). Прейскурантная цена Mercury 2 составляет $0.25/M входных и $0.75/M выходных токенов. Стоимость только на уровне модели; исключая STT, TTS и телефонию.
Предположим, что профиль голосового агента в рабочей среде выглядит так: ~4 речевых оборота в минуту; системный промпт на ~2000 токенов плюс растущая история диалога, повторно отправляемая на каждом шаге (~20 000 входных токенов на минуту разговора); ~600 выходных токенов в минуту, включая токены рассуждения (~50 токенов на устный ответ и ~100 токенов на рассуждение за один оборот). Прейскурантная цена Mercury 2 составляет $0,25 за миллион входных токенов и $0,75 за миллион выходных. Указана стоимость только на уровне модели; без учета STT, TTS и телефонии.
Каскадные конвейеры по-прежнему популярны, но им не хватало «мозга», способного рассуждать в режиме реального времени. Будучи конечной точкой, совместимой с OpenAI API, Mercury встраивается в слот LLM любого стека оркестрации, который вы уже используете — LiveKit, Pipecat, Vapi, Retell или вашего собственного.
Что дальше
Рассуждения в реальном времени меняют возможности голосовых агентов. Мы работаем с голосовыми платформами и предприятиями над расширением контекста, повышением производительности при вызове инструментов и режимом рассуждения с учетом задержек.
Хотите увидеть, как Mercury 2 справляется с вашими промптами? API доступен по адресу platform.inceptionlabs.ai. Проводите бенчмаркинг задержек голосового агента в рабочей среде? Мы предоставим повышенную пропускную способность, чтобы вы могли оценить реальную производительность на вашей нагрузке. Свяжитесь с нашей командой.









