Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Mercury 2 pervaya model s mehanizmom rassuzhdeniya dostatochno bystraya dlya tel
Dev48

© 2026 · All rights reserved.

Mercury 2: первая модель с механизмом рассуждения, достаточно быстрая для телефонного разговора

Источник: Inception Labs

Mercury 2: первая модель с механизмом рассуждения, достаточно быстрая для телефонного разговора

Источник: Inception Labs

Mercury 2 привносит рассуждения в реальном времени в голосовые агенты. Время до первого токена (TTFT) менее 300 мс на стандартных графических процессорах NVIDIA, что позволяет вашим агентам поддерживать полноценный диалог.

27 сентября 2026 г.•Обновлено: 27 сентября 2026 г.

Последние два года каждая передовая лаборатория развивала интеллект одним и тем же способом: позволяя моделям «думать» дольше. Современные модели рассуждения тратят тысячи токенов на размышления (философствование, обдумывание, безделье), прежде чем произнести хоть слово. При доминирующей парадигме авторегрессионного декодирования каждый из этих токенов генерируется последовательно, и для каждого требуется полный проход модели. Во время разговора с голосовым агентом это время генерации (декодирования) накапливается до такой степени, что проще просто повесить трубку.

Результатом стал странный раскол в индустрии. Фронтир интеллектуальных рассуждений рванул вперед, в то время как интеллект реального времени застыл на месте. Голосовое взаимодействие — одна из немногих областей, где GPT 5.x, Claude Sonnet и Gemini Pro просто не справляются, потому что никто не хочет ждать по 3 секунды каждый раз, когда отвечает на вопрос о записи к стоматологу.

Mercury 2 — первая в мире диффузионная языковая модель с функцией рассуждения, декодирующая более 1000 токенов в секунду на стандартных графических процессорах NVIDIA. Этого достаточно, чтобы выполнить полный цикл рассуждения и начать говорить в рамках допустимой задержки для естественного разговора. Мы сокращаем стоимость рассуждения с 3 секунд тишины до всего лишь 300 миллисекунд.

Голосовые агенты застряли в апреле 2025 года

Клиенты голосовых сервисов говорят нам, что сквозная задержка LLM должна быть менее ~500 мс, иначе разговор перестает ощущаться естественным.

Модель рассуждения, которая выдает 500 токенов цепочки рассуждений при типичной авторегрессионной скорости 60–100 токенов/сек, превышает этот бюджет на пять-восемь секунд. Поэтому разработчикам голосовых решений приходится выбирать между умной моделью, которая звучит «сломанной», или быстрой моделью, которая не может следовать инструкциям.

Большинство из них решили эту проблему одинаково: GPT 4.1, самая умная модель OpenAI без функции рассуждения — из апреля 2025 года(!) — остается «мозгом» по умолчанию для большинства производственных голосовых агентов. Это одна из немногих моделей, сочетающая сильное следование инструкциям и вызов инструментов с задержкой реального времени по цене, которая масштабируется до тысяч звонков в день. Но GPT 4.1 планируется к выводу из эксплуатации у многих провайдеров позднее в этом году, а это значит, что индустрия голосовых агентов скоро лишится своей модели по умолчанию, и ни одна из передовых моделей рассуждения не сможет занять ее место.

Один из путей отхода — экзотическое оборудование: использование Cerebras или Groq позволяет добиться авторегрессионного декодирования на впечатляющих скоростях. Но мощности на специализированных чипах дефицитны и часто забронированы на 12+ месяцев вперед; масштабная многолетняя сделка Cerebras с OpenAI заблокировала большую часть их ресурсов, вытесняя мелкие контракты. Так что главный вопрос: что, если бы вы могли получить скорость декодирования специализированных чипов на графических процессорах NVIDIA, которые уже есть у всех?

Почему диффузии не нужно идти по одному токену за раз

Узкое место в каждой авторегрессионной LLM является структурным. Последовательное декодирование означает, что каждый выходной токен требует полного прямого прохода, а каждый прямой проход означает передачу весов всей модели из HBM GPU в SRAM на чипе. При малых размерах пакетов (batch sizes), которые требуются для чувствительных к задержке сервисов, большая часть арифметической пропускной способности GPU остается простаивающей.

Модели Mercury — это диффузионные большие языковые модели (dLLM), использующие архитектуру, которая генерирует токены параллельно.

Как мы подробно описываем в нашем техническом отчете, генерация работает через пару процессов. Прямой процесс берет чистый текст и постепенно искажает его в шум в течение серии шагов. Модель — стандартный трансформер — обучена выполнять это в обратном порядке: получив зашумленную латентную последовательность, она предсказывает чистый текст, и она обучена с помощью целевой функции шумоподавления делать это для всех позиций в последовательности одновременно.

Каждый проход шумоподавления затрагивает множество токенов, поэтому арифметическая интенсивность генерации намного выше, чем при декодировании по одному токену за раз, т.е. одни и те же веса, загруженные из памяти, выполняют полезные вычисления для множества токенов. Результат — более 1000 токенов в секунду на NVIDIA H100 — пропускная способность, ранее возможная только на специализированных чипах — при качестве, сопоставимом с небольшими моделями фронтира, такими как GPT Mini и Claude Haiku.

Математика рассуждений в реальном времени

При скорости 1000+ токенов в секунду цепочка рассуждений из 300 токенов завершается менее чем за 300 мс. Это означает, что обдумывание, которое делает модели рассуждения эффективными в выборе инструментов, соблюдении политик и многошаговых рабочих процессах, теперь укладывается в один ход, незаметно для собеседника.

Mercury 2 использует регулятор reasoning_effort с четырьмя настройками — мгновенный (instant), низкий (low), средний (medium) и высокий (high) — чтобы разработчики могли выбирать уровень в соответствии с интеллектом, необходимым для их приложения.

Мы протестировали настройки «мгновенный», «низкий» и «средний» на IFBench (следование инструкциям) и Tau3Bench Telecom (реалистичный многоходовой вызов инструментов для агентов службы поддержки), измерив задержку на реальных производственных промптах от OpenCall.

«В OpenCall мы используем Mercury 2 для работы наших производственных голосовых агентов, обрабатывающих сложные звонки пациентов. В нашем тестировании Mercury 2 превзошла GPT OSS 120B на Cerebras по следованию инструкциям, использованию инструментов и рассуждению в многошаговых рабочих процессах. Она дает нам качество рассуждения, которое нам нужно, не жертвуя задержкой, необходимой для естественного телефонного разговора».

Оливер Сильверстайн, генеральный директор OpenCall

«Мгновенный» режим жертвует интеллектом ради скорости рефлексов, что делает его подходящим для подтверждений, фоновых ответов и реплик, не требующих вызова инструментов. «Низкий» уже превосходит GPT 4.1 по следованию инструкциям при доле задержки. А «средний» — это главный козырь, превосходящий GPT 4.1 на 27 пунктов в IFBench и на 24 пункта в Tau3Bench Telecom, при этом оставаясь быстрее, чем декодирование без рассуждения у GPT 4.1:

Почему каскадные конвейеры все еще выигрывают у speech-to-speech

Вы можете подумать: зачем вообще оптимизировать LLM в каскадном конвейере, если существуют модели speech-to-speech? Несмотря на естественность полнодуплексных голосовых моделей, почти все производственные голосовые агенты в 2026 году по-прежнему работают по схеме ASR → LLM → TTS как минимум по четырем причинам:

Гибкость. При работе с голосовыми агентами в разных регионах и с разными акцентами вы можете менять модели транскрипции и голоса для каждого рынка.

Наблюдаемость. Каскадные конвейеры создают текстовые расшифровки, а не тысячи часов непрозрачного аудио, что позволяет масштабировать контроль качества и аудит.

Интеллект. Современные модели speech-to-speech все еще отстают по работе с длинным контекстом, согласованности в многоходовых диалогах и точности вызова инструментов.

Стоимость. При цене $32/$64 за миллион токенов, тарифы GPT Realtime 2 не выдерживают объемов колл-центров. Mercury 2 стоит $0.25 за миллион входных токенов и $0.75 за миллион выходных, что составляет примерно полцента за минуту разговора.

Предполагаемый профиль производственного голосового агента: ~4 реплики в минуту; системный промпт на ~2000 токенов плюс растущая история разговора, повторно отправляемая при каждом ходе (~20 000 входных токенов на минуту разговора); ~600 выходных токенов в минуту, включая токены рассуждения (~50 токенов речевого ответа и ~100 токенов рассуждения на ход). Прейскурантная цена Mercury 2: $0.25/M входных и $0.75/M выходных. Стоимость только на уровне модели; исключая STT, TTS и телефонию.

Предположим, что профиль голосового агента в рабочей среде выглядит так: ~4 речевых оборота в минуту; системный промпт на ~2000 токенов плюс растущая история диалога, повторно отправляемая при каждом обороте (~20 000 входных токенов на минуту разговора); ~600 выходных токенов в минуту, включая токены рассуждения (~50 токенов на устный ответ и ~100 токенов на рассуждение за оборот). Прейскурантная цена Mercury 2 составляет $0,25 за миллион входных и $0,75 за миллион выходных токенов. Указана стоимость только на уровне модели; без учета STT, TTS и телефонии.

Каскадные конвейеры по-прежнему популярны, но им не хватало «мозга», способного рассуждать в режиме реального времени. Будучи конечной точкой, совместимой с OpenAI API, Mercury встраивается в слот LLM любого стека оркестрации, который вы уже используете — LiveKit, Pipecat, Vapi, Retell или вашего собственного.

Что дальше

Рассуждение в реальном времени меняет возможности голосового агента. Мы работаем с голосовыми платформами и предприятиями над увеличением контекста, повышением производительности при вызове инструментов и режимом рассуждения с учетом задержки.

Хотите увидеть, как Mercury 2 справляется с вашими промптами? API доступен по адресу platform.inceptionlabs.ai. Проводите бенчмаркинг задержки голосовой связи в рабочей среде? Мы предоставим более высокую пропускную способность, чтобы вы могли оценить реальную производительность на своей рабочей нагрузке. Свяжитесь с нашей командой.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Lambda построит новый центр обработки данных в округе Мейс, штат Оклахома, что принесет полмиллиарда долларов налоговых поступлений в течение следующего десятилетия
Lambda

Lambda построит новый центр обработки данных в округе Мейс, штат Оклахома, что принесет полмиллиарда долларов налоговых поступлений в течение следующего десятилетия

Google тестирует возможность покупок на принадлежащей Walmart площадке Flipkart через Gemini и AI Mode в ИндииПресса
Google Gemini

Google тестирует возможность покупок на принадлежащей Walmart площадке Flipkart через Gemini и AI Mode в Индии

OpenAI расширяет проверку поведения моделей после появления новых инцидентов с несанкционированными агентами
Пресса
OpenAI

OpenAI расширяет проверку поведения моделей после появления новых инцидентов с несанкционированными агентами

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple WatchПресса
Apple

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple Watch

Незащищенные агенты OpenAI опубликовали 53 пользовательских изображения в интернете без ведома лабораторииПресса
OpenAI

Незащищенные агенты OpenAI опубликовали 53 пользовательских изображения в интернете без ведома лаборатории

Proaction увеличивает продажи на 60% и экономит более 75 часов с Codex
OpenAI

Proaction увеличивает продажи на 60% и экономит более 75 часов с Codex

Ещё от Inception Labs

Mercury 2 в Azure Foundry — Начало работы
Inception Labs

Mercury 2 в Azure Foundry — Начало работы

Больше разработчиков. Больше пропускной способности. Улучшенный Mercury 2.
Inception Labs

Больше разработчиков. Больше пропускной способности. Улучшенный Mercury 2.

Mercury 2 для поиска: достаточно быстро, чтобы выполнять сотни запросов
Inception Labs

Mercury 2 для поиска: достаточно быстро, чтобы выполнять сотни запросов

Представляем Mercury 2.5
Inception Labs

Представляем Mercury 2.5