Сегодня мы выпускаем Mercury 2.5, нашу самую мощную на данный момент модель для промышленного использования. Это значительный шаг вперед в плане качества по сравнению с Mercury 2 при сохранении того же профиля обслуживания с низкой задержкой и низкой стоимостью.
С момента запуска Mercury 2 тысячи разработчиков создали на ее основе свои решения, десятки предприятий внедрили ее в производство, а объем использования вырос более чем на порядок. Сейчас она обслуживает рабочие нагрузки, чувствительные к задержкам, в продуктах для поиска, голосовых технологиях и программировании.
Эти рабочие нагрузки дали нам более четкие сигналы, чем просто бенчмарки. Мы использовали отзывы клиентов и случаи сбоев в работе для уточнения оценок и фокусировки обучения. Mercury 2.5 — первый результат этой обратной связи.
Что изменилось
Mercury 2.5 — самая мощная диффузионная LLM на рынке. Насколько нам известно, это крупнейшая диффузионная языковая модель из когда-либо обученных.
- Качество: повышение интеллектуальных возможностей на 40% по сравнению с Mercury 2. Сопоставимо с передовыми моделями, оптимизированными по стоимости, такими как GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite и Claude Haiku 4.5.
Качество: повышение интеллектуальных возможностей на 40% по сравнению с Mercury 2. Сопоставимо с передовыми моделями, оптимизированными по стоимости, такими как GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite и Claude Haiku 4.5.
- Скорость: 1107 токенов в секунду на широко доступных графических процессорах NVIDIA.
Скорость: 1107 токенов в секунду на широко доступных графических процессорах NVIDIA.
- Контекст: 260 тыс. токенов.
Контекст: 260 тыс. токенов.
- Цена: $0,20 за миллион входных токенов и $0,75 за миллион выходных токенов. На момент запуска на Mercury 2.5 действует скидка 80%: $0,04 за миллион входных и $0,15 за миллион выходных токенов.
Цена: $0,20 за миллион входных токенов и $0,75 за миллион выходных токенов.
- На момент запуска на Mercury 2.5 действует скидка 80%: $0,04 за миллион входных и $0,15 за миллион выходных токенов.
На момент запуска на Mercury 2.5 действует скидка 80%: $0,04 за миллион входных и $0,15 за миллион выходных токенов.
- Возможности: настраиваемое рассуждение, параллельные вызовы инструментов и JSON, соответствующий схеме.
Возможности: настраиваемое рассуждение, параллельные вызовы инструментов и JSON, соответствующий схеме.
С момента запуска Mercury 2 мы наблюдали, как Inception продвигает диффузионные языковые модели на базе инфраструктуры NVIDIA AI. Повышение интеллектуальных возможностей Mercury 2.5 в сочетании с высокой скоростью и низкой стоимостью отражает то, как быстро новые архитектуры могут превращаться в готовые к промышленному использованию системы на платформе NVIDIA.
Шрути Копаркар, старший менеджер по продукту, группа ускоренных вычислений NVIDIA
Mercury в производстве
Поисковые агенты и RAG-конвейеры
Один поисковый запрос может инициировать десятки вызовов модели: планирование поиска, переписывание запросов, переранжирование результатов, структурирование фактов, обобщение источников и проверка ответа. Mercury поддерживает достаточно высокую скорость этих вызовов, чтобы оставаться в рамках одного взаимодействия с пользователем. Несколько ведущих компаний в области поисковой инфраструктуры уже используют ее в производстве.
Голосовые агенты и интерактивные приложения
В голосовых технологиях задержка — это не просто деталь инфраструктуры. Это пауза, которую слышит звонящий.
OpenCall создает AI-телефонных агентов, которые обрабатывают живые звонки клиентов. При работе с их нагрузкой Mercury обеспечила медианную задержку ответа модели около 170 миллисекунд.
После перехода на Mercury наше время отклика P99 сократилось с нескольких минут до одной секунды, а P50 — с 0,4 секунды до менее чем 0,2, что значительно быстрее, чем у любого другого провайдера, которого мы видели, включая задачи на рассуждение.
Оливер Силверстайн, соучредитель и генеральный директор OpenCall
Вспомогательные агенты для программирования
Агенты для программирования уже распределяют работу между моделями. Одна может планировать или писать код, в то время как другие ищут, запускают инструменты, маршрутизируют запросы, обобщают состояние или сжимают длинную сессию. Эти вспомогательные вызовы происходят постоянно, поэтому задержки и затраты быстро накапливаются.
Augment Code использует Mercury для сжатия контекста, маршрутизации моделей и поиска инструментов MCP. Перенос сжатия на Mercury сократил задержку на 82% (примерно со 150 до 27 секунд) и снизил затраты на 90% при сохранении качества. Сводки поиска инструментов возвращаются менее чем за секунду.
Та же скорость применима и к разработке веб-приложений. Посмотрите, как Mercury 2.5 генерирует работающее веб-приложение для поиска музыки по нескольким подсказкам в демо ниже.
Предварительный просмотр Mercury Voice и Mercury Router
Вместе с Mercury 2.5 мы анонсируем предварительную версию Mercury Voice и Mercury Router.
- Mercury Voice обеспечивает время до первого токена (TTFT) менее 170 миллисекунд и представляет собой dLLM, оптимизированную для голосовых агентов с самыми жесткими требованиями к задержке.
Mercury Voice обеспечивает время до первого токена (TTFT) менее 170 миллисекунд и представляет собой dLLM, оптимизированную для голосовых агентов с самыми жесткими требованиями к задержке.
- Mercury Router понимает входящие запросы с помощью dLLM и направляет их к лучшим моделям (открытым и закрытым), которые предлагают оптимальное сочетание качества, скорости и стоимости.
Mercury Router понимает входящие запросы с помощью dLLM и направляет их к лучшим моделям (открытым и закрытым), которые предлагают оптимальное сочетание качества, скорости и стоимости.
Начало работы
Модели Mercury доступны через наш API Inception, Baseten и OpenRouter. Корпоративные развертывания поддерживают выделенные мощности, автоматическое масштабирование, средства контроля соответствия требованиям и настраиваемое хранение данных.
Попробуйте Mercury 2.5 в чате Попробуйте API с 100 миллионами бесплатных токенов · Прочитайте документацию API
- Клиенты Baseten: разверните Mercury 2.5 через существующую настройку Baseten.
Клиенты Baseten: разверните Mercury 2.5 через существующую настройку Baseten.
- Компании Y Combinator: Claim $500 000 в виде бонусов на развертывание.
Компании Y Combinator: $500 000 в виде бонусов на развертывание.
- Оцениваете Mercury для голосовых решений? Мы поможем вам протестировать соответствие рабочей нагрузки и подтвердить производительность в рамках ваших ограничений обслуживания. Свяжитесь с нами.
Оцениваете Mercury для голосовых решений? Мы поможем вам протестировать соответствие рабочей нагрузки и подтвердить производительность в рамках ваших ограничений обслуживания. Свяжитесь с нами.
Что дальше
Мы уже начали обучение нашей следующей модели. Это наша самая большая модель на сегодняшний день, и мы планируем выпустить ее в ближайшие месяцы. Наша следующая модель станет скачком в возможностях, не жертвуя при этом скоростью и эффективностью токенов, присущими диффузии. Это требует прогресса в обучении моделей, выводе, оценках и инфраструктуре. Если это та задача, над которой вы хотите работать, мы будем рады услышать вас.
Скоро будет больше информации.









