Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Predstavlyaem mercury 25 2
Dev48

© 2026 · All rights reserved.

Представляем Mercury 2.5

Источник: Inception Labs

Представляем Mercury 2.5

Источник: Inception Labs

Mercury 2.5 — самая мощная диффузионная LLM на рынке. Она работает со скоростью 1107 токенов/сек и предлагает 40% прирост интеллекта по сравнению с Mercury 2, что сопоставимо с оптимизированными по стоимости передовыми моделями.

27 сентября 2026 г.•Обновлено: 27 сентября 2026 г.

Сегодня мы выпускаем Mercury 2.5, нашу самую мощную на сегодняшний день производственную модель. Это значительный шаг вперед в плане качества по сравнению с Mercury 2, при сохранении того же профиля обслуживания с низкой задержкой и низкой стоимостью.

С момента запуска Mercury 2 тысячи разработчиков создали на его основе свои решения, десятки предприятий внедрили его в производство, а объем использования вырос более чем на порядок. Сейчас он обслуживает рабочие нагрузки, чувствительные к задержкам, в продуктах для поиска, голосовых сервисах и программировании.

Эти рабочие нагрузки дали нам более четкие сигналы, чем просто бенчмарки. Мы использовали отзывы клиентов и случаи сбоев в производстве, чтобы улучшить оценки и сфокусировать обучение. Mercury 2.5 — первый результат этой обратной связи.

Что изменилось

Mercury 2.5 — самая мощная диффузионная LLM на рынке. Насколько нам известно, это крупнейшая диффузионная языковая модель из когда-либо обученных.

  • Качество: 40% прирост интеллектуальных возможностей по сравнению с Mercury 2. Сопоставимо с оптимизированными по стоимости передовыми моделями, такими как GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite и Claude Haiku 4.5.

Качество: 40% прирост интеллектуальных возможностей по сравнению с Mercury 2. Сопоставимо с оптимизированными по стоимости передовыми моделями, такими как GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite и Claude Haiku 4.5.

  • Скорость: 1107 токенов в секунду на широко доступных графических процессорах NVIDIA.

Скорость: 1107 токенов в секунду на широко доступных графических процессорах NVIDIA.

  • Контекст: 260 тысяч токенов.

Контекст: 260 тысяч токенов.

  • Цена: $0,20 за миллион входных токенов и $0,75 за миллион выходных. На момент запуска Mercury 2.5 предоставляется со скидкой 80%: $0,04 за миллион входных и $0,15 за миллион выходных токенов.

Цена: $0,20 за миллион входных токенов и $0,75 за миллион выходных.

  • На момент запуска Mercury 2.5 предоставляется со скидкой 80%: $0,04 за миллион входных и $0,15 за миллион выходных токенов.

На момент запуска Mercury 2.5 предоставляется со скидкой 80%: $0,04 за миллион входных и $0,15 за миллион выходных токенов.

  • Возможности: настраиваемое рассуждение, параллельные вызовы инструментов и JSON с поддержкой схем.

Возможности: настраиваемое рассуждение, параллельные вызовы инструментов и JSON с поддержкой схем.

С момента запуска Mercury 2 мы наблюдали, как Inception продвигает диффузионные языковые модели на базе инфраструктуры NVIDIA AI. Повышение интеллектуальных возможностей Mercury 2.5 в сочетании с неизменной скоростью и низкой стоимостью отражает то, как быстро новые архитектуры могут превращаться в готовые к производству системы на платформе NVIDIA.

Шрути Копаркар, старший менеджер по продукту, группа ускоренных вычислений в NVIDIA

Mercury в производстве

Поисковые агенты и RAG-конвейеры

Один поисковый запрос может инициировать десятки вызовов модели: планирование поиска, переписывание запросов, переранжирование результатов, структурирование фактов, обобщение источников и проверка ответа. Mercury поддерживает достаточно высокую скорость этих вызовов, чтобы оставаться в рамках одного взаимодействия с пользователем. Несколько ведущих компаний в области поисковой инфраструктуры уже используют его в производстве.

Голосовые агенты и интерактивные приложения

В голосовых сервисах задержка — это не просто деталь инфраструктуры. Это пауза, которую слышит звонящий.

OpenCall создает AI-телефонных агентов, которые обрабатывают живые звонки клиентов. В их производственной нагрузке Mercury сократил медианную задержку ответа модели до 170 миллисекунд.

После того как мы перешли на Mercury, наше время отклика P99 сократилось с нескольких минут до одной секунды, а P50 — с 0,4 секунды до менее чем 0,2. Это значительно быстрее, чем у любого другого провайдера, которого мы видели, включая возможности рассуждения.

Оливер Силверстайн, соучредитель и генеральный директор OpenCall

Вспомогательные агенты для программирования

Агенты для программирования уже распределяют работу между моделями. Одна может планировать или писать код, в то время как другие ищут информацию, запускают инструменты, маршрутизируют запросы, обобщают состояние или сжимают длинную сессию. Эти вспомогательные вызовы происходят постоянно, поэтому задержки и затраты быстро накапливаются.

Augment Code использует Mercury для сжатия контекста, маршрутизации моделей и поиска инструментов MCP. Перенос сжатия на Mercury сократил задержку на 82%, примерно со 150 секунд до 27 секунд, и снизил затраты на 90% при сохранении качества. Сводки поиска инструментов возвращаются менее чем за секунду.

Та же скорость применима и к разработке веб-приложений. Посмотрите, как Mercury 2.5 генерирует работающее веб-приложение для поиска музыки по нескольким подсказкам в демонстрации ниже.

Предварительная версия Mercury Voice и Mercury Router

Наряду с Mercury 2.5 мы анонсируем предварительную версию Mercury Voice и Mercury Router.

  • Mercury Voice обеспечивает время до первого токена (TTFT) менее 170 миллисекунд и представляет собой dLLM, оптимизированную для голосовых агентов с самыми жесткими требованиями к задержке.

Mercury Voice обеспечивает время до первого токена (TTFT) менее 170 миллисекунд и представляет собой dLLM, оптимизированную для голосовых агентов с самыми жесткими требованиями к задержке.

  • Mercury Router понимает входящие запросы с помощью dLLM и направляет их к лучшим моделям (открытым и закрытым), которые предлагают оптимальное сочетание качества, скорости и стоимости.

Mercury Router понимает входящие запросы с помощью dLLM и направляет их к лучшим моделям (открытым и закрытым), которые предлагают оптимальное сочетание качества, скорости и стоимости.

Начало работы

Модели Mercury доступны через наш Inception API, Baseten и OpenRouter. Корпоративные развертывания поддерживают выделенные мощности, автоматическое масштабирование, средства контроля соответствия требованиям и настраиваемое хранение данных.

Попробуйте Mercury 2.5 в чате Попробуйте API с 100 миллионами бесплатных токенов · Прочитайте документацию API

  • Клиенты Baseten: разверните Mercury 2.5 через существующую настройку Baseten.

Клиенты Baseten: разверните Mercury 2.5 через существующую настройку Baseten.

  • Компании Y Combinator: Claim $500 000 в виде бонусов на развертывание.

Компании Y Combinator: $500 000 в виде бонусов на развертывание.

  • Оцениваете Mercury для голосовых сервисов? Мы будем работать с вами, чтобы проверить соответствие рабочей нагрузки и подтвердить производительность в рамках ваших ограничений обслуживания. Свяжитесь с нами.

Оцениваете Mercury для голосовых сервисов? Мы будем работать с вами, чтобы проверить соответствие рабочей нагрузки и подтвердить производительность в рамках ваших ограничений обслуживания. Свяжитесь с нами.

Что дальше

Мы уже начали обучение нашей следующей модели. Это наша самая большая модель на данный момент, и мы планируем выпустить ее в ближайшие месяцы. Наша следующая модель станет качественным скачком без потери скорости и токеновой эффективности диффузии. Это требует прогресса в обучении моделей, выводе, оценках и инфраструктуре. Если это та проблема, над которой вы хотите работать, мы будем рады услышать вас.

Скоро будет больше информации.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Google тестирует возможность покупок на принадлежащей Walmart площадке Flipkart через Gemini и AI Mode в ИндииПресса
Google Gemini

Google тестирует возможность покупок на принадлежащей Walmart площадке Flipkart через Gemini и AI Mode в Индии

OpenAI расширяет проверку поведения моделей после появления новых инцидентов с несанкционированными агентамиПресса
OpenAI

OpenAI расширяет проверку поведения моделей после появления новых инцидентов с несанкционированными агентами

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple Watch
Пресса
Apple

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple Watch

Незащищенные агенты OpenAI опубликовали 53 пользовательских изображения в интернете без ведома лабораторииПресса
OpenAI

Незащищенные агенты OpenAI опубликовали 53 пользовательских изображения в интернете без ведома лаборатории

Proaction увеличивает продажи на 60% и экономит более 75 часов с Codex
OpenAI

Proaction увеличивает продажи на 60% и экономит более 75 часов с Codex

Сообщества вокруг дата-центров Amazon: что происходит рядом с центрами обработки данных по всей территории США
Amazon

Сообщества вокруг дата-центров Amazon: что происходит рядом с центрами обработки данных по всей территории США

Ещё от Inception Labs

Mercury 2 в Azure Foundry — Начало работы
Inception Labs

Mercury 2 в Azure Foundry — Начало работы

Mercury 2: первая модель с механизмом рассуждения, достаточно быстрая для телефонного разговора
Inception Labs

Mercury 2: первая модель с механизмом рассуждения, достаточно быстрая для телефонного разговора

Больше разработчиков. Больше пропускной способности. Улучшенный Mercury 2.
Inception Labs

Больше разработчиков. Больше пропускной способности. Улучшенный Mercury 2.

Mercury 2 для поиска: достаточно быстро, чтобы выполнять сотни запросов
Inception Labs

Mercury 2 для поиска: достаточно быстро, чтобы выполнять сотни запросов