Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Predstavlyaem mercury 25
Dev48

© 2026 · All rights reserved.

Представляем Mercury 2.5

Источник: Inception Labs

Представляем Mercury 2.5

Источник: Inception Labs

Mercury 2.5 — самая мощная диффузионная LLM на рынке. Она работает со скоростью 1107 токенов/сек и предлагает повышение интеллектуальных возможностей на 40% по сравнению с Mercury 2, что сопоставимо с передовыми моделями, оптимизированными по стоимости.

26 сентября 2026 г.

Сегодня мы выпускаем Mercury 2.5, нашу самую мощную на данный момент модель для промышленного использования. Это значительный шаг вперед в плане качества по сравнению с Mercury 2 при сохранении того же профиля обслуживания с низкой задержкой и низкой стоимостью.

С момента запуска Mercury 2 тысячи разработчиков создали на ее основе свои решения, десятки предприятий внедрили ее в производство, а объем использования вырос более чем на порядок. Сейчас она обслуживает рабочие нагрузки, чувствительные к задержкам, в продуктах для поиска, голосовых технологиях и программировании.

Эти рабочие нагрузки дали нам более четкие сигналы, чем просто бенчмарки. Мы использовали отзывы клиентов и случаи сбоев в работе для уточнения оценок и фокусировки обучения. Mercury 2.5 — первый результат этой обратной связи.

Что изменилось

Mercury 2.5 — самая мощная диффузионная LLM на рынке. Насколько нам известно, это крупнейшая диффузионная языковая модель из когда-либо обученных.

  • Качество: повышение интеллектуальных возможностей на 40% по сравнению с Mercury 2. Сопоставимо с передовыми моделями, оптимизированными по стоимости, такими как GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite и Claude Haiku 4.5.

Качество: повышение интеллектуальных возможностей на 40% по сравнению с Mercury 2. Сопоставимо с передовыми моделями, оптимизированными по стоимости, такими как GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite и Claude Haiku 4.5.

  • Скорость: 1107 токенов в секунду на широко доступных графических процессорах NVIDIA.

Скорость: 1107 токенов в секунду на широко доступных графических процессорах NVIDIA.

  • Контекст: 260 тыс. токенов.

Контекст: 260 тыс. токенов.

  • Цена: $0,20 за миллион входных токенов и $0,75 за миллион выходных токенов. На момент запуска на Mercury 2.5 действует скидка 80%: $0,04 за миллион входных и $0,15 за миллион выходных токенов.

Цена: $0,20 за миллион входных токенов и $0,75 за миллион выходных токенов.

  • На момент запуска на Mercury 2.5 действует скидка 80%: $0,04 за миллион входных и $0,15 за миллион выходных токенов.

На момент запуска на Mercury 2.5 действует скидка 80%: $0,04 за миллион входных и $0,15 за миллион выходных токенов.

  • Возможности: настраиваемое рассуждение, параллельные вызовы инструментов и JSON, соответствующий схеме.

Возможности: настраиваемое рассуждение, параллельные вызовы инструментов и JSON, соответствующий схеме.

С момента запуска Mercury 2 мы наблюдали, как Inception продвигает диффузионные языковые модели на базе инфраструктуры NVIDIA AI. Повышение интеллектуальных возможностей Mercury 2.5 в сочетании с высокой скоростью и низкой стоимостью отражает то, как быстро новые архитектуры могут превращаться в готовые к промышленному использованию системы на платформе NVIDIA.

Шрути Копаркар, старший менеджер по продукту, группа ускоренных вычислений NVIDIA

Mercury в производстве

Поисковые агенты и RAG-конвейеры

Один поисковый запрос может инициировать десятки вызовов модели: планирование поиска, переписывание запросов, переранжирование результатов, структурирование фактов, обобщение источников и проверка ответа. Mercury поддерживает достаточно высокую скорость этих вызовов, чтобы оставаться в рамках одного взаимодействия с пользователем. Несколько ведущих компаний в области поисковой инфраструктуры уже используют ее в производстве.

Голосовые агенты и интерактивные приложения

В голосовых технологиях задержка — это не просто деталь инфраструктуры. Это пауза, которую слышит звонящий.

OpenCall создает AI-телефонных агентов, которые обрабатывают живые звонки клиентов. При работе с их нагрузкой Mercury обеспечила медианную задержку ответа модели около 170 миллисекунд.

После перехода на Mercury наше время отклика P99 сократилось с нескольких минут до одной секунды, а P50 — с 0,4 секунды до менее чем 0,2, что значительно быстрее, чем у любого другого провайдера, которого мы видели, включая задачи на рассуждение.

Оливер Силверстайн, соучредитель и генеральный директор OpenCall

Вспомогательные агенты для программирования

Агенты для программирования уже распределяют работу между моделями. Одна может планировать или писать код, в то время как другие ищут, запускают инструменты, маршрутизируют запросы, обобщают состояние или сжимают длинную сессию. Эти вспомогательные вызовы происходят постоянно, поэтому задержки и затраты быстро накапливаются.

Augment Code использует Mercury для сжатия контекста, маршрутизации моделей и поиска инструментов MCP. Перенос сжатия на Mercury сократил задержку на 82% (примерно со 150 до 27 секунд) и снизил затраты на 90% при сохранении качества. Сводки поиска инструментов возвращаются менее чем за секунду.

Та же скорость применима и к разработке веб-приложений. Посмотрите, как Mercury 2.5 генерирует работающее веб-приложение для поиска музыки по нескольким подсказкам в демо ниже.

Предварительный просмотр Mercury Voice и Mercury Router

Вместе с Mercury 2.5 мы анонсируем предварительную версию Mercury Voice и Mercury Router.

  • Mercury Voice обеспечивает время до первого токена (TTFT) менее 170 миллисекунд и представляет собой dLLM, оптимизированную для голосовых агентов с самыми жесткими требованиями к задержке.

Mercury Voice обеспечивает время до первого токена (TTFT) менее 170 миллисекунд и представляет собой dLLM, оптимизированную для голосовых агентов с самыми жесткими требованиями к задержке.

  • Mercury Router понимает входящие запросы с помощью dLLM и направляет их к лучшим моделям (открытым и закрытым), которые предлагают оптимальное сочетание качества, скорости и стоимости.

Mercury Router понимает входящие запросы с помощью dLLM и направляет их к лучшим моделям (открытым и закрытым), которые предлагают оптимальное сочетание качества, скорости и стоимости.

Начало работы

Модели Mercury доступны через наш API Inception, Baseten и OpenRouter. Корпоративные развертывания поддерживают выделенные мощности, автоматическое масштабирование, средства контроля соответствия требованиям и настраиваемое хранение данных.

Попробуйте Mercury 2.5 в чате Попробуйте API с 100 миллионами бесплатных токенов · Прочитайте документацию API

  • Клиенты Baseten: разверните Mercury 2.5 через существующую настройку Baseten.

Клиенты Baseten: разверните Mercury 2.5 через существующую настройку Baseten.

  • Компании Y Combinator: Claim $500 000 в виде бонусов на развертывание.

Компании Y Combinator: $500 000 в виде бонусов на развертывание.

  • Оцениваете Mercury для голосовых решений? Мы поможем вам протестировать соответствие рабочей нагрузки и подтвердить производительность в рамках ваших ограничений обслуживания. Свяжитесь с нами.

Оцениваете Mercury для голосовых решений? Мы поможем вам протестировать соответствие рабочей нагрузки и подтвердить производительность в рамках ваших ограничений обслуживания. Свяжитесь с нами.

Что дальше

Мы уже начали обучение нашей следующей модели. Это наша самая большая модель на сегодняшний день, и мы планируем выпустить ее в ближайшие месяцы. Наша следующая модель станет скачком в возможностях, не жертвуя при этом скоростью и эффективностью токенов, присущими диффузии. Это требует прогресса в обучении моделей, выводе, оценках и инфраструктуре. Если это та задача, над которой вы хотите работать, мы будем рады услышать вас.

Скоро будет больше информации.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Незащищенные агенты OpenAI опубликовали в интернете 53 изображения пользователей без ведома лабораторииПресса
OpenAI

Незащищенные агенты OpenAI опубликовали в интернете 53 изображения пользователей без ведома лаборатории

Создание производственных агентов с помощью Jev и LangGraph
LangChain

Создание производственных агентов с помощью Jev и LangGraph

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов
LangChain

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактовПресса
OpenAI

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактов

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержекПресса
Tesla

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержек

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое
LangChain

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое

Ещё от Inception Labs

Mercury 2: первая модель рассуждения, достаточно быстрая для телефонного разговора
Inception Labs

Mercury 2: первая модель рассуждения, достаточно быстрая для телефонного разговора

Больше разработчиков. Больше пропускной способности. Улучшенный Mercury 2.
Inception Labs

Больше разработчиков. Больше пропускной способности. Улучшенный Mercury 2.

Mercury 2 для поиска: достаточно быстро, чтобы выполнять сотни запросов
Inception Labs

Mercury 2 для поиска: достаточно быстро, чтобы выполнять сотни запросов