Сегодня мы с радостью представляем Mercury 2 is available on Azure AI Foundry, самую быструю в мире языковую модель для рассуждений, созданную для того, чтобы сделать ИИ в продакшене мгновенным. Этот релиз объединяет революционную диффузионную архитектуру Inception с готовой к корпоративному использованию инфраструктурой Azure, предоставляя разработчикам доступ к модели, которая обеспечивает как исключительную скорость, так и качество.
Созданная командой разработчиков фундаментальных технологий ИИ, включая Flash Attention, Direct Preference Optimization и первые диффузионные модели для изображений, Mercury представляет собой фундаментальный сдвиг в том, как языковые модели генерируют текст. Разработчики на Azure AI Foundry теперь имеют доступ к модели, которая превосходно проявляет себя в чувствительных к задержкам приложениях, где пользовательский опыт имеет решающее значение.
Новая основа: Диффузия для рассуждений в реальном времени
Mercury 2 не выполняет последовательное декодирование. Она генерирует ответы посредством параллельного уточнения, создавая множество токенов одновременно и сходясь за небольшое количество шагов. Меньше пишущей машинки, больше редактора, перерабатывающего весь черновик за один раз. Результат: генерация в >5 раз быстрее с принципиально иной кривой скорости.
Это преимущество в скорости также меняет компромисс в отношении рассуждений. Сегодня более высокий уровень интеллекта означает больше вычислений во время тестов — более длинные цепочки, больше выборок, больше повторных попыток, — что достигается за счет прямой платы в виде задержки и стоимости. Рассуждения на основе диффузии обеспечивают качество уровня рассуждений в рамках бюджета задержки реального времени.
Производительность: Скорость и Качество
Mercury 2 изменяет кривую качества и скорости для развертывания в продакшене:
- Скорость: 1009 токенов/сек на графических процессорах NVIDIA Blackwell
Скорость: 1009 токенов/сек на графических процессорах NVIDIA Blackwell
- Цена: $0,25/1 млн входных токенов · $0,75/1 млн выходных токенов
Цена: $0,25/1 млн входных токенов · $0,75/1 млн выходных токенов
- Качество: конкурентоспособно с ведущими моделями, оптимизированными по скорости
Качество: конкурентоспособно с ведущими моделями, оптимизированными по скорости
- Функции: настраиваемые рассуждения · контекст 128K · нативное использование инструментов · вывод в формате JSON с проверкой по схеме
Функции: настраиваемые рассуждения · контекст 128K · нативное использование инструментов · вывод в формате JSON с проверкой по схеме
Мы оптимизируем скорость, которую пользователи действительно ощущают: отзывчивость в те моменты, которые важны для пользователя — задержка p95 при высокой параллельности, стабильное поведение от запроса к ответу и стабильная пропускная способность при высокой нагрузке на системы.
Готовность для корпоративного сектора на Azure
Mercury 2 на Azure AI Foundry готова к работе в продакшене «из коробки». Она оснащена окном контекста на 128K токенов для обработки больших документов и поддержания масштабных разговоров, с поддержкой нативного вызова инструментов и структурированного вывода с использованием схем JSON для создания агентских рабочих процессов. API совместим с OpenAI, что делает интеграцию с существующими кодовыми базами бесшовной.
Azure AI Foundry предоставляет инфраструктуру корпоративного уровня, включая сетевую изоляцию, гарантии конфиденциальности данных, обеспечивающие нахождение ваших данных в вашей среде Azure и их неиспользование для обучения, стандарты соответствия Azure, включая SOC2 и HIPAA, а также комплексную наблюдаемость с помощью Azure Monitor и Application Insights.
Варианты использования в реальном мире
Mercury 2 превосходно проявляет себя в чувствительных к задержкам приложениях, где пользовательский опыт имеет решающее значение:
- Написание кода и редактирование: автозаполнение, предложения следующего изменения, рефакторинг, интерактивные агенты кода — рабочие процессы, в которых разработчик находится в процессе принятия решений и любая пауза прерывает поток.
Написание кода и редактирование: автозаполнение, предложения следующего изменения, рефакторинг, интерактивные агенты кода — рабочие процессы, в которых разработчик находится в процессе принятия решений и любая пауза прерывает поток.
- Агентские циклы: агентские рабочие процессы объединяют в цепочки десятки вызовов инференса для каждой задачи. Сокращение задержки каждого вызова не только экономит время, но и меняет то, сколько шагов вы можете позволить себе выполнить и насколько хорошим становится финальный результат.
Агентские циклы: агентские рабочие процессы объединяют в цепочки десятки вызовов инференса для каждой задачи. Сокращение задержки каждого вызова не только экономит время, но и меняет то, сколько шагов вы можете позволить себе выполнить и насколько хорошим становится финальный результат.
- Голос и взаимодействие в реальном времени: голосовые интерфейсы имеют самый жесткий бюджет задержки в ИИ. Mercury 2 делает качество уровня рассуждений жизнеспособным в рамках естественных речевых каденций.
Голос и взаимодействие в реальном времени: голосовые интерфейсы имеют самый жесткий бюджет задержки в ИИ. Mercury 2 делает качество уровня рассуждений жизнеспособным в рамках естественных речевых каденций.
- Поиск и конвейеры RAG: задержки многошагового извлечения, переупорядочивания и суммирования быстро суммируются. Mercury 2 позволяет добавлять рассуждения в поисковый цикл без превышения бюджета задержки.
Поиск и конвейеры RAG: задержки многошагового извлечения, переупорядочивания и суммирования быстро суммируются. Mercury 2 позволяет добавлять рассуждения в поисковый цикл без превышения бюджета задержки.
Развертывание в Azure AI Foundry
Mercury 2 доступна в регионах США и Канады через Azure AI Foundry. Развертывание выполняется просто: подготовьте конечную точку модели и настройте инфраструктуру через унифицированный каталог Azure AI Foundry. Лицензия на программное обеспечение Mercury 2 стоит по фиксированной почасовой ставке, а затраты на вычисления оплачиваются отдельно через вашу учетную запись Azure в зависимости от выделенных вами ресурсов.
Интеграция с Azure AI Foundry
Mercury 2 легко интегрируется с более широкой экосистемой Azure. Выполняйте развертывание с помощью каталога моделей Azure AI Foundry, применяйте Azure AI Content Safety для фильтрации контента, отслеживайте производительность и затраты в режиме реального времени, управляйте доступом с помощью Azure RBAC и управляемых удостоверений, а также создавайте многомодельные приложения с использованием фреймворка агентов Azure.
Начните работу в три шага
- Перейдите в каталог моделей Azure AI Foundry, найдите Mercury 2 и нажмите на карточку модели. Кроме того, вы можете посетить нашу карточку модели
Перейдите в каталог моделей Azure AI Foundry, найдите Mercury 2 и нажмите на карточку модели. Кроме того, вы можете посетить нашу карточку модели
- Нажмите «Использовать эту модель», выберите проект и следуйте подсказкам пользовательского интерфейса для выделения желаемой мощности.
Нажмите «Использовать эту модель», выберите проект и следуйте подсказкам пользовательского интерфейса для выделения желаемой мощности.
- Хотя конфигурация по умолчанию должна подойти для большинства разработчиков, мы рекомендуем выбирать экземпляры ND-H100-v5 для достижения оптимальной скорости. Завершение развертывания должно занять несколько минут.
Хотя конфигурация по умолчанию должна подойти для большинства разработчиков, мы рекомендуем выбирать экземпляры ND-H100-v5 для достижения оптимальной скорости. Завершение развертывания должно занять несколько минут.
Вот и все! Теперь вы сможете начать разработку с вашей недавно созданной конечной точкой API:
На Python
Будущее ИИ в реальном времени
Запуск Mercury на Azure AI Foundry знаменует собой поворотный момент для приложений ИИ в продакшене. Разработчикам больше не нужно выбирать между скоростью и качеством, между оперативностью в реальном времени и возможностями передовых моделей.
Для получения подробной документации, бенчмарков и руководств по интеграции посетите карточку модели Mercury в Azure AI Foundry.










