Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Mlperf inference v61 pervye agentnye benchmarki i benchmarki vlm
Dev48

© 2026 · All rights reserved.

MLPerf Inference v6.1: первые агентные бенчмарки и бенчмарки VLM

Источник: Lambda

MLPerf Inference v6.1: первые агентные бенчмарки и бенчмарки VLM

Источник: Lambda

Первая агентная рабочая нагрузка на оборудовании для дата-центров в MLPerf и первая модель с более чем триллионом параметров. Кроме того, рост пропускной способности на 8,85% на том же оборудовании по сравнению с версией v6.0.

25 сентября 2026 г.

Первая агентная рабочая нагрузка на оборудовании для дата-центров в MLPerf и первая модель с более чем триллионом параметров. Кроме того, рост пропускной способности на 8,85% на том же оборудовании по сравнению с версией v6.0.

Масштабирование крупномасштабного инференса сводится к стабильной производительности при реальных рабочих нагрузках. Задержка, пропускная способность и узкие места на уровне моделей — это основные ключевые показатели эффективности, определяющие, успевают ли ваши производственные развертывания за требованиями. Результаты MLPerf Inference v6.1 компании Lambda наглядно показывают, где именно был устранен каждый разрыв и насколько.

В этом раунде инференса результаты в закрытом разделе (closed division) демонстрируют несколько достижений в выполнении инференса: на аппаратной стороне наша система с 4 графическими процессорами NVIDIA Blackwell Ultra обеспечивает ведущую пропускную способность в режиме Offline для GPT-OSS 120B среди всех заявок с 4 графическими процессорами Blackwell Ultra; на программной стороне эта же система демонстрирует прирост пропускной способности на 8,85% (Server) и 8,79% (Offline) по сравнению с v6.0 на идентичном оборудовании, что является прямым отражением влияния оптимизаций стека с прошлого раунда. В открытом разделе (open division) запас памяти нашей системы NVIDIA HGX B200 позволил нам заменить основу агентной рабочей нагрузки инференса с Qwen3.6-27B на Kimi K2.6, развернув модель с более чем триллионом параметров и, насколько нам известно, проведя первую агентную рабочую нагрузку инференса на оборудовании для дата-центров в MLPerf.

Результаты с первого взгляда

Модель

Система

Раздел

Сценарий

Результат

Примечания

GPT-OSS 120B

4 графических процессора NVIDIA Blackwell Ultra

Closed

Server + Offline

58,195 / 65,511 токенов/с

Ведущий результат Offline среди заявок с 4 графическими процессорами NVIDIA Blackwell Ultra, превосходящий второе место на 2,38%; улучшение на 8,85% (Server) и 8,79% (Offline) по сравнению с v6.0

Qwen3 VL

NVIDIA HGX B200

Closed

Server + Offline

69,41 / 101,56 запросов/с

Единственная заявка 8× B200 + Qwen3 VL; Offline на 28,5% быстрее самой быстрой заявки v6.0 (79,04 з/с), Server на 2,29% быстрее (против 67,86 з/с)

Qwen3 VL

4 графических процессора NVIDIA Blackwell Ultra

Closed

Server + Offline

64,624 / 71,122 запросов/с

Server занимает второе место из четырех заявок с 4 Blackwell Ultra, отставая от лидера на тысячные доли запроса в секунду; Offline в пределах 2,9% от лучшего результата

Kimi K2.6

NVIDIA HGX B200

Open

SingleStream (Edge Agentic)

Точность BFCL v4 86,83%; завершено 1 007/1 007 шагов повторного воспроизведения

Первое развертывание модели с >1 трлн параметров в MLPerf; первая агентная рабочая нагрузка на оборудовании дата-центров

Разница между раундами рассчитывается как (результат v6.1 ÷ результат v6.0 − 1) × 100 на идентичном оборудовании и в одинаковых условиях бенчмарка.

Главное событие 1: первое тестирование VLM на оборудовании Lambda

Инференс «зрение-язык» (vision-language) дебютирует в нашем наборе заявок в этом раунде, и мы подали заявку с Qwen3-VL-235B-A22B-Instruct как для системы NVIDIA HGX B200, так и для системы с 4 графическими процессорами NVIDIA Blackwell Ultra.

На NVIDIA HGX B200 наша заявка с Qwen3-VL-235B-A22B-Instruct является единственной для этой конфигурации. Результат Offline в 101,56 запросов/с на 28,5% быстрее самой быстрой заявки из предыдущего раунда (79,04 з/с), а результат Server в 69,41 запросов/с превосходит лучший результат прошлого раунда (67,86 з/с) на 2,29%. От раунда к раунду на сопоставимом оборудовании эта разница достигается за счет работы программного стека, а также дополнительной тонкой настройки гиперпараметров экспертами Lambda по ML для поиска наиболее оптимальной конфигурации инференса для этой модели.

На 4 графических процессорах NVIDIA Blackwell Ultra борьба плотнее. Наш результат Server в 64,624 запросов/с занимает второе место из четырех заявок в условиях, когда весь диапазон от первого (64,63 з/с) до четвертого места (64,608 з/с) составляет сотые доли запроса в секунду. Наш результат Offline в 71,122 запросов/с находится в пределах 2,9% от лидирующего результата (73,186 з/с).

Эта заявка знаменует собой первый результат Lambda в MLPerf для модели «зрение-язык» (VLM). Помимо самого бенчмарка, мы публикуем этот результат в качестве тематического исследования, демонстрирующего, как клиенты могут достичь многомодального инференса с низкими задержками на инфраструктуре Lambda — профиля рабочей нагрузки, который служит прокси для новых сценариев использования, таких как генерация синтетических данных и физический ИИ.

Тестируемая система: NVIDIA HGX B200

  • 8× NVIDIA B200-SXM-180GB с использованием vLLM, версия NVIDIA CUDA 13.0, без распараллеливания
  • Веса NVFP4, кэш KV в формате FP8
  • Два процессора Dual Intel Xeon Platinum 8570 (56 ядер)

Главное событие 2: внедрение бенчмаркинга агентного инференса на оборудовании дата-центров

Заявка Lambda в открытом разделе объединила нашу систему NVIDIA HGX B200 с моделью Kimi K2.6. MLPerf Inference v6.1 — это первый раунд, включающий агентные задачи, и наша заявка является единственной заявкой агентного инференса на оборудовании дата-центров. Это также первое развертывание в MLPerf модели с более чем триллионом параметров. Бенчмарк был разработан для одного периферийного ускорителя; мы использовали его, чтобы показать, как выглядит та же агентная обвязка, когда ограничения по памяти сняты.

Периферийный агентный бенчмарк (Edge Agentic) является новым в версии v6.1, он представлен рабочей группой MLCommons Edge LLM Taskforce для измерения того, насколько качественно и быстро агентные LLM вызывают инструменты. Он объединяет две рабочие нагрузки: Berkeley Function Calling Leaderboard v4 (BFCL v4) в качестве детерминированного подтверждения точности без участия судьи и запись повторного воспроизведения агентного кодирования (20 траекторий) для производительности в рамках одного потока. Эталонная реализация обслуживает Qwen3.6-27B в качестве квантования Q4_K_M GGUF на одном периферийном ускорителе.

Мы запустили эталонную рабочую нагрузку без изменений, за исключением замены обслуживаемой модели. Имея 1,44 ТБ совокупной памяти HBM в системе HGX B200, у нас был запас для размещения модели примерно в 40 раз больше, поэтому мы выбрали Kimi K2.6 от Moonshot AI, модель типа «мире-экспертов» (mixture-of-experts) с более чем триллионом параметров, обслуживаемую в FP8 с помощью SGLang при TP=8. Замена модели переносит этот тест в открытый раздел; все остальные параметры соответствуют эталонной конфигурации: температура 0, max_new_tokens 1024, однопоточное выполнение (target_concurrency 1) и эталонное соотношение категорий BFCL v4. Рассуждения (reasoning) были отключены на стороне сервера, что соответствует настройке `--reasoning off` эталонного сервера.

С точки зрения производительности, повторное воспроизведение агентного кодирования завершилось как полностью корректный запуск: 1,007 вызовов выполнены без единого сбоя, со скользящим показателем IoU 0,6158. Средняя задержка на один шаг составила 770,8 мс (медиана: 361,0 мс), а время до получения первого токена (TTFT) в среднем составило всего 179,7 мс и было поразительно стабильным со значением P99 TTFT на уровне 196,7 мс. Из 1,007 шагов 1,003 были выполнены через вызовы инструментов, что ожидаемо для агентной рабочей нагрузки.

Отправитель

Размер модели (всего параметров)

Система

Средняя задержка (мс)

Общая точность BFCL v4

Lambda (open)

1 триллион (Kimi K2.6)

NVIDIA HGX B200

770,8

86,83%

Поставщик A

27 миллиардов (Qwen3.6-27B)

NVIDIA Jetson AGX Thor 128G

1 466,0

87,94%

Поставщик B

27 миллиардов (Qwen3.6-27B)

ProLiant DL345 Gen12, 4× RTX PRO 4500

2 616,2

86,43%

Поставщик B

27 миллиардов (Qwen3.6-27B)

ProLiant DL145 Gen11, 1× RTX PRO 4500

2 758,0

86,13%

Поставщик C

27 миллиардов (Qwen3.6-27B)

NVIDIA DGX Spark (GB10)

3 807,7

87,24%

Это некорректное сравнение в формате «яблок к яблокам», поскольку те результаты представляют собой заявки в закрытом дивизионе на периферийном оборудовании, выполняющие модель размером 27B, в то время как наша заявка относится к открытому дивизиону на датацентровом оборудовании, выполняющем модель примерно в 40 раз крупнее. Тем не менее, эта асимметрия и есть суть дела: та же самая агентная обвязка без ограничения по памяти обслуживает MoE фронтирного масштаба с меньшей задержкой, с точностью, которая находится точно в диапазоне отрасли и выше опубликованного справочного базиса.

Система, участвующая в тестировании: HGX B200 (открытый дивизион)

  • 8× NVIDIA Blackwell GPU-SXM-180GB, обслуживание с помощью SGLang
  • Параллелизация с TP=8 и квантование с FP8, temp=0, max_new_tokens=1024, один поток
  • Идентичное аппаратное обеспечение по сравнению с закрытыми заявками NVIDIA HGX B200

Основной момент 3: Пропускная способность MoE, аппаратное и программное обеспечение

Наша заявка для 4 графических процессоров NVIDIA Blackwell Ultra показала 65 511 токенов/с (в автономном режиме) и 58 195 токенов/с (в серверном режиме) на GPT-OSS 120B. Результат в автономном режиме превосходит все заявки для 4 графических процессоров Blackwell Ultra в этом раунде, опережая второе место на 2,38% и третье место на 7,8%. В серверном сценарии наш результат находится в пределах 3,9% от самого быстрого предложения (60 466 токенов/с) в условиях жесткой борьбы трех участников, где разрыв между первым и третьим местами составляет менее 4%.

По сравнению с базовым показателем из 4 графических процессоров Blackwell (оцененным путем деления пополам нашего результата закрытого дивизиона HGX B200), 4 графических процессора Blackwell Ultra обеспечивают ускорение в 1,54 раза (в автономном режиме) и в 1,42 раза (в серверном режиме). Этот прирост обусловлен исключительно «железом»: те же NVIDIA TensorRT, та же точность NVFP4/FP8 и та же задача. А улучшение на 8,85%/8,79% по сравнению с нашими собственными результатами для v6.0 Blackwell Ultra на идентичном оборудовании достигнуто исключительно за счет программных улучшений за последние шесть месяцев.

GPT-OSS 120B работает с 5,1 млрд активных параметров на токен. На графических процессорах NVIDIA Blackwell Ultra с 279 ГБ памяти HBM3e на чип вся модель целиком умещается в памяти одного графического процессора без необходимости использования тензорного параллелизма или параллелизма экспертов. Кроме того, следующие функции TensorRT обеспечили дополнительный рост производительности:

Оптимизация

Что она делает

torch.compile

Объединяет операции в ядра Triton

Кусочные графы NVIDIA CUDA

Захватывает 39 вариантов графов, охватывающих фазы префилла и декодирования для различных форм токенов

Графы NVIDIA CUDA только для генерации

Захватывает 14 графов только для декодирования для генерации в установившемся режиме для различных размеров батча

MNNVL для NVIDIA GB300 NVL72

Флаг, который обеспечивает более высокую мощность и производительность графического процессора, а также более крупные домены NVLink на нескольких узлах в пределах стойки

MoE AutoTuner

Выбирает оптимальные тактики GEMM для каждого эксперта

Определение размера кэша KV (пробный пропуск)

Выполняет пробный проход прямой передачи для точного определения размера кэша KV в соответствии с доступной памятью HBM; в оперативной памяти

JIT-компиляция расширения PyTorch C++

Кэширует скомпилированное с помощью JIT расширение C++, поэтому компиляция имеет разовую стоимость

Система, участвующая в тестировании: 4 графических процессора NVIDIA Blackwell Ultra

  • 4× графических процессора Blackwell Ultra (279 ГБ HBM3e на один графический процессор)
  • NVIDIA TensorRT, веса MXFP4, кэш KV FP8
  • GPT-OSS 120B (серверный + автономный режимы)

Что это значит для вашей инфраструктуры ИИ

MLPerf Inference v6.1 продолжает расширение набора тестов в сторону рабочих нагрузок, которые действительно используют корпоративные команды: рассуждения, мультимодальность и теперь агентный вывод наряду с бенчмарками обслуживания LLM, которые были основой предыдущих раундов. Lambda продолжает раздвигать границы, представляя ведущие результаты в нескольких из этих закрытых рабочих нагрузок и предлагая новаторскую открытую заявку.

Результаты Lambda охватывают модели, которые корпоративные команды развертывают сегодня и готовятся развернуть завтра. На графических процессорах NVIDIA Blackwell Ultra мы готовы к следующему поколению. На графических процессорах NVIDIA Blackwell мы все еще раздвигаем границы возможностей текущего поколения.

Кластеры Lambda 1-Click доступны в конфигурациях от 16 до 1536+ графических процессоров с еженедельными или многолетними резервированиями и без необходимости заключения контрактов для реализации концептуального проекта (PoC). Независимо от того, проводите ли вы бенчмаркинг новой архитектуры, масштабируете производственное развертывание или исследуете фронтирные модели, инфраструктура готова.

Изучите Lambda Узнайте о кластерах Lambda 1-Click

Детали системы Заявка для 4 графических процессоров NVIDIA Blackwell Ultra: 4× графических процессора NVIDIA Blackwell Ultra, NVIDIA TensorRT, NVFP4/FP8. Закрытые заявки NVIDIA HGX B200: 8× графических процессоров NVIDIA Blackwell SXM 180 ГБ, NVIDIA TensorRT, веса FP4, кэш KV FP8. Открытая заявка NVIDIA HGX B200: идентичное оборудование, агентная рабочая нагрузка Kimi K2.6.

Все результаты подлежат окончательной проверке и публикации MLCommons.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Tesla готовится к масштабному производству тяжелых грузовиков Semi с открытием завода в НевадеПресса
Tesla

Tesla готовится к масштабному производству тяжелых грузовиков Semi с открытием завода в Неваде

Waymo быстро масштабируется. Вот что показывают данные автопарка.Пресса
Waymo

Waymo быстро масштабируется. Вот что показывают данные автопарка.

Meta опережает OpenAI на рынке потребительских ИИ-устройств, но стратегия Цукерберга пока не доказала свою эффективность
Пресса
OpenAI

Meta опережает OpenAI на рынке потребительских ИИ-устройств, но стратегия Цукерберга пока не доказала свою эффективность

Скучный ИИ: почему ваш погрузчик важнее вашего чат-бота
DataRobot

Скучный ИИ: почему ваш погрузчик важнее вашего чат-бота

Создание мультимодальных моделей для пространственного мышления
Lambda

Создание мультимодальных моделей для пространственного мышления

Генеральный директор ElevenLabs — о маржинальности, сроках IPO и предупреждении клиентов о том, что они говорят с ботомПресса
ElevenLabs

Генеральный директор ElevenLabs — о маржинальности, сроках IPO и предупреждении клиентов о том, что они говорят с ботом

Ещё от Lambda

Создание мультимодальных моделей для пространственного мышления
Lambda

Создание мультимодальных моделей для пространственного мышления

От структур к динамике: масштабирование ИИ для молекулярной динамики в разработке лекарств
Lambda

От структур к динамике: масштабирование ИИ для молекулярной динамики в разработке лекарств

Замкнуть цикл: агентная оценка для базовых моделей редактирования изображений
Lambda

Замкнуть цикл: агентная оценка для базовых моделей редактирования изображений

Lambda подписала обязательство Белого дома по защите потребителей электроэнергии, подтвердив приверженность интересам местных сообществ и надежности энергосистемы
Lambda

Lambda подписала обязательство Белого дома по защите потребителей электроэнергии, подтвердив приверженность интересам местных сообществ и надежности энергосистемы