Первая агентная рабочая нагрузка на серверном оборудовании в MLPerf и первая модель с более чем триллионом параметров. Кроме того, пропускная способность выросла на 8,85% на том же оборудовании по сравнению с v6.0.
Масштабирование крупномасштабного инференса сводится к обеспечению стабильной производительности при реальных рабочих нагрузках. Задержка, пропускная способность и узкие места на уровне модели — это основные ключевые показатели эффективности, определяющие, справляются ли ваши производственные развертывания с задачами. Результаты Lambda в MLPerf Inference v6.1 показывают, где именно были устранены пробелы и насколько.
В этом раунде инференса наши результаты в закрытом дивизионе демонстрируют несколько достижений в области выполнения инференса: со стороны оборудования наша система с 4 графическими процессорами NVIDIA Blackwell Ultra обеспечивает лидирующую пропускную способность в режиме Offline для GPT-OSS 120B среди всех заявок с 4 GPU Blackwell Ultra; со стороны программного обеспечения та же система показывает улучшение пропускной способности на 8,85% (Server) и 8,79% (Offline) по сравнению с v6.0 на идентичном оборудовании, что является прямым отражением влияния оптимизаций стека с прошлого раунда. В открытом дивизионе запас памяти нашей системы NVIDIA HGX B200 позволил нам заменить основу агентной рабочей нагрузки Qwen3.6-27B на Kimi K2.6, развернув модель с более чем триллионом параметров и, насколько нам известно, впервые запустив агентную рабочую нагрузку инференса на серверном оборудовании в MLPerf.
Краткий обзор результатов
Модель
Система
Дивизион
Сценарий
Результат
Примечания
GPT-OSS 120B
4 графических процессора NVIDIA Blackwell Ultra
Закрытый
Server + Offline
58 195 / 65 511 токенов/с
Лидирующий результат в режиме Offline среди заявок с 4 GPU NVIDIA Blackwell Ultra, опережающий второе место на 2,38%; улучшение на 8,85% (Server) и 8,79% (Offline) по сравнению с v6.0
Qwen3 VL
NVIDIA HGX B200
Закрытый
Server + Offline
69,41 / 101,56 запросов/с
Единственная заявка с 8× B200 + Qwen3 VL; результат Offline на 28,5% быстрее, чем самая быстрая заявка v6.0 (79,04 зап/с), Server на 2,29% быстрее (против 67,86 зап/с)
Qwen3 VL
4 графических процессора NVIDIA Blackwell Ultra
Закрытый
Server + Offline
64,624 / 71,122 запросов/с
Server занимает второе место из четырех заявок с 4 GPU Blackwell Ultra, с разницей в тысячные доли запроса в секунду от лидера; Offline в пределах 2,9% от лидирующего результата
Kimi K2.6
NVIDIA HGX B200
Открытый
SingleStream (Edge Agentic)
Точность BFCL v4 86,83%; 1007/1007 выполненных шагов воспроизведения
Первое развертывание модели с >1 трлн параметров в MLPerf; первая агентная рабочая нагрузка на серверном оборудовании
Изменения между раундами рассчитаны как (результат v6.1 ÷ результат v6.0 − 1) × 100 на идентичном оборудовании и в одинаковых условиях тестирования.
Основной момент 1: первое тестирование VLM на Lambda
Инференс «зрение-язык» дебютирует в нашей линейке заявок в этом раунде, и мы представили Qwen3-VL-235B-A22B-Instruct как на системе NVIDIA HGX B200, так и на системе с 4 графическими процессорами NVIDIA Blackwell Ultra.
На NVIDIA HGX B200 наша заявка — единственная с использованием Qwen3-VL-235B-A22B-Instruct в этой конфигурации. Результат Offline в 101,56 запросов/с на 28,5% быстрее, чем самая быстрая заявка предыдущего раунда (79,04 зап/с), а результат Server в 69,41 запросов/с превосходит лучший результат предыдущего раунда (67,86 зап/с) на 2,29%. Этот разрыв на сопоставимом оборудовании — результат работы программного стека, а также дополнительной настройки гиперпараметров экспертами Lambda по ML для поиска наиболее оптимальной конфигурации инференса для этой модели.
Для 4 графических процессоров NVIDIA Blackwell Ultra конкуренция выше. Наш результат Server в 64,624 запросов/с занимает второе место из четырех заявок, где весь разброс от первого (64,63 зап/с) до четвертого (64,608 зап/с) места составляет несколько сотых запроса в секунду. Наш результат Offline в 71,122 запросов/с находится в пределах 2,9% от лидирующего результата (73,186 зап/с).
Эта заявка знаменует собой первый результат Lambda в MLPerf для мультимодальной модели (VLM). Помимо самого бенчмарка, мы публикуем этот результат как пример того, как клиенты могут достичь низкозадержечного мультимодального инференса на инфраструктуре Lambda — профиль рабочей нагрузки, который служит прокси для новых вариантов использования, таких как генерация синтетических данных и физический ИИ.
Тестируемая система: NVIDIA HGX B200
- 8× NVIDIA B200-SXM-180GB с использованием vLLM, NVIDIA CUDA версии 13.0, без параллелизма
- Веса NVFP4, кэш FP8 KV
- Два процессора Intel Xeon Platinum 8570 (56 ядер)
Основной момент 2: внедрение бенчмаркинга агентного инференса на серверном оборудовании
Заявка Lambda в открытом дивизионе объединила нашу систему NVIDIA HGX B200 с Kimi K2.6. MLPerf Inference v6.1 — это первый раунд, включающий агентные задачи, и наша заявка — единственная заявка по агентному инференсу на серверном оборудовании. Это также первое развертывание в MLPerf модели с более чем триллионом параметров. Бенчмарк был разработан для одного периферийного ускорителя; мы использовали его, чтобы показать, как выглядит та же агентная обвязка, когда снимаются ограничения по памяти.
Бенчмарк Edge Agentic является новым в v6.1 и был представлен рабочей группой MLCommons Edge LLM для измерения того, насколько хорошо и быстро агентные LLM вызывают инструменты. Он объединяет две рабочие нагрузки: Berkeley Function Calling Leaderboard v4 (BFCL v4) в качестве детерминированного подтверждения точности без участия судьи и записанное воспроизведение агентного кодирования (20 траекторий) для оценки производительности в одном потоке. Эталонная реализация обслуживает Qwen3.6-27B в квантовании Q4_K_M GGUF на одном периферийном ускорителе.
Мы запустили эталонную рабочую нагрузку без изменений, за исключением замены обслуживаемой модели. Имея 1,44 ТБ совокупной HBM в системе HGX B200, мы получили запас для размещения модели примерно в 40 раз больше, поэтому мы выбрали Kimi K2.6 от Moonshot AI — модель типа «смесь экспертов» (MoE) с более чем триллионом параметров, обслуживаемую в FP8 с помощью SGLang при TP=8. Замена модели — это то, что переводит заявку в открытый дивизион; все остальные параметры соответствуют эталонной конфигурации: температура 0, max_new_tokens 1024, однопоточное выполнение (target_concurrency 1) и эталонное сочетание категорий BFCL v4. Рассуждения (reasoning) были отключены на стороне сервера, что соответствует настройке `--reasoning off` эталонного сервера.
Что касается производительности, воспроизведение агентного кодирования завершилось как полностью валидный запуск: 1007 шагов выполнены без единого сбоя, с показателем IoU 0,6158. Средняя задержка на шаг составила 770,8 мс (медиана: 361,0 мс), время до первого токена (TTFT) в среднем составило всего 179,7 мс и было удивительно стабильным, с P99 TTFT 196,7 мс. Из 1007 шагов 1003 были выполнены через вызовы инструментов, что является ожидаемым показателем для агентной рабочей нагрузки.
Отправитель
Размер модели (общее количество параметров)
Система
Средняя задержка (мс)
Общая точность BFCL v4
Lambda (открытый)
1 триллион (Kimi K2.6)
NVIDIA HGX B200
770,8
86,83%
Поставщик A
27 миллиардов (Qwen3.6-27B)
NVIDIA Jetson AGX Thor 128G
1466,0
87,94%
Поставщик B
27 миллиардов (Qwen3.6-27B)
ProLiant DL345 Gen12, 4× RTX PRO 4500
2616,2
86,43%
Поставщик B
27 миллиардов (Qwen3.6-27B)
ProLiant DL145 Gen11, 1× RTX PRO 4500
2758,0
86,13%
Поставщик C
27 миллиардов (Qwen3.6-27B)
NVIDIA DGX Spark (GB10)
3807,7
87,24%
Это сравнение нельзя назвать сопоставимым, поскольку в закрытой категории представлены результаты на периферийном оборудовании с использованием модели 27B, а наша заявка в открытой категории выполнена на оборудовании дата-центра с использованием модели, которая примерно в 40 раз больше. Однако именно в этой асимметрии и заключается смысл: та же агентная обвязка, без ограничений по памяти, обслуживает MoE-модель пограничного масштаба с меньшей задержкой и точностью, находящейся прямо в диапазоне текущих отраслевых стандартов и выше опубликованного эталонного уровня.
Тестируемая система: HGX B200 (открытая категория)
- 8× NVIDIA Blackwell GPU-SXM-180GB, обслуживание через SGLang
- Параллелизация с TP=8 и квантование с FP8, temp=0, max_new_tokens=1024, однопоточный режим
- Идентичное оборудование по сравнению с закрытыми заявками NVIDIA HGX B200
Основной момент 3: пропускная способность MoE, аппаратное и программное обеспечение
Наша заявка на 4 графических процессорах NVIDIA Blackwell Ultra показала 65 511 токенов/с (автономный режим) и 58 195 токенов/с (серверный режим) на модели GPT-OSS 120B. Результат в автономном режиме лидирует среди всех заявок на 4 графических процессорах Blackwell Ultra в этом раунде, опережая второе место на 2,38%, а третье — на 7,8%. В серверном сценарии наш результат находится в пределах 3,9% от самой быстрой заявки (60 466 токенов/с) — это плотная конкуренция, где разрыв между первым и третьим местом составляет менее 4%.
При сравнении с эталоном на 4 графических процессорах Blackwell (оцененным путем деления нашего результата в закрытой категории HGX B200 пополам), 4 графических процессора Blackwell Ultra обеспечивают ускорение в 1,54 раза (автономный режим) и 1,42 раза (серверный режим). Разница обусловлена исключительно аппаратным обеспечением: тот же NVIDIA TensorRT, та же точность NVFP4/FP8 и та же задача. А улучшение на 8,85%/8,79% по сравнению с нашими собственными результатами v6.0 для Blackwell Ultra на идентичном оборудовании достигнуто исключительно за счет программных оптимизаций, проведенных за последние шесть месяцев.
GPT-OSS 120B работает с 5,1 млрд активных параметров на токен. На графических процессорах NVIDIA Blackwell Ultra с 279 ГБ HBM3e на чип вся модель комфортно помещается в память одного графического процессора без необходимости использования тензорного параллелизма или параллелизма экспертов. Кроме того, следующие функции TensorRT обеспечили дальнейший прирост производительности:
Оптимизация
Что она делает
torch.compile
Объединяет операции в ядра Triton
Кусочные графы NVIDIA CUDA
Захватывает 39 вариантов графов, охватывающих фазы префилла и декодирования для различных форм токенов
Графы NVIDIA CUDA только для генерации
Захватывает 14 графов только для декодирования для установившейся генерации при различных размерах пакетов
MNNVL для NVIDIA GB300 NVL72
Флаг, который обеспечивает более высокую мощность и производительность графического процессора, а также более крупные домены NVLink для нескольких узлов в стойке
MoE AutoTuner
Выбирает оптимальную тактику GEMM для каждого эксперта
Определение размера кэша KV (пробный запуск)
Выполняет пробный прямой проход для точного определения размера кэша KV в соответствии с доступной памятью HBM; в оперативной памяти
JIT-компиляция расширений PyTorch C++
Кэширует JIT-компилированное расширение C++, поэтому компиляция выполняется только один раз
Тестируемая система: 4 графических процессора NVIDIA Blackwell Ultra
- 4× графических процессора Blackwell Ultra (279 ГБ HBM3e на GPU)
- NVIDIA TensorRT, веса MXFP4, кэш KV FP8
- GPT-OSS 120B (серверный + автономный режимы)
Что это значит для вашей инфраструктуры ИИ
MLPerf Inference v6.1 продолжает расширение набора тестов, включая рабочие нагрузки, которые реально используют корпоративные команды: рассуждения, мультимодальность, а теперь и агентный вывод, наряду с эталонными тестами обслуживания LLM, которые были основой предыдущих раундов. Lambda продолжает расширять границы, демонстрируя ведущие показатели в нескольких из этих закрытых рабочих нагрузок и представляя новую открытую заявку.
Результаты Lambda охватывают модели, которые корпоративные команды развертывают сегодня и готовятся развертывать завтра. На графических процессорах NVIDIA Blackwell Ultra мы готовы к следующему поколению. На графических процессорах NVIDIA Blackwell мы продолжаем расширять границы возможностей текущего поколения.
Кластеры Lambda 1-Click доступны в конфигурациях от 16 до 1536+ графических процессоров, с еженедельным или многолетним резервированием и без необходимости заключения контрактов для проведения пилотных проектов. Независимо от того, проводите ли вы тестирование новой архитектуры, масштабируете производственное развертывание или исследуете пограничные модели, инфраструктура готова.
Исследуйте Lambda Узнайте больше о кластерах Lambda 1-Click
Детали системы Заявка на 4 графических процессора NVIDIA Blackwell Ultra: 4× NVIDIA Blackwell Ultra, NVIDIA TensorRT, NVFP4/FP8. Закрытые заявки NVIDIA HGX B200: 8× NVIDIA Blackwell GPU SXM 180 ГБ, NVIDIA TensorRT, веса FP4, кэш KV FP8. Открытая заявка NVIDIA HGX B200: идентичное оборудование, агентная рабочая нагрузка Kimi K2.6.
Все результаты подлежат окончательной проверке и публикации MLCommons.










