Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Amd predstavlyaet svoi samye masshtabnye rezultaty v teste mlperf inference 61
Dev48

© 2026 · All rights reserved.

AMD представляет свои самые масштабные результаты в тесте MLPerf® Inference 6.1

Источник: AMD

AMD представляет свои самые масштабные результаты в тесте MLPerf® Inference 6.1

Источник: AMD

Узнайте, как графические процессоры AMD Instinct™ демонстрируют лидерство в MLPerf® Inference 6.1, производительность PCIe®, рекордную пропускную способность токенов на 512 графических процессорах и подтверждение со стороны партнеров.

25 сентября 2026 г.

Почему MLPerf Inference 6.1 знаменует собой новый этап для AMD Instinct

Заявка AMD в MLPerf Inference 6.1 является самой масштабной для компании на сегодняшний день: она расширилась с трех семейств моделей в предыдущем раунде MLPerf 6.0 Inference до шести в текущем, охватывая графические процессоры AMD Instinct™ MI355X и MI350X, а также нашу совершенно новую карту PCIe MI350P. Заявка охватывает инференс для языковых моделей, рассуждений, генерации текста в видео и рекомендательных систем, что дает читателям более широкое представление о производительности платформы для различных моделей и форматов развертывания.

Широта охвата — это лишь начало истории. Тот же аппаратный комплекс на базе графических процессоров AMD Instinct MI355X продемонстрировал существенно более высокую производительность, чем цикл MLPerf назад. Кроме того, заявка компании Crusoe на базе 512 графических процессоров для модели GPT-OSS-120B достигла наивысшей совокупной пропускной способности токенов за всю историю MLPerf. Семь партнеров близко воспроизвели результаты AMD, что подтверждает масштабируемость этой производительности за пределы эталонной системы.

Три технических вехи помогают объяснить, что изменилось в этом раунде:

  • Больше производительности от того же аппаратного обеспечения AMD Instinct MI355X: в рамках одного цикла MLPerf непрерывная оптимизация программного обеспечения AMD ROCm™ увеличила пропускную способность GPT-OSS-120B на 8 GPU, снизила задержку Wan-2.2 и повысила пропускную способность кластера при меньшем количестве GPU.
  • Лидирующая производительность на графических процессорах AMD Instinct MI355X и MI350P: графические процессоры AMD Instinct MI355X превзошли результаты NVIDIA B200 и B300 для GPT-OSS-120B на 8 GPU, а также результаты NVIDIA GB200 на 72 GPU. В своем первом раунде MLPerf графические процессоры AMD Instinct MI350P опередили выбранные решения NVIDIA RTX PRO 6000 Server Edition и H200 NVL.
  • Рекордная пропускная способность токенов и инференс производственного масштаба с эффективным масштабированием: на 72 графических процессорах AMD Instinct MI355X достиг эффективности масштабирования 95% для модели GPT-OSS-120B. Отдельно компания Crusoe обеспечила рекордную совокупную пропускную способность токенов на 512 GPU, достигнув 5,75 млн офлайн-токенов в секунду для GPT-OSS-120B и 2,90 млн для DeepSeek-R1.

В совокупности эти результаты показывают переход платформы от ранней адаптации рабочих нагрузок к более широкому, воспроизводимому инференсу производственного масштаба.

Единая основа AMD CDNA 4 для двух путей развертывания

Графические процессоры AMD Instinct™ MI355X и карты PCIe® MI350P созданы на базе архитектуры AMD CDNA™ 4, но они отвечают различным требованиям к инфраструктуре. Графический процессор AMD MI355X обеспечивает масштабируемую основу для систем с максимальной пропускной способностью и крупнейших кластеров в данной заявке. Карта AMD MI350P переносит то же архитектурное поколение в двухслотовый форм-фактор PCIe, предназначенный для развертывания в существующих средах центров обработки данных.

Увеличение изображения

Графический процессор AMD Instinct MI355X объединяет 256 вычислительных блоков, 288 ГБ памяти HBM3E и пропускную способность памяти 8 ТБ/с. Он обеспечивает до 10,1 Пфлопс пиковой теоретической матричной производительности MXFP4 и MXFP6 в форм-факторе OAM и на платформе UBB 2.0. Эта конфигурация предназначена для плотных систем, где максимальная пропускная способность инференса и масштабируемость являются главными требованиями.

Карта PCIe AMD Instinct MI350P предоставляет 128 вычислительных блоков, 144 ГБ памяти HBM3E и пропускную способность памяти 4 ТБ/с. Она обеспечивает до 4,6 Пфлопс пиковой теоретической матричной производительности MXFP4 и MXFP6 в двухслотовом форм-факторе PCIe 5.0. Это важный выбор в портфолио, поскольку не все клиенты строят ИИ-системы одинаково. Графический процессор AMD Instinct MI355X поддерживает среды, где приоритетом является максимальная масштабируемость производительности, в то время как карта PCIe AMD Instinct MI350P обеспечивает более прямой путь к производительности инференса на базе AMD CDNA™ 4 в существующей инфраструктуре ЦОД. Вместе серия AMD Instinct MI350 поддерживает обе модели развертывания.

Этот выбор определяет дальнейшие результаты в заявке. Аппаратное обеспечение задает доступные вычислительные мощности, объем памяти и формат развертывания. Последующие результаты показывают, как непрерывная работа над ПО AMD ROCm™ и экосистемой инференса с открытым исходным кодом позволила извлечь больше производительности из этой базы, включая измеримый прирост на тех же графических процессорах AMD Instinct MI355X между раундами MLPerf.

Ключевые моменты заявки AMD в MLPerf Inference 6.1

Заявка AMD в MLPerf® Inference 6.1 базируется на трех ключевых подтверждениях: рост производительности на том же аппаратном обеспечении, широкое лидерство в путях развертывания AMD Instinct™ MI355X и MI350P, а также инференс производственного масштаба с рекордной совокупной пропускной способностью токенов.

1. Те же графические процессоры AMD Instinct™ MI355X обеспечивают более высокую производительность

Увеличение изображения

Менее чем за шесть месяцев непрерывная оптимизация программного обеспечения увеличила производительность графических процессоров AMD Instinct™ MI355X. На тех же 8 графических процессорах AMD Instinct™ MI355X совместная работа над ПО AMD ROCm™ и экосистемой инференса с открытым исходным кодом увеличила пропускную способность GPT-OSS-120B на 28% в режиме Offline и на 38% в режиме Server, в то время как производительность Wan-2.2 SingleStream выросла на 70%.

В масштабе кластера этот эффект становится еще более очевидным. 72 графических процессора AMD Instinct MI355X в раунде MLPerf Inference 6.1 обеспечили большую пропускную способность GPT-OSS-120B, чем 94 графических процессора в предыдущем раунде 6.0. Поколение GPU осталось прежним, но большая часть его потенциала воплотилась в полезную работу по инференсу. Это дает инфраструктурным командам дополнительный запас производительности развернутых систем перед расширением кластера.

Увеличение изображения

Wan-2.2 превращает историю платформы в историю зрелости рабочих нагрузок. Рабочая нагрузка перешла от дебютной заявки Open в раунде MLPerf Inference 6.0 к лидирующей заявке Closed в 6.1. Графический процессор AMD Instinct MI355X продемонстрировал на 18% более высокую производительность в режиме Offline и на 11% более высокую в режиме SingleStream по сравнению с выбранной заявкой NVIDIA B300.

Важное значение имеет скорость этого прогресса. Новая рабочая нагрузка прошла путь от начальной адаптации до лидирующего стандарта результата всего за один цикл MLPerf. В этом ценность программной платформы, которая продолжает развиваться после выпуска оборудования: новые рабочие нагрузки совершенствуются, пути обработки запросов улучшаются, а развернутые системы продолжают выполнять все больше полезной работы.

2. Графические процессоры AMD Instinct™ MI355X и MI350P демонстрируют широкое лидерство в рабочих нагрузках ИИ-инференса

Раунд MLPerf Inference 6.1 демонстрирует широту лидерства производительности AMD в языковых нагрузках, генерации текста в видео и рекомендательных системах, а также в различных сценариях обслуживания запросов.

Увеличение изображения

GPT-OSS-120B является наиболее наглядной отправной точкой. На стандартной 8-GPU системе AMD Instinct MI355X компания AMD опередила выбранные результаты NVIDIA B200 и B300 как в режиме Offline, так и в режиме Server. Это имеет значение, так как узел с восемью графическими процессорами является практическим строительным блоком инфраструктуры инференса.

Увеличение изображения

Увеличение изображения

Другие рабочие нагрузки расширяют доказательную базу. Wan-2.2 демонстрирует быструю программную зрелость, Llama 2 70B добавляет покрытие для пакетного, серверного и интерактивного инференса, а DLRM v3 распространяет платформу на рекомендательные рабочие нагрузки, используемые для ранжирования и персонализации.

Лидерство в производительности также распространяется на другую модель инфраструктуры. В своем первом раунде MLPerf карта PCIe® AMD Instinct MI350P представила пять рабочих нагрузок в категории Closed и показала лидирующие результаты по сравнению с выбранными заявками NVIDIA RTX PRO 6000 Server Edition и H200 NVL.

Увеличение изображения

Увеличение изображения

Это меняет характер обсуждения развертывания. GPU AMD Instinct MI355X предназначен для высокоплотных систем с возможностью масштабирования, в то время как GPU AMD Instinct MI350P предоставляет дата-центрам, построенным на базе двуслотовых серверов PCIe, еще один путь к достижению производительности инференса на базе AMD CDNA™ 4. Команды могут оценить платформу, которая соответствует их текущим требованиям к энергопотреблению, охлаждению и серверной архитектуре, вместо того чтобы рассматривать один форм-фактор как универсальное решение для любой среды.

Что производительность может означать на практике

Увеличение изображения

Исследование Signal65, проведенное по заказу AMD, помогает перевести показатели производительности из бенчмарков в операционные термины. По результатам протестированных рабочих нагрузок в исследовании сообщается о более низкой стоимости обработки одного документа, большем количестве токенов на доллар и обслуживании большего числа пользователей в рамках заданного целевого значения задержки.

Эти выводы объясняют, почему пропускная способность имеет значение. Бизнес-вопрос сводится к тому, какой объем полезной работы инфраструктура может выполнить в рамках бюджета и какой спрос она может обслужить, не выходя за рамки целевого времени отклика приложения.

3. Рекордная пропускная способность токенов и инференс производственного масштаба с эффективным масштабированием

Высокая производительность на одном узле имеет значение только в том случае, если добавление новых GPU приводит к росту полезной пропускной способности. Компания AMD расширила конфигурацию GPT-OSS-120B с 8 до 72 GPU AMD Instinct MI355X, что представляет собой девятикратное увеличение количества графических процессоров при сохранении 95% эффективности масштабирования как в режиме Offline, так и в Server.

Увеличение изображения

Этот результат показывает, что платформа может наращивать значительную емкость инференса без существенной потери производительности из-за накладных расходов на коммуникацию, планирование и распределение рабочей нагрузки. GPU AMD Instinct MI355X не просто быстры на одном узле; они продолжают обеспечивать высокую производительность по мере превращения развертываний в реальные многоузловые кластеры инференса. При использовании 512 GPU фокус смещается с эффективности масштабирования на совокупную пропускную способность. Благодаря Crusoe модель GPT-OSS-120B достигла 5,75 млн токенов в секунду в режиме Offline и 5,39 млн токенов в секунду в режиме Server, что является наивысшим показателем совокупной пропускной способности токенов за всю историю MLPerf.

Результат для DeepSeek-R1 составил 2,90 млн токенов в секунду в режиме Offline и 2,41 млн в режиме Server, что установило рекорд совокупной пропускной способности токенов для DeepSeek-R1 за всю историю MLPerf.

Увеличение изображения

В совокупности эти три определяющих момента демонстрируют платформу, которая улучшает показатели на том же самом «железе», обеспечивает лидирующие позиции в различных сценариях развертывания (масштабирование и PCIe®), эффективно масштабируется с восьми до 72 GPU и достигает рекордной совокупной пропускной способности токенов при использовании 512 GPU.

Производительность AMD Instinct™, воспроизведенная в партнерских системах

Dell Technologies и MangoBoost представили первый гетерогенный результат инференса на 32 GPU, объединив 16 GPU AMD Instinct™ MI300X в Корее и 16 GPU AMD Instinct MI355X в США в единую точку обслуживания модели GPT-OSS-120B. Система продемонстрировала 285 454 токена в секунду в режиме Offline и 253 501 токен в секунду в режиме Server.

Значение этого достижения заключается в том, как была объединена такая вычислительная мощность. Существующие системы с GPU AMD Instinct MI300X и более новые системы с GPU AMD Instinct MI355X совместно обслуживали один и тот же процесс инференса, демонстрируя возможность объединения ресурсов разных поколений GPU-систем и географических локаций, а не управления каждым парком как изолированной средой.

Увеличение изображения

Эта гибкость является частью более широкой истории партнерства. Компании Dell Technologies, Oracle, Hewlett Packard Enterprise, Supermicro, MangoBoost, Crusoe и MiTAC представили результаты на базе систем с GPU AMD Instinct MI350X, MI350P и MI355X. Среднее значение сопоставимых результатов партнеров для GPU AMD MI355X отклонялось от результатов AMD в пределах 4%, а некоторые результаты совпали с эталонным показателем AMD или даже немного превзошли его.

Результат бенчмарка становится более ценным, когда его можно воспроизвести за пределами оригинальной лаборатории. Эти партнерские результаты показывают, что стабильная производительность AMD Instinct переносится на различные системы, что дает командам инфраструктуры больше уверенности при оценке вариантов развертывания от OEM-производителей, облачных провайдеров и разработчиков программного обеспечения.

Выбор правильного профиля производительности для дата-центра

Не каждое развертывание инференса ориентировано на максимальную пропускную способность. Энергопотребление, охлаждение и существующая инфраструктура могут быть не менее важны, когда команды решают, сколько производительности GPU задействовать в каждом сервере.

В выбранных рабочих нагрузках GPT-OSS, Llama, Wan и DLRM платформа с восемью GPU AMD Instinct™ MI350X сохранила примерно 80% производительности платформы AMD Instinct MI355X. GPU AMD Instinct MI355X имеет на 40% более высокий показатель TDP в данном сравнении, что отражает его позиционирование в качестве решения с максимальной производительностью в портфолио.

Увеличение изображения

Это формирует два профиля производительности:

  • GPU AMD Instinct MI350X: вариант с более низким энергопотреблением (TDP) для развертываний, где дизайн системы определяется требованиями к питанию, охлаждению и гибкости инфраструктуры.
  • GPU AMD Instinct MI355X: вариант с максимальной производительностью для развертываний, где пропускная способность инференса является главным требованием.

Как ПО AMD ROCm™ связывает прогресс в бенчмарках с производственным ИИ

Программное обеспечение AMD ROCm™ объединяет всю историю MLPerf® Inference 6.1. ПО AMD ROCm версии v7 обеспечило каждый результат в поданной заявке, включая более высокую производительность на тех же GPU AMD Instinct™ MI355X, переход от первоначальной поддержки Wan-2.2 к закрытой заявке (Closed), 95% эффективности масштабирования на 72 GPU и партнерские результаты, которые практически не уступали показателям AMD.

Эти вехи представляют собой различные этапы жизненного цикла одной и той же рабочей нагрузки. Сначала модель должна корректно запускаться, затем ее операции внимания (attention), GEMM, использование KV-кеша, планирование и пути передачи данных должны быть оптимизированы под целевую систему. Результатом является не просто более высокий балл в бенчмарке. Это рабочая нагрузка, которая может более эффективно использовать развернутое «железо» и обеспечивать сопоставимые результаты как на системах AMD, так и на партнерских системах.

Увеличение изображения

ROCm 10.0 опирается на этот фундамент, предлагая более понятный путь к продакшену. Команды могут начать с привычного ПО vLLM и SGLang, использовать инструменты ROCm.AI для диагностики производительности и переносить единую программную основу с отдельной системы на многоузловую инфраструктуру. Локальное профилирование и оптимизация также дают разработчикам более наглядное представление о том, на что уходит время при обработке запросов.

Главная идея здесь — преемственность: развернуть рабочую нагрузку, улучшить путь обслуживания, расширить масштабы развертывания и воспроизвести результат. ROCm обеспечивает программную основу на каждом из этих этапов.

Ежегодный цикл создает следующую главу линейки AMD Instinct™ для инференса

Ценность дорожной карты AMD Instinct заключается не просто в последовательности названий продуктов. Это четкий цикл развития платформы, продемонстрированный в рамках раунда 6.1 MLPerf® Inference.

Увеличение изображения

GPU AMD Instinct MI300X заложили фундамент в 2023 году. GPU AMD Instinct MI325X расширили эту платформу за счет памяти HBM3E и возросшей вычислительной мощности в 2024 году, за чем последовала серия AMD Instinct MI350 в 2025 году. Текущие результаты показывают, как этот фундамент продолжает приносить пользу благодаря программной оптимизации, более широкой поддержке рабочих нагрузок и большему выбору вариантов развертывания.

Дорожная карта продолжается серией ускорителей AMD Instinct MI400 в 2026 году с памятью HBM4 и увеличенной вычислительной мощностью, за которой в 2027 году последует серия MI500 и архитектура нового поколения. Для инфраструктурных команд такой темп обеспечивает более четкий путь от развертываемых сегодня систем к требованиям к вычислениям и памяти для будущих рабочих нагрузок инференса.

Итоги

Заявка AMD на участие в раунде MLPerf® Inference 6.1 знаменует собой важный шаг вперед для инференса на базе ИИ AMD Instinct. Компания AMD обеспечила более высокую производительность на том же аппаратном обеспечении графических процессоров AMD Instinct™ MI355X, лидерство в отдельных сравнениях графических процессоров AMD Instinct MI355X и MI350P, 95-процентную эффективность масштабирования на 72 графических процессорах, рекордную общую пропускную способность токенов в заявке для 512 графических процессоров от компании Crusoe, а также результаты семи парттеров по экосистеме.

Результаты также демонстрируют формирование более масштабной платформы. Графические процессоры AMD Instinct обеспечивают аппаратную основу для масштабируемых, энергоэффективных (с более низким TDP) и PCIe®-развертываемых решений. ПО AMD ROCm™ объединяет оптимизацию рабочих нагрузок, непрерывную оптимизацию, многоузловое выполнение и воспроизводимость на партнерских системах.

Для читателей, интересующихся более глубокими техническими аспектами, в двух новых блогах AMD ROCm представлена дополнительная информация о заявке на участие в MLPerf Inference 6.1. В статье «AMD Instinct™ GPUs MLPerf Inference v6.1 Submission» рассматриваются программные оптимизации и оптимизации рабочих нагрузок, лежащие в основе результатов, а в статье «Reproducing the AMD MLPerf Inference v6.1 submission result» объясняется, как воспроизвести бенчмарки на оборудовании AMD Instinct. В совокупности эти блоги позволяют поближе познакомиться с программной основой AMD ROCm, лежащей в основе заявки, и подтверждают приверженность AMD принципам открытости, прозрачности и воспроизводимости в сфере ИИ-инференса.

Примечания

Примечания

  • Предупреждение AMD — https://www.amd.com/en/legal/copyright.html
  • Для получения дополнительной информации о результатах MLPerf Inference 6.1 по состоянию на 16 сентября 2026 г. посетите сайт: https://mlcommons.org/benchmarks/inference-datacenter/.
  • Название и логотип MLPerf являются зарегистрированными и незарегистрированными товарными знаками MLCommons Association в США и других странах. Все права защищены. Несанкционированное использование строго запрещено. Дополнительную информацию см. на сайте www.mlcommons.org.

ОБЩИЙ ОТКАЗ ОТ ОТВЕТСТВЕННОСТИ

Информация, содержащаяся в этом документе, носит исключительно информационный характер и может быть изменена без предварительного уведомления. Несмотря на то, что при подготовке этого документа были приняты все меры предосторожности, он может содержать технические неточности, пропуски и опечатки, и компания AMD не берет на себя обязательств по обновлению или иному исправлению этой информации. Advanced Micro Devices, Inc. не делает никаких заявлений и не дает никаких гарантий в отношении точности или полноты содержимого этого документа и не несет никакой ответственности, включая подразумеваемые гарантии ненарушения прав, товарной пригодности или пригодности для определенных целей, в отношении работы или использования аппаратного обеспечения, программного обеспечения или других продуктов AMD, описанных в данном документе. Данный документ не предоставляет никаких лицензий (подразумеваемых или возникающих в силу правовой презумпции) на какие-либо права интеллектуальной собственности. Условия и ограничения, применимые к покупке или использованию продуктов AMD, изложены в подписанном между сторонами соглашении или в Стандартных условиях продажи AMD. GD-18u.

© Advanced Micro Devices, Inc., 2026 г. Все права защищены. AMD, логотип в виде стрелки AMD, AMD Instinct и их комбинации являются товарными знаками компании Advanced Micro Devices, Inc. Название и логотип MLPerf являются зарегистрированными и незарегистрированными товарными знаками MLCommons Association в США и других странах. Все права защищены. Несанкционированное использование строго запрещено. Дополнительную информацию см. на сайте www.mlcommons.org. Другие названия продуктов, используемые в этой публикации, предназначены только для идентификации и могут быть товарными знаками соответствующих владельцев. Некоторые технологии AMD могут требовать поддержки или активации третьими сторонами. Поддерживаемые функции могут различаться в зависимости от операционной системы. Уточняйте информацию о конкретных функциях у производителя системы. Никакая технология или продукт не могут быть полностью безопасными.

← Все статьи