- Мои инструменты
- Недавние
Недавние
Главные новости: В последних результатах тестов MLPerf Inference v6.1 от организации MLCommons компания Intel подчеркнула прирост производительности инференса ИИ, достигнутый за счет программной оптимизации на процессорах Intel Xeon 6 и графических процессорах Intel Arc Pro серии B. Результаты также отражают растущее участие клиентов и партнеров: все больше систем подтверждают возможности платформ Intel на еще большем числе моделей, рабочих нагрузок и сценариев развертывания.
На том же аппаратном обеспечении и том же количестве сокетов, что и в MLPerf v6.0, процессоры Intel Xeon 6980P продемонстрировали увеличение пропускной способности в режиме Server для модели Llama 3.1 8B в 2,4 раза и увеличение пропускной способности в режиме Offline на 56%¹. Эти результаты были достигнуты исключительно за счет программных улучшений, что демонстрирует, как непрерывная оптимизация позволяет извлекать больше производительности из уже развернутого клиентами оборудования. Партнеры Intel продемонстрировали аналогичную динамику.
Почему это важно: По мере того как инференс ИИ переходит в стадию промышленной эксплуатации, клиентам требуются платформы, способные поддерживать более крупные и разнообразные модели, обеспечивая при этом рост производительности, гибкость и ценность с течением времени. Результаты Intel в MLPerf Inference v6.1 доказывают, как программная оптимизация может продлить срок эффективной работы развернутой инфраструктуры, помогая клиентам получать максимум от уже используемых систем и масштабировать вычисления на базе CPU и GPU.
Участие клиентов и партнеров на платформах Intel также возросло: с 29 результатов в v6.0 до 39 в v6.1, что расширило стороннюю валидацию за рамки собственных заявок Intel². Компания Oracle представила свою первую заявку на базе решений Intel; Red Hat подала первую заявку на инференс с использованием процессоров Xeon, а Quanta Cloud Technology и Supermicro предоставили первые партнерские заявки с использованием Intel Arc Pro B70.
Обзор результатов Intel Xeon 6: Intel расширила свое участие с процессорами Xeon в MLPerf v6.1, увеличив число протестированных моделей Xeon 6 с двух в v6.0 до пяти, что привело к росту количества результатов инференса на CPU с 24 до 35. Процессоры Intel Xeon остаются единственными автономными серверными CPU, представленными в заявках MLPerf Inference.
Обзор результатов Intel Arc Pro B70: Заявки на базе Intel Arc Pro B70 демонстрируют, как программные улучшения позволяют повысить производительность для широкого спектра моделей ИИ. Один узел, оснащенный четырьмя графическими процессорами Intel Arc Pro B70, обеспечивает 128 ГБ видеопамяти и поддерживает тестирование для Llama 3.1 8B, Llama 2 70B, gpt-oss-120B, Whisper, а также для сквозной генерации с дополненной выборкой (E2E-RAG). На той же системе с четырьмя графическими процессорами, что использовалась в v6.0, производительность в режиме Server для gpt-oss-120B выросла на 36%, а в режиме Offline — на 27%, что отражает продолжающееся развитие программного стека Intel³.
О новом тесте E2E-RAG: Компания Intel также приняла участие в разработке и подала результаты для нового теста сквозной генерации с дополненной выборкой MLPerf Inference v6.1, который является одной из самых сложных новых рабочих нагрузок этого раунда. В ходе одного замера на системе, объединяющей процессор Intel Xeon 6787P и четыре графических процессора Intel Arc Pro B70, рабочая нагрузка была распределена между CPU и GPU, причем каждый компонент обрабатывал разные этапы конвейера ИИ: Xeon выполнял встраивание (embedding), переранжирование, векторный поиск и работу с малой языковой моделью (SLM), в то время как графические процессоры Arc Pro B70 осуществляли генерацию с помощью большой языковой модели (LLM). Этот результат демонстрирует, как оптимизированные вычислительные возможности CPU и GPU могут работать совместно в рамках единого рабочего процесса ИИ.
Текущая работа Intel по оптимизации выходит за рамки результатов бенчмарков. Улучшения для Xeon интегрируются в широко используемые фреймворки ИИ, чтобы клиенты могли получать выгоду от программных достижений на развернутой инфраструктуре, в то время как оптимизация для Intel Arc Pro B70 способствует развитию ядер, фреймворков и стека обслуживания для будущих продуктов Intel в сфере графических процессоров.
Дополнительный контекст: MLPerf Inference v6.1 results
Уведомления и отказ от ответственности
Производительность зависит от использования, конфигурации и других факторов. Узнайте больше на сайте www.Intel.com/PerformanceIndex.
Результаты производительности основаны на тестировании по состоянию на указанные в конфигурациях даты и могут не отражать все общедоступные обновления. Посетите сайт MLCommons для получения подробной информации. Ни один продукт или компонент не может быть абсолютно безопасным.
¹ На основе результатов MLPerf Inference v6.1 (ID: mint-lark-1a28) и MLPerf Inference v6.0 (ID: 6.0-0057), предоставленных Intel. Конфигурация: 1 узел, 2 процессора Intel® Xeon® 6980P (128 ядер), 24 модуля DDR5 MRDIMM по 96 ГБ 8800 МТ/с (всего 2304 ГБ), без дискретного ускорителя. Сценарий Server: 1 139,51 против 471,54 токенов/с (в 2,4 раза). Сценарий Offline: 1 916,74 против 1 229,56 токенов/с (в 1,56 раза). Результаты могут не отражать все общедоступные обновления. Название и логотип MLPerf являются товарными знаками MLCommons. Дополнительную информацию см. на сайте mlcommons.org.
² На основе результатов закрытого дивизиона MLPerf Inference v6.1 и v6.0, опубликованных на mlcommons.org. Под «платформами Intel» понимаются заявки, использующие процессоры Intel® Xeon® в качестве основного вычислительного средства (инференс только на CPU) или графические процессоры Intel® Arc™ Pro в качестве ускорителя. Количество партнеров/клиентов не включает собственные заявки Intel. Название и логотип MLPerf являются товарными знаками MLCommons. Дополнительную информацию см. на сайте mlcommons.org.
³ На основе результатов закрытого дивизиона MLPerf Inference v6.1 и MLPerf Inference v6.0 (ID: 6.0-0101), предоставленных Intel. Конфигурация: 1 узел, 1 процессор Intel® Xeon® 698X (86 ядер), 4 графических процессора Intel® Arc™ Pro B70 (каждый по 32 ГБ GDDR6, PCIe Gen5 x16), 8 модулей DDR5 по 16 ГБ 6400 МТ/с (всего 128 ГБ). gpt-oss-120B Server: 1 296,87 против 951,67 токенов/с (+36%). gpt-oss-120B Offline: 1 956,40 против 1 536,90 токенов/с (+27%). Программное обеспечение: PyTorch vLLM на Ubuntu 24.04. Результаты могут не отражать все общедоступные обновления. Название и логотип MLPerf являются товарными знаками MLCommons. Дополнительную информацию см. на сайте mlcommons.org.
Сравнение производительности между MLPerf Inference v6.0 и v6.1 основано на сопоставимых конфигурациях с использованием аналогичного процессорного или графического оборудования и соответствующего количества сокетов или GPU. Полные конфигурации систем и подробную информацию о бенчмарках см. в результатах MLCommons и документации по производительности Intel.
Ваши затраты и результаты могут отличаться.
Для технологий Intel может потребоваться активация аппаратного обеспечения, программного обеспечения или услуг.





