AMD проти NVIDIA: MLPerf 6.1 розкриває силу кластера MI355X

AMD проти NVIDIA: MLPerf 6.1 розкриває силу кластера MI355X 1

MLPerf v6.1 вже доступний, з результатами від AMD, NVIDIA та Intel у низці AI-бенчмарків.

AMD та NVIDIA демонструють високу продуктивність в MLPerf 6.1, Intel також представила Xeon та Arc Pro

Останнє оновлення від MLCommons — це набір бенчмарків MLPerf Inference v6.1, який містить низку робочих навантажень, що відповідають останнім тенденціям у сегменті ШІ. Традиційно, усі три компанії подали результати своїх актуальних апаратних рішень, які ми зібрали в наведені нижче таблиці.

AMD проти NVIDIA: MLPerf 6.1 розкриває силу кластера MI355X 2
AMD проти NVIDIA: MLPerf 6.1 розкриває силу кластера MI355X 3
AMD проти NVIDIA: MLPerf 6.1 розкриває силу кластера MI355X 4
AMD проти NVIDIA: MLPerf 6.1 розкриває силу кластера MI355X 5
AMD проти NVIDIA: MLPerf 6.1 розкриває силу кластера MI355X 6
AMD проти NVIDIA: MLPerf 6.1 розкриває силу кластера MI355X 7
AMD проти NVIDIA: MLPerf 6.1 розкриває силу кластера MI355X 8
AMD проти NVIDIA: MLPerf 6.1 розкриває силу кластера MI355X 9
AMD проти NVIDIA: MLPerf 6.1 розкриває силу кластера MI355X 10

2 з 9

Починаючи з DeepSeek R1, AMD демонструє конфігурацію кластера з 512 GPU Instinct MI355X. Це забезпечує лідерство у продуктивності як для офлайн, так і для серверних сценаріїв використання. Рішення NVIDIA GB300 та GB200 тестувалися у конфігураціях з 288 GPU, причому конфігурація GB300 була близькою до платформи MI355X.

AMD проти NVIDIA: MLPerf 6.1 розкриває силу кластера MI355X 11
AMD проти NVIDIA: MLPerf 6.1 розкриває силу кластера MI355X 12
AMD проти NVIDIA: MLPerf 6.1 розкриває силу кластера MI355X 13

2 з 9

Тут також представлено перші результати NVIDIA Vera Rubin (VR200) у конфігураціях з 72 та 36 GPU. Конфігурація з 72 GPU працює до 95% швидше, ніж конфігурація GB300 з 72 GPU, тоді як конфігурація з 36 GPU випереджає конфігурацію GB200 з 72 GPU, що є вражаючим показником. Це ранній огляд, і ми побачимо ще більше результатів для Vera Rubin, коли вона буде впроваджена та протестована в наборі MLPerf.

MLPerf v6.1 DeepSeek R1

Offline (Tokens/s)

Server (Tokens/s)

0 4836599673181450977193463624182952901954 0 4836599673181450977193463624182952901954
AMD MI355X (512 GPUs) 29019502405310 NVIDIA GB300 (288 GPUs) 27051302028030
NVIDIA GB200 (288 GPUs) 20911901598510 NVIDIA VR200 (72 GPUs) 11833261175890
NVIDIA GB300 (72 GPUs) 689961603023 NVIDIA VR200 (36 GPUs) 558802591368
NVIDIA GB200 (72 GPUs) 542075426796 NVIDIA GB300 (8 GPUs) 13685480536

У тесті GPT-OSS 120B AMD знову продемонструвала свою найпотужнішу конфігурацію з 512 GPU, яка лідирувала як в офлайн-, так і в серверних сценаріях.

Крім того, конфігурація NVIDIA GB300 “Grace Blackwell Ultra” випередила конфігурації з 72 та 8 GPU. Рішення AMD MI350P також показало кращу продуктивність, ніж MI300X, в обох конфігураціях з 8 GPU. Intel також була представлена в тестуванні своїм продуктом Arc Pro B70, тоді як GPU NVIDIA RTX PRO також тестувалися в конфігураціях з 8 та 4 GPU.

MLPerf v6.1 GPT-OSS-120B (Max)

Offline (Tokens/s)

Server (Tokens/s)

0 95824019164802874720383296047912005749440 0 95824019164802874720383296047912005749440
AMD MI355X (512 GPUs) 57494405392930
MLPerf v6.1 GPT-OSS-120B

Offline (Tokens/s)

Server (Tokens/s)

0 1996193992385988577984769980951197714 0 1996193992385988577984769980951197714
NVIDIA GB300 (72 GPUs) 11977101160490 AMD MI355X (72 GPUs) 1039900964468
NVIDIA GB200 (72 GPUs) 911566901058 AMD MI355X (16 GPUs) 2284880.1
NVIDIA GB300 (8 GPUs) 132236127921 AMD MI355X (8 GPUs) 117804110188
NVIDIA GB200 (8 GPUs) 101453100714 NVIDIA GB300 (4 GPUs) 6551158195
NVIDIA GB200 (4 GPUs) 5091250613 AMD MI350P (8 GPUs) 4897140867
AMD MI300X (8 GPUs) 3019824863 NVIDIA RTX PRO 6000 (8 GPUs) 1573814784
NVIDIA RTX PRO 6000 (4 GPUs) 70816950 Intel Arc Pro B70 (4 GPUs) 20631351

У тесті Llama2 70B домінують GPU Blackwell від NVIDIA з конфігураціями на 72 GPU. NVIDIA GB300 також випередила AMD MI355X у конфігураціях з 8 GPU, але платформа Instinct виявилася швидшою за рішення GB200 Blackwell. Знову ж таки, AMD MI350P, NVIDIA RTX PRO та Intel Arc Pro показали хороші результати. Приємно бачити результати MLPerf, що подаються для платформ робочих станцій.

MLPerf v6.1 Llama2-70B

Offline (Tokens/s)

Server (Tokens/s)

0 18935037870056805075740094675011361000 0 18935037870056805075740094675011361000
NVIDIA GB300 (72 GPUs) 1136100944902 NVIDIA GB200 (72 GPUs) 894002910621
NVIDIA GB300 (16 GPUs) 227570179596 NVIDIA GB300 (8 GPUs) 132253127983
AMD MI355X (8 GPUs) 103792103932 NVIDIA GB200 (8 GPUs) 102703102397
NVIDIA GB300 (4 GPUs) 6600158991 AMD MI350P (8 GPUs) 4228641830
NVIDIA RTX PRO 6000 (8 GPUs) 3003429203 NVIDIA RTX PRO 6000 (4 GPUs) 1486014333
NVIDIA RTX PRO 4500 (8 GPUs) 43743012 Intel Arc Pro B70 (4 GPUs) 24841759

Нарешті, Llama 3.1-8B, де конфігурація NVIDIA GB300 (8 GPU) була до 17% швидшою за AMD MI355X (конфігурація з 8 GPU). Решту результатів можна побачити нижче:

MLPerf v6.1 Llama3.1-8B

Offline (Tokens/s)

Server (Tokens/s)

0 289925798486976115968144960173952 0 289925798486976115968144960173952
NVIDIA GB300 (8 GPUs) 171114173950 AMD MI355X (8 GPUs) 158458148563
AMD MI350P (8 GPUs) 7364372305 NVIDIA RTX PRO 6000 (8 GPUs) 5096549523
NVIDIA RTX PRO 6000 (4 GPUs) 2451124510 NVIDIA RTX PRO 4500 (8 GPUs) 1880018186
NVIDIA RTX PRO 4500 (4 GPUs) 95189277 Intel Arc Pro B70 (4 GPUs) 49774122
Intel Xeon 6788P (4 Socket) 20681030 Xeon 6980P (2 Socket) 19161139
Xeon 6788P (2 Socket) 1170516

Звичайно, ці результати чудові, але всі працюють над оптимізацією свого найновішого обладнання відповідно до майбутніх трендів ШІ. Саме тому результати, які ви бачите сьогодні, не будуть такими ж через кілька місяців. Постійна оптимізація програмного забезпечення та апаратного рівня не тільки покращує продуктивність, але й сприяє ефективності, що означає кращу пропускну здатність та більше можливостей для масштабування платформ.

Нижче наведено ключові моменти від кожної компанії щодо їхніх відповідних подань MLPerf 6.1:

  • Дебют системи NVIDIA Vera Rubin NVL72 з провідною продуктивністю: У своєму першому попередньому поданні MLPerf Inference, NVIDIA Vera Rubin NVL72 забезпечує до 3.7 разів вищу пропускну здатність, ніж GB300 NVL72.
  • NVIDIA GB300 NVL72 масштабується з провідною ефективністю: Подання 288 GPU в чотирьох стійках GB300 NVL72 досягло 99% ефективності масштабування, зі збільшенням пропускної здатності майже лінійно від базового рівня однієї стійки.
  • Постійна оптимізація програмного забезпечення забезпечує зростання продуктивності: Оптимізація програмного забезпечення в поданнях NVIDIA MLPerf Inference v6.1 забезпечила до 1.6 разів вищу продуктивність порівняно з v6.0. Оптимізація тривала після подання v6.1, забезпечуючи подальше зростання продуктивності.

NVIDIA

  • Більша продуктивність від того самого обладнання GPU AMD Instinct MI355X: протягом одного циклу MLPerf, постійна оптимізація програмного забезпечення AMD ROCm збільшила пропускну здатність GPT-OSS-120B на 8 GPU, зменшила затримку Wan-2.2 та підвищила пропускну здатність кластера з меншою кількістю GPU.
  • Провідна продуктивність GPU AMD Instinct MI355X та MI350P: GPU AMD Instinct MI355X випередили результати NVIDIA B200 та B300 GPT-OSS-120B на 8 GPU та результати NVIDIA GB200 на 72 GPU. У своєму першому раунді MLPerf GPU AMD Instinct MI350P випередили вибрані результати NVIDIA RTX PRO 6000 Server Edition та H200 NVL.
  • Рекордна пропускна здатність токенів та інференс у виробничому масштабі з ефективним масштабуванням: на 72 GPU, GPU AMD Instinct MI355X досяг 95% ефективності масштабування на GPT-OSS-120B. Окремо, Crusoe досяг рекордного сукупного пропускної здатності токенів на 512 GPU, досягнувши 5.75 мільйонів офлайн-токенів за секунду на GPT-OSS-120B та 2.90 мільйонів на DeepSeek-R1.

AMD

  • Про результати Intel Xeon 6: Intel розширила свою участь у Xeon у MLPerf v6.1 з двох протестованих SKU Xeon 6 у v6.0 до п’яти, збільшивши кількість результатів інференсу CPU з 24 до 35. Intel Xeon залишається єдиним окремим серверним CPU, представленим у поданнях MLPerf Inference.
  • Про результати Intel Arc Pro B70: Подання Intel Arc Pro B70 демонструють, як вдосконалення програмного забезпечення можуть розширити продуктивність для низки моделей ШІ. Один вузол, сконфігурований з чотирма GPU Intel Arc Pro B70, забезпечує 128 ГБ VRAM та підтримує подання для Llama 3.1 8B, Llama 2 70B, gpt-oss-120B, Whisper та наскрізного генеративного пошуку (E2E-RAG). На тій самій системі з чотирма GPU, що використовувалася в v6.0, продуктивність gpt-oss-120B Server покращилася на 36%, а офлайн-продуктивність зросла на 27%, що відображає подальше дозрівання програмного стека Intel.

Intel

MLPerf Inference v6.1 демонструє насичене та швидкозмінне поле, а не єдиного переможця. Кластер AMD MI355X з 512 GPU встановив темп у екстремальному масштабі на DeepSeek R1 та GPT-OSS 120B, тоді як перший попередній огляд NVIDIA Vera Rubin вже виглядає як стрибок: система VR200 з 72 GPU майже подвоїла показники відповідної стійки GB300, і навіть конфігурація з 36 GPU обігнала GB200 з 72 GPU.

У більш поширених конфігураціях з 8 та 72 GPU ситуація неоднозначна — GB300 часто лідирує в Llama 2 70B та Llama 3.1 8B, AMD залишається конкурентоспроможною або випереджає в деяких тестах GPT-OSS, а MI350P, RTX PRO та Intel Arc Pro B70 доводять, що обладнання робочих станцій тепер належить до тієї ж розмови. Intel також зберегла Xeon як єдиний окремий CPU у пакеті.

Справжня історія полягає в тому, як швидко програмне забезпечення продовжує рухати показники. NVIDIA заявила про зростання до 1.6 раза завдяки роботі над стеком з моменту v6.0; AMD покращила той самий кремній MI355X протягом одного циклу; Intel підвищила результати Arc Pro на ідентичному обладнанні. Ці показники є знімками, а не стелями. Оскільки Rubin надійде в продаж, ROCm та CUDA будуть продовжувати вдосконалюватися, і з’являться нові кластери, наступний раунд MLPerf виглядатиме інакше — і це саме те, чого хоче індустрія.

AMD проти NVIDIA: MLPerf 6.1 розкриває силу кластера MI355X 14

Про автора: Хассан Муджтаба, інженер-програміст за освітою та ентузіаст ПК за покликанням, є старшим редактором розділу апаратного забезпечення Wccftech. Маючи багаторічний досвід у галузі, він спеціалізується на глибокому технічному аналізі процесорних та графічних архітектур нового покоління, материнських плат та систем охолодження. Його робота включає не тільки оперативні новини про майбутні технології, але й всебічні огляди та бенчмаркінг.

Пропозиція дня

AMD проти NVIDIA: MLPerf 6.1 розкриває силу кластера MI355X 15AMD проти NVIDIA: MLPerf 6.1 розкриває силу кластера MI355X 16

Додатково для читання

AMD проти NVIDIA: MLPerf 6.1 розкриває силу кластера MI355X 17

Intel Arc Pro B70 перевершує NVIDIA RTX 5090D в DeepSeek R1 AI LLM, коштуючи чверть ціни, пропонуючи понад 2000 токенів/сек

Хассан Муджтаба

AMD проти NVIDIA: MLPerf 6.1 розкриває силу кластера MI355X 18

Maxsun Intel Arc Pro B70 32G Graphics Card Hands On Impressions: Big Battlemage Stuns With Big Uplifts Over B580

Хассан Муджтаба

AMD проти NVIDIA: MLPerf 6.1 розкриває силу кластера MI355X 19

Intel Arc Pro B70 перевершує NVIDIA RTX Pro 4000 в AI за половину ціни, на 33% більше пам’яті

Хассан Муджтаба

AMD проти NVIDIA: MLPerf 6.1 розкриває силу кластера MI355X 20

Tenstorrent TT-QuietBox 2 запущено: AI-робоча станція на базі RISC-V з 128 ГБ пам’яті GDDR6, рідинним охолодженням та стартовою ціною $9999

Хассан Муджтаба

Оригінал статті: wccftech.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *