OpenAI Jalapeno перевершує чипи NVIDIA Blackwell за ефективністю

OpenAI Jalapeno перевершує чипи NVIDIA Blackwell за ефективністю 1

OpenAI, схоже, використала наявні моделі, що працюють на GPU від NVIDIA, для розробки чипа Jalapeno, а потім поєднала його з власним мовним програмування Gluon, кидаючи виклик легендарному екосистемі CUDA від NVIDIA. Як же змінилися обставини!

Архітектура чипа Jalapeno від OpenAI

OpenAI Jalapeno перевершує чипи NVIDIA Blackwell за ефективністю 2

Аналітична компанія SemiAnalysis нещодавно опублікувала детальний огляд ASIC Jalapeno від OpenAI, описавши дещо нову архітектуру, яка забезпечує значну економію завдяки масштабу.

Jalapeno поєднує один великий обчислювальний кристал (reticle-sized) на базі вузла N3P від TSMC з I/O чіплетом N3E та пам’яттю HBM4 (ймовірно, від Samsung), забезпечуючи пропускну здатність пам’яті 15,4 ТБ/с на пакет.

Ядра та пам’ять розділені на відповідні “зрізи”, надаючи кожному зрізу ядра низьколатентний локальний доступ до власного зрізу HBM, з’єднаного через колективну мережу з високою пропускною здатністю.

Наразі моделі ШІ зазвичай не обробляють дані рядок за рядком. Натомість вони обробляють мільярди чисел, організованих у сітки або матриці. Таким чином, матричний рушій є “важким навантаженням”, створеним виключно для прискорення цих математичних завдань на основі сіток.

Звичайно, традиційна математика ШІ використовує стандартні 16-бітові або 8-бітові числа. Однак Jalapeno використовує числові формати MXFP. Для тих, хто може не знати, формати MX ще більше стискають дані математики ШІ — до 4-бітових у MXFP4. Це стиснення досягається шляхом групування чисел та їх спільного використання одного масштабуючого коефіцієнта (експоненти), тим самим скорочуючи обсяг пам’яті, необхідної для зберігання та переміщення даних.

Матричні рушії Jalapeno мають систолічний масив, стійкий до ваг (weight-stationary systolic array). У стандартному ЦП чіп повинен постійно зчитувати дані з пам’яті, виконувати обчислення та записувати результат назад у пам’ять. Це створює вузьке місце. Систолічний масив, з іншого боку, працює як людське серце, що перекачує кров: дані надходять у сітку тісно пов’язаних обчислювальних комірок, проходячи безпосередньо з однієї комірки до наступної, без постійних зупинок для читання/запису до зовнішньої пам’яті.

Крім того, обчислення ШІ зазвичай включають множення вхідних даних (наприклад, вашого запиту) на фіксовані внутрішні значення (ваги моделі). Однак матричні рушії Jalapeno є стійкими до ваг, що означає, що чіп завантажує ваги моделі в обчислювальну сітку один раз, а потім фіксує їх (стаціонарно).

Таким чином, заморожуючи ключові ваги ШІ на місці (weight stationary), плавно перекачуючи дані через сітку (systolic array) та стискаючи числа (MXFP), Jalapeño усуває вузькі місця передачі даних.

Окрім матричних рушіїв, чип Jalapeno від OpenAI також оснащений 64-бітними скалярними ядрами для виконання керуючого коду, керування пам’яттю та оркестрування всієї операції. Ці скалярні ядра мають конвеєри виконання з позачерговим доступом (Out-of-Order, OoO) і поставляються з кешем L1. Це запобігає зупинці цих ядер під час очікування даних. Таким чином, скалярні ядра з позачерговим доступом працюють випереджаючи математичні рушії: вони потоково передають дані до спеціалізованих апаратних черг, щоб, коли жорсткі, послідовні матричні та векторні ядра будуть готові, числа вже були вишикувані та чекали на них.

Нарешті, чіп може похвалитися векторними ядрами FP32/INT32, які можуть одночасно застосовувати одну інструкцію до цілого рядка чисел, що використовується у випадках, коли потрібна високоточна математика, а стиснення з матричних рушіїв може зіпсувати результати. Це корисно для фіналізації ймовірностей наступного слова (шари softmax) або нормалізації шарів даних.

1/n OPENAI JALAPENO – Scale Up Domain:

The most striking detail of Jalapeno is that its scale up domain can have 2048 XPUs compared to only 72 of NVL72.

They divide scale up in local and global domains – use copper for local (higher bandwidth) and use optical transreceivers… https://t.co/buWNwcgJGA pic.twitter.com/8qe8ZGsHtv

— GDP (@bookwormengr) August 25, 2026

Звісно, OpenAI будує не тільки чип Jalapeno, але й повне рішення масштабу стійки, яке складається з:

  1. Стійка хост-процесора (Katsu): Ця стійка містить 16 окремих лотків хост-процесорів. Кожен індивідуальний лоток Katsu оснащений двома процесорами AMD EPYC класу Turin, 1,5 ТБ стандартної системної пам’яті DRAM, локальним сховищем NVMe SSD та мережевими підключеннями 400G.
  2. Стійка прискорювача ASIC (Vindaloo): Розташована безпосередньо праворуч від стійки хоста, містить 16 відповідних лотків прискорювачів. Кожен лоток Vindaloo містить 8 ASIC Jalapeno, що становить загалом 128 чипів Jalapeno на одну розгортання стійки.
  3. Для з’єднання двох стійок між собою 8 зовнішніх високошвидкісних кабелів PCIe Direct Attach Copper (DAC) проходять горизонтально по передній частині серверних шаф, з’єднуючи кожен хост-лоток Katsu безпосередньо з відповідним лотком ASIC Vindaloo.
  4. Кожна стійка з 128 чипами ASIC забезпечує до 1,7 ExaFLOPs обчислювальної потужності 4-бітового формату (MXFP4) і містить 27,5 ТБ пам’яті HBM4 наступного покоління на стійку, причому кожен індивідуальний пакет Jalapeno використовує шість стеків HBM4 висотою 12 для досягнення вражаючої пропускної здатності пам’яті 15,4 ТБ/с.

Чип Jalapeno від OpenAI перевершує конкурентів

OpenAI Jalapeno перевершує чипи NVIDIA Blackwell за ефективністю 3

Згідно з результатами, наданими SemiAnalysis, Jalapeno є найефективнішим чипом для робочих навантажень виведення (inference). На тестовому наборі InferenceX він забезпечив на 1,5-1,9 рази більше роботи ШІ на ват при піковій пропускній здатності та на 1,7-3,6 рази меншу наскрізну затримку порівняно з найкращими результатами NVIDIA GB200/GB300, доступними наразі, на основі тестування моделей OpenAI GPT-OSS 120B, DeepSeek R1 670B та Kimi K2.5 1T. Важливо, що чип не оптимізовано спеціально для одного сімейства моделей і, здається, може з легкістю запускати будь-яку модель.

OpenAI’s new Jalapeño chip announced at Hot Chips beats Vera Rubin’s July results on Output Throughput per MW. (1/7)🧵 pic.twitter.com/mVHQ5P41BY

— SemiAnalysis (@SemiAnalysis_) August 25, 2026

За даними SemiAnalysis, Jalapeno “забезпечує 13,4 PFLOPs MXFP4 на одному обчислювальному кристалі розміром з ретикулу (reticle-sized), виготовленому на TSMC N3P. Це порівнюється з 17,5 PFLOPs щільного NVFP4 Rubin для одного кристала Rubin подібного розміру та на тому ж вузлі.”

Більше того, хоча OpenAI оцінила TDP Jalapeno в 700 Вт, його стабільне енергоспоживання зазвичай залишається на рівні 550 Вт або нижче під час активних робочих навантажень ШІ.

Важливо, що Jalapeno досягає цього, використовуючи архітектуру Single-Token Prediction (STP), де модель приймає запит, обробляє його і передбачає рівно один токен (слово або частину слова) за раз. Це означає, що ASIC не покладався на архітектурні трюки, такі як багатотокенове прогнозування (MTP) або спекулятивне декодування, для завищення своїх показників продуктивності. Зауважте, що спекулятивне декодування забезпечує приблизно 3-кратне покращення вартості за токен.

Як остаточне застереження, зверніть увагу, що Jalapeno використовує HBM4, тоді як системи GB200 та GB300 використовують HBM3E. Це дещо ставить ASIC OpenAI у вигідне становище.

OpenAI Jalapeno перевершує чипи NVIDIA Blackwell за ефективністю 4

Дізнатися більше на: wccftech.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *