На конференції Hot Chips у вівторок компанія OpenAI представила докладнішу інформацію про Jalapeño, включно з першими результатами тестування нової системи. За результатами тестування за допомогою бенчмарку SemiAnalysis’ InferenceX, Jalapeño продемонстрував більшу кількість токенів на користувача та вищу пропускну здатність на кіловат порівняно з сучасними процесорами для інференсу.
«Результати показують дуже, дуже значний приріст продуктивності порівняно з найсучаснішими рішеннями», — заявив Річард Хо, керівник відділу обладнання OpenAI, під час прес-конференції. «Jalapeño може виконувати більше завдань ШІ на одиницю потужності, водночас швидше надаючи відповіді. Він дуже ефективний для обслуговування великої кількості клієнтів, а також забезпечує низьку затримку».
Важливо зазначити, що порівняння проводилося з системою Nvidia Blackwell. Однак до моменту повного розгортання Jalapeño конкуренція може суттєво просунутися. Хо оцінив, що Jalapeño буде розгорнуто наприкінці 2026 року «в дуже малих обсягах», а більш значне розгортання відбудеться у 2027 році.
Jalapeño, вперше анонсований у жовтні минулого року, був розроблений OpenAI у тісній співпраці з Broadcom. У процесі розробки брали участь власні моделі OpenAI. Компанія планує зробити Jalapeño багатопоколіннєвою платформою, що дозволить спільно розробляти продукти ШІ, моделі, чипи та пам’ять.
Завдяки такому підходу до всього стеку, OpenAI змогла оптимізувати конкретні етапи процесу інференсу, які часто спричиняють проблеми. Зокрема, Jalapeño розроблено для мінімізації затримок під час фаз prefill та комунікації, які, за словами OpenAI, часто виступають вузькими місцями.
«Ми розробили Jalapeño для мінімізації переміщення даних та затримок комунікації», — зазначила компанія у своєму блозі, представляючи результати. «Це означає, що стан моделі, включно з KV-кешем, який використовується під час генерації відповіді, може бути явно розміщений і зберігатися локально, тоді як система активує правильну комбінацію обчислень, пам’яті та мережі для кожної фази інференсу».
Оригінал статті: techcrunch.com
