AMD відповідає на ставку NVIDIA на Groq: Cerebras Wafer-Scale Engine та Helios разом дають у 5 разів більше токенів за секунду на ват

AMD відповідає на ставку NVIDIA на Groq: Cerebras Wafer-Scale Engine та Helios разом дають у 5 разів більше токенів за секунду на ват 1

Компанія NVIDIA оперативно залучила Groq, як тільки її LPU продемонструвала перспективність у сфері ефективного виведення (inferencing). Тепер AMD відповідає на цей хід NVIDIA, уклавши партнерство з Cerebras для інтеграції свого рішення Helios масштабу стійки з Wafer-Scale Engine від Cerebras, що значно підвищує можливості виведення інтегрованої системи.

LPU проти Wafer-Scale Engine

Для тих, хто, можливо, не знає, Groq Language Processing Unit (LPU) об’єднує сотні або навіть тисячі спеціалізованих чипів, кожен з яких містить великі блоки Matrix Multiply (MXM) та Vector (VXM), а також близько 230 МБ надшвидкої SRAM. Крім того, ваги AI-моделей жорстко вбудовуються безпосередньо в SRAM, повністю оминаючи концепцію кешу пам’яті.

AMD відповідає на ставку NVIDIA на Groq: Cerebras Wafer-Scale Engine та Helios разом дають у 5 разів більше токенів за секунду на ват 2

Важливо, що LPU не має прогнозувальників гілок чи апаратних планувальників. Натомість компілятор Groq планує кожне обчислення з точністю до наносекунди, забезпечуючи безперервне та ретельно сплановане надходження відповідних даних з SRAM для обробки, що призводить до надзвичайно швидкого виведення.

На відміну від цього, Cerebras Wafer-Scale Engine розміщує пам’ять та обчислювальні потужності, еквівалентні цілому суперкомп’ютеру для ШІ, на єдиному гігантському взаємопов’язаному кремнієвому кристалі, де сотні тисяч обчислювальних ядер та десятки ГБ SRAM безшовно з’єднані, дозволяючи даним ефективно переміщатися без вузьких місць зовнішньої мережі.

AMD відповідає на ставку NVIDIA на Groq: Cerebras Wafer-Scale Engine та Helios разом дають у 5 разів більше токенів за секунду на ват 3

LPU використовує невеликі ізольовані пули SRAM, де певна AI-модель розбивається, а потім розподіляється між великою кількістю спеціалізованих чіпів. Cerebras Wafer-Scale Engine, однак, може вмістити цілу модель середнього розміру – або великі фрагменти великої моделі – у своєму єдиному блоці SRAM. Крім того, універсальність підходу Cerebras дозволяє виконувати як навчання, так і виведення.

AMD відповідає на ставку NVIDIA на Groq: Cerebras Wafer-Scale Engine та Helios разом дають у 5 разів більше токенів за секунду на ват 4

AMD інтегрує своє рішення Helios масштабу стійки з Cerebras Wafer-Scale Engine для забезпечення «наднизької затримки, необхідної для найсучасніших AI-додатків»

Згідно з дорожньою картою AMD, Helios забезпечить високопродуктивний, масштабований механізм пропускної здатності, тоді як технологія Cerebras Wafer-Scale Engine надасть надшвидке декодування та генерацію токенів з наднизькою затримкою. Очікується, що разом ці два обчислювальних механізми забезпечать до 5 разів більше токенів на секунду на ват.

Ця домовленість балансує вимоги до високої генерації токенів у робочих навантаженнях, що базуються на обсязі, з швидшим часом відгуку, який цінується в таких завданнях, як кодування та інші агентські завдання.

AMD зазначає:

«Helios забезпечує надвисоку пропускну здатність, обробляючи запити та великі контекстні вікна. Cerebras Wafer-Scale Engine прискорює інтенсивну за пропускною здатністю пам’яті генерацію токенів з наднизькою затримкою. Об’єднуючи ці найкращі в своєму класі механізми через єдиний інтегрований робочий процес, компанії створюють диференційовану платформу для виведення з наднизькою затримкою без шкоди для пропускної здатності чи масштабу».

Звісно, NVIDIA вже продає своє рішення масштабу стійки на базі LPU під назвою Groq 3 LPX, що містить 256 взаємопов’язаних прискорювачів Groq 3 LPU, повне рідинне охолодження та 315 PFLOPS обчислювальної потужності для виведення.

Тим не менш, співпраця AMD-Cerebras пропонує продукт масштабу стійки, який значно універсальніший, ніж відносно жорсткі LPU в Groq 3 LPX.

AMD відповідає на ставку NVIDIA на Groq: Cerebras Wafer-Scale Engine та Helios разом дають у 5 разів більше токенів за секунду на ват 5

Про автора: Письмо — моя єдина беззаперечна пристрасть. За останні шість років я написав понад 2200 окремих статей на фінансові та технологічні теми, обсягом майже 1 мільйон слів. І я є членом команди Wcctech mobile з 2025 року. Як випускник Університету Торонто, програми Rotman Commerce, я привношу нюанси, глибокі знання та унікальний погляд на кожну тему, яку висвітлюю. Коли я не пишу, я подорожую світом, досліджуючи приховані кондитерські та ресторани як шанувальник кулінарії.

Слідкуйте за Wccftech на Google, щоб отримувати більше наших новин у своїх стрічках.

Додатково для читання

AMD відповідає на ставку NVIDIA на Groq: Cerebras Wafer-Scale Engine та Helios разом дають у 5 разів більше токенів за секунду на ват 6

Процесори AMD EPYC Venice перевершують NVIDIA Vera, будучи на 20% швидшими за одноядерними та в 2,2 рази продуктивнішими завдяки до 256 ядрам «Zen 6», 203 мільярдам транзисторів та тактовим частотам понад 5 ГГц+

Хассан МуджтабаAMD відповідає на ставку NVIDIA на Groq: Cerebras Wafer-Scale Engine та Helios разом дають у 5 разів більше токенів за секунду на ват 7

NVIDIA, як повідомляється, підвищила ціни на комплекти GDDR6 та GDDR7 для своїх GPU RTX

Сарфраз ХанAMD відповідає на ставку NVIDIA на Groq: Cerebras Wafer-Scale Engine та Helios разом дають у 5 разів більше токенів за секунду на ват 8

Framework демонструє свій настільний ПК AMD Ryzen AI MAX+ PRO 495 зі 192 ГБ уніфікованої пам’яті, який легко запускає DeepSeek V4-Flash з Q8

Хассан МуджтабаAMD відповідає на ставку NVIDIA на Groq: Cerebras Wafer-Scale Engine та Helios разом дають у 5 разів більше токенів за секунду на ват 9

Дивіться подію AMD «Advancing AI 2026» наживо тут – запуск нових процесорів EPYC Zen 6, серії Instinct MI400 та AI-стійки Helios

Хассан Муджтаба

За даними порталу: wccftech.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *