NVIDIA Vera: Архітектура для епохи AI-агентів з рекордною продуктивністю одного ядра проти x86

NVIDIA Vera: Архітектура для епохи AI-агентів з рекордною продуктивністю одного ядра проти x86 1

Процесор NVIDIA Vera CPU призначений для систем навчання з підкріпленням (Reinforcement Learning) та агентного ШІ (Agentic AI), пропонуючи 88 ядер Olympus для максимальної одноядерної продуктивності.

CPU NVIDIA Vera, “вбивця” x86, тепер доступний: створений виключно з думкою про агентний ШІ

Зростання навантажень агентного ШІ та навчання з підкріпленням, що стає ключовим механізмом масштабування для покращення можливостей моделей, зробило процесори життєво важливим компонентом систем ШІ. Без швидкого процесора (для виконання, оцінки, оркестрації) відеокарта не зможе отримувати контекст, що призводить до значних недоліків та неефективності. Саме тому NVIDIA розробила Rubin, процесор, створений спеціально для агентів, який усуває ці “вузькі місця” та забезпечує пропускну здатність та ефективність, яких вимагає галузь.

Дізнайтеся більше про продуктивність процесора NVIDIA Vera тут!

NVIDIA Vera: Архітектура для епохи AI-агентів з рекордною продуктивністю одного ядра проти x86 2

Сьогодні ми детально розглянемо Vera – останній та найпотужніший процесор NVIDIA для ШІ, що базується на кастомних ядрах Arm.

Внутрішня будова процесора Vera

На високому рівні процесор NVIDIA Vera базується на архітектурі Olympus Core, яка використовує кастомний IP-адрес Armv9.2. Він побудований на монолітному обчислювальному кристалі та оснащений такими технологіями, як NVIDIA Scalable Coherency Fabric 2-го покоління (SCF), Confidential Computing (TEE-I/O Capable) та x16 PCIe Gen6 CXL 3.1.

Ключові переваги NVIDIA Scalable Coherency Fabric включають:

  • Зв’язок між кластерами процесорів з низькою затримкою.
  • Ефективний доступ до спільних ресурсів кешу системного рівня.
  • Високошвидкісне підключення до контролерів пам’яті.
  • Нативна інтеграція з NVLink-C2C та інфраструктурою прискорювачів.

Функція Brand Prediction використовує нейронні та спеціалізовані передбачення з двома гілками, що беруться за цикл. Він має 10-рівневе декодування інструкцій, новий планувальник для графіків та розширений префетчер, 96 КБ кешу L1D, 64 КБ кешу L1I, 2 МБ кешу L2 та 164 МБ кешу L3. Кожне ядро має доступ до пропускної здатності 14 ГБ/с. Інтерконект NVLink C2C забезпечує когерентну пропускну здатність процесора та GPU до 1,8 ТБ/с.

Загалом, Vera має 88 високопродуктивних ядер Olympus та 176 потоків NVIDIA Spatial Multi-threading. Чіп інтегрує широку мікроархітектуру з високим IPC, розроблену для забезпечення максимальної однопотокової продуктивності, досягаючи ефективної паралельності в тисячах програмних середовищ.

Ядра / Потоки 88 / 176
Кеш L2 2 МБ на ядро
Кеш L3 164 МБ на процесор
Пам’ять До 1,5 ТБ SOCAMM2 LPPDDR5X
Швидкість пам’яті До 9600 МТ/с
Пропускна здатність пам’яті До 1,2 ТБ/с (сумарно), 14 ГБ/с (на ядро)
PCIe 88 ліній PCIe 6.4 (тільки процесор), 96 ліній PCIe 6.4 (Vera Rubin), розбиття до x2, CXL 3.1
Конфігурований TDP 250 Вт – 450 Вт

Olympus – Пік ШІ

Olympus, ядро, що живить Vera, називається обчислювальним рушієм процесора. Воно розроблене з нуля з однією метою: максимізувати IPC (Instructions Per Cycle) для нерегулярного, інтенсивного до розгалужень, чутливого до затримок та високопаралельного програмного забезпечення. Порівняно з Grace, Vera досягає 50% приросту IPC. Архітектура процесора Vera складається з чотирьох ключових компонентів:

  • Front End: Оптимізовані передбачувачі розгалужень.
  • Mid Core: Прискорення критичного шляху.
  • Execution Engine: Оптимізація складних векторів.
  • Cache Subsystem: Оптимізовані за затримкою шляхи інструкцій та даних.

Нижче наведено блок-схему ядра Olympus:

Нейронний передбачувач розгалужень Olympus

Починаючи з розбору ядра Olympus, першим ми маємо нейронний передбачувач розгалужень (NBP), який призначений для покращення точності передбачень у складних, інтенсивних до розгалужень програмах.

NVIDIA Vera: Архітектура для епохи AI-агентів з рекордною продуктивністю одного ядра проти x86 3

NBP вивчає довгострокову поведінку керуючого потоку та статистично зміщені шаблони розгалужень, які поширені у великих середовищах виконання, інтерпретаторах, базах даних, компіляторах та навантаженнях агентів. Покращення передбачення розгалужень дозволяють front end Olympus отримувати корисні інструкції, що, у свою чергу, забезпечує вищу пропускну здатність інструкцій та більш стабільну продуктивність.

Mid Core Olympus

Mid Core в Olympus перетворює декодовані інструкції на виконувані операції, максимізуючи паралельність на рівні інструкцій та пам’яті. Mid Core Olympus розроблений для ідентифікації та виконання незалежної роботи, прихованої за цими “вузькими місцями”, забезпечуючи вищу утилізацію обчислювальних ресурсів та покращений загальний IPC.

NVIDIA Vera: Архітектура для епохи AI-агентів з рекордною продуктивністю одного ядра проти x86 4

Mid Core має широкий механізм перейменування та розподілу, що підтримується великим буфером повторного замовлення та розширеними ресурсами фізичних регістрів. Перейменування регістрів Mid Core усуває хибні залежності між інструкціями, дозволяючи процесору виявляти додаткову паралельність та виконувати інструкції, як тільки їхні справжні операнди стають доступними. Велике вікно інструкцій дозволяє Olympus заглядати значно далі в потік інструкцій, знаходячи корисну роботу, поки інші інструкції чекають на пам’ять або вирішення розгалужень.

Olympus також містить кілька технологій для розриву залежностей, таких як:

  • Перейменування пам’яті: Прискорює ланцюжки залежностей від запису до читання, дозволяючи виконувати залежні інструкції до завершення читання, коли зв’язок даних може бути передбачений або визначений. Це особливо корисно для програм з великою кількістю вказівників, обходу графів, середовищ виконання та складних об’єктно-орієнтованих навантажень.
  • Передбачення значень: Виявляє стабільні ланцюжки залежностей і передбачає майбутні значення до їх створення, дозволяючи залежним інструкціям виконуватися спекулятивно, поки правильність перевіряється пізніше. Ця можливість особливо ефективна для повторюваних програмних шаблонів та послідовних структур даних.
  • Усунення переміщень та оптимізація значень: Техніки для досягнення вищої утилізації.

Execution Engine Olympus

Execution Engine в ядрі Olympus розроблений для підтримки високої пропускної здатності інструкцій для різних навантажень, включаючи середовища виконання агентного ШІ, RL, бази даних тощо. Після того, як інструкції проходять етапи перейменування та планування, вони динамічно надсилаються до спеціалізованих обчислювальних ресурсів, оптимізованих для цілочисельної арифметики, обробки розгалужень, векторних обчислень та операцій з пам’яттю.

Комбінація широкого backend виконання та глибокого out-of-order engine дозволяє ядрам Olympus продовжувати прогрес, навіть коли деякі частини навантажень сповільнюються доступом до пам’яті, вирішенням розгалужень або довгими ланцюжками залежностей.

Таким чином, для Execution Engine NVIDIA інтегрує 8 простих цілочисельних АЛП, 2 складних АЛП та 4 виділених блоки виконання розгалужень. Прості АЛП обробляють поширені арифметичні та логічні операції, тоді як складні АЛП прискорюють операції з вищою затримкою, такі як множення, ділення, CRC та інтенсивні операції зсуву.

NVIDIA Vera: Архітектура для епохи AI-агентів з рекордною продуктивністю одного ядра проти x86 5

Виділені блоки розгалужень працюють у поєднанні з передовою системою передбачення розгалужень для швидкого вирішення рішень щодо керуючого потоку та мінімізації збоїв конвеєра. Ця комбінація особливо корисна для сучасних агентних навантажень, які часто демонструють нерегулярний керуючий потік та часті розгалуження, коли агенти міркують, оцінюють стан та виконують дії.

Для векторних та орієнтованих на ШІ обчислень Olympus інтегрує шість 128-бітних векторних виконавчих блоків SVE, включаючи два вектори, здатні до криптографічних операцій, і підтримує точність FP8. Ці блоки прискорюють векторизовані навантаження, які часто зустрічаються при обробці даних, попередній обробці машинного навчання, стисненні, шифруванні, наукових обчисленнях та аналітичних фреймворках. Підтримка Arm Scalable Vector Extension (SVE) забезпечує ефективне виконання як традиційних HPC-навантажень, так і нових конвеєрів обробки даних ШІ.

Execution Engine тісно інтегрований з високошвидкісною підсистемою пам’яті через чотири конвеєри читання та 2 конвеєри запису. Разом ці ресурси дозволяють Olympus підтримувати високу утилізацію як обчислювально-інтенсивних, так і пам’ятно-інтенсивних навантажень.

Просторове багатопотокове виконання Vera забезпечує вищу однопотокову пропускну здатність, ніж традиційні підходи SMT

NVIDIA використовує нове багатопотокове рішення в процесорах Vera під назвою Spatial Multi-Threading (Просторове багатопотокове виконання). Порівняно з традиційним SMT (Simultaneous Multi-Threading), підхід NVIDIA дозволяє розділяти ресурси між двома апаратними потоками всередині ядра Olympus, замість того, щоб покладатися переважно на вужче ядро.

Традиційний SMT досягає цього, дозволяючи обом апаратним потокам оппортуністично ділити одні й ті ж ресурси ядра. У щільно потокових середовищах з пісочницею таке спільне використання може створювати конфлікти ресурсів передбачення розгалужень, декодування, виконання, завантаження/збереження, кешу та пам’яті. Це створює ефект “шумного сусіда”, коли активність одного потоку може знижувати продуктивність іншого потоку, який ділить те ж ядро ​​в межах пісочниці. Для агентного ШІ, навчання з підкріпленням та хмарних сервісів, де паралельно виконується багато короткотривалих завдань і важлива кінцева затримка, це може збільшити варіативність та зробити продуктивність менш передбачуваною.

Завдяки цьому Vera пропонує ядро ​​з високою пропускною здатністю для одного потоку, коли це необхідно, тоді як пара потоків керує процесом. Маючи 88 ядер і 176 потоків, NVIDIA Vera — це гнучкий процесор, який забезпечує як високу однопотокову продуктивність, так і щільне розгортання в стилі vGPU.

NVIDIA Vera: Архітектура для епохи AI-агентів з рекордною продуктивністю одного ядра проти x86 6

Просторове багатопотокове виконання покращує детермінізм, ізоляцію та якість обслуговування порівняно з традиційними підходами SMT. Результатом є архітектура процесора, яка може обробляти велику кількість паралельних завдань агентів, зберігаючи при цьому більш стабільну затримку та пропускну здатність.

Підсистема пам’яті Vera – LP5X знижує споживання енергії порівняно з DDR DIMM

NVIDIA вибрала пам’ять LPDDR5X для своїх процесорів Vera, інтегрувавши вісім контролерів, що забезпечують пропускну здатність до 1,2 ТБ/с. Пам’ять LPDDR5X має ECC (Error-Correcting Code) рівня дата-центрів і дозволяє платформі значно зменшити енергоспоживання порівняно з традиційними серверами на базі DDR4. Чіп підтримує до 1,5 ТБ ємності LPDDR5X.

NVIDIA Vera: Архітектура для епохи AI-агентів з рекордною продуктивністю одного ядра проти x86 7

Використання пам’яті LPDDR5X у форм-факторі SOCAMM2 також відіграє важливу роль у підвищенні енергоефективності, а три основні цілі використання цього типу пам’яті включають:

  • Висока пропускна здатність – Забезпечення пропускної здатності пам’яті, необхідної для підтримки сучасних навантажень ШІ, аналітики та HPC.
  • Енергоефективність – Максимізація пропускної здатності на ват за допомогою технології LPDDR5X для зменшення загального енергоспоживання платформи.
  • Обслуговування підприємств – Забезпечення модульної, ремонтованої в польових умовах архітектури пам’яті, придатної для розгортань гіперскейл та корпоративного рівня.

Пам’ять LPDDR5X на Vera працює на швидкості 9600 MT/s, пропонуючи до 14 ГБ/с пропускної здатності пам’яті кожному ядру Olympus. Ємність пам’яті повністю масштабується від 256 ГБ до 1,5 ТБ.

NVIDIA Vera: Архітектура для епохи AI-агентів з рекордною продуктивністю одного ядра проти x86 8

Тепер, використання LP5X також має головну причину – зниження енергоспоживання. Традиційні стандарти DRAM, такі як DDR5 (DIMM, RDIMM, MRDIMM), пропонують вищу пропускну здатність, але також споживають значно більше енергії. Платформи RDIMM можуть споживати понад 100 Вт, тоді як рішення MRDIMM можуть використовувати понад 200 Вт енергії при навантаженнях з інтенсивною пропускною здатністю. SOCAMM2, з іншого боку, досягає швидкості до 1,2 ТБ/с, споживаючи лише 30-40 Вт, і це для повністю завантаженої системи.

На фронті вводу/виводу, безпеки та масштабування процесори NVIDIA Vera пропонують безліч технологічних інновацій, таких як:

  • NVLink-C2C 2-го покоління – Когерентний інтерконект з високою пропускною здатністю для зв’язку між процесором та GPU, а також між процесорами.
  • Двопроцесорне масштабування – Високошвидкісне когерентне з’єднання процесор-процесор для масштабованих двопроцесорних систем.
  • PCI Express 6.4 – Високопродуктивне підключення вводу/виводу для пристроїв зберігання даних, мережевих пристроїв та прискорювачів.
  • Compute Express Link (CXL) 3.1 – Розширює інфраструктуру PCIe для підтримки розширення пам’яті, пулування та композиційних архітектур систем.
  • Confidential Computing – Безпечне середовище масштабування для 2-процесорних та NVL-стійок.

Починаючи з PCIe, Vera використовує новітній стандарт PCIe 6.4, де кожен чіп пропонує до 88 ліній PCIe, а двопроцесорні конфігурації – 176 ліній. Вони працюють на швидкості до 64 GT/s, що подвоює пропускну здатність стандарту PCIe 5, і забезпечує достатню пропускну здатність для AIC та рішень зберігання даних. Vera також поставляється з широким набором розбиття ліній PCIe, як детально описано в таблиці нижче:

NVIDIA Vera: Архітектура для епохи AI-агентів з рекордною продуктивністю одного ядра проти x86 9

Подальше розширення до CXL 3.1 дозволяє розширення пам’яті наступного покоління та композиційну інфраструктуру з підтримкою пристроїв пам’яті CXL Type-3, окрім стандартного рішення LPDDR5X.

Vera підтримує Arm CCA, RME-DA та RME-CDA, забезпечуючи основу для ізоляції конфіденційних VM та безпечного призначення пристроїв. Ключі шифрування на VM дозволяють криптографічну ізоляцію між орендарями, що працюють на процесорі Vera, тоді як підтримка пристроїв з підтримкою TDISP розширює середовище довіреного виконання за межі процесора.

NVIDIA Vera: Архітектура для епохи AI-агентів з рекордною продуктивністю одного ядра проти x86 10

Як перший у галузі процесор Confidential Computing, який підтримує TDISP для когерентних пристроїв, таких як GPU, Vera забезпечує високопродуктивний, когерентний доступ без буферів пересилки або непотрібного копіювання даних, зберігаючи при цьому надійну ізоляцію навантажень. Щодо безпеки, надійності та доступності, Vera пропонує наступне:

NVIDIA Vera: Архітектура для епохи AI-агентів з рекордною продуктивністю одного ядра проти x86 11
Функція RAS Опис
Багатосимвольна корекція ECC Виправляє багатосимвольні помилки пам’яті, забезпечуючи надійність пам’яті корпоративного класу.
Звітування про багатобітові виправні помилки Повідомляє про багатобітові виправні події ECC прошивці та операційній системі, дозволяючи ранню діагностику та проактивне обслуговування.
Записи про помилки RAS Впроваджує записи RAS для послідовного звітування про помилки, діагностики та інтеграції з операційною системою.
Жорсткий ремонт після виробництва (PPR) Назавжди ремонтує дефектні місця пам’яті, виявлені під час виробництва або розгортання, покращуючи довгострокову надійність пам’яті.
Офлайнінг сторінок Виводить з роботи сторінки пам’яті, які зазнали невідновлюваних помилок, зменшуючи радіус ураження від збою та покращуючи доступність системи.
Запасний канал Перенаправляє звернення до пам’яті від деградованих каналів або ресурсів каналу, покращуючи доступність платформи та відмовостійкість.
Модульна підтримка SOCAMM2 Дозволяє заміну та обслуговування модулів пам’яті в польових умовах без заміни процесора чи материнської плати.
Підтримка інжекції помилок Надає апаратну підтримку для інжекції помилок для перевірки прошивки, потоків відновлення операційної системи та механізмів RAS платформи.

Процесор NVIDIA Vera є революційним досягненням у дизайні процесорів, спеціально створеним для наступної ери агентного ШІ та навантажень навчання з підкріпленням. Використовуючи інноваційну архітектуру ядра Olympus з кастомною технологією Armv9.2, Vera забезпечує виняткову однопотокову продуктивність завдяки мікроархітектурі з високим IPC, що включає в себе передове нейронне передбачення розгалужень, складні методи паралелізму mid-core, такі як передбачення пам’яті та значень, потужний execution engine з векторними можливостями та оптимізовану підсистему кешу.

NVIDIA Vera: Архітектура для епохи AI-агентів з рекордною продуктивністю одного ядра проти x86 12

Його підхід до просторового багатопотокового виконання забезпечує чудовий детермінізм та ізоляцію порівняно з традиційними методами SMT, тоді як інтеграція високошвидкісної пам’яті LPDDR5X, NVLink-C2C 2-го покоління, PCIe 6.4, CXL 3.1 та комплексних функцій конфіденційних обчислень забезпечує безперебійну оркестрацію процесора та GPU, масивну масштабованість та підвищену безпеку.

Усуваючи традиційні “вузькі місця” у виконанні, оцінці та переміщенні даних, Vera досягає до 50% кращого IPC порівняно зі своїми попередниками, пропонуючи безпрецедентну ефективність, пропускну здатність та продуктивність з низькою затримкою, оптимізовану для складних, паралельних середовищ ШІ – позиціонуючи його як справжню альтернативу x86 та наріжний камінь для майбутніх систем ШІ.

NVIDIA Vera: Архітектура для епохи AI-агентів з рекордною продуктивністю одного ядра проти x86 13

Про автора: Хасан Муджтаба, інженер-програміст за освітою та ентузіаст ПК за покликанням, є старшим редактором розділу апаратного забезпечення Wccftech. Маючи багаторічний досвід у галузі, він спеціалізується на глибокому технічному аналізі процесорних та графічних архітектур наступного покоління, материнських плат та систем охолодження. Його робота включає не тільки найсвіжіші новини про майбутні технології, але й розширені практичні огляди та тестування.

Слідкуйте за Wccftech на Google, щоб отримувати більше новин у своїх стрічках.

Подальше читання

NVIDIA Vera: Архітектура для епохи AI-агентів з рекордною продуктивністю одного ядра проти x86 14

Apple може доцільно використовувати лише низькоспецифіковані чіпи LPDDR5X від CXMT в iPhone 18e, але Bank of America вважає, що головна мета Apple – посилити свою переговорну позицію

Рохайль СалімNVIDIA Vera: Архітектура для епохи AI-агентів з рекордною продуктивністю одного ядра проти x86 15

Apple A20 Pro порушить 13-річну традицію з 96-бітним LPDDR6, але зекономить на NAND для iPhone 18 Pro Duo в якості компенсації

Рохайль СалімNVIDIA Vera: Архітектура для епохи AI-агентів з рекордною продуктивністю одного ядра проти x86 16

GMKtec випускає EVO-X3 на базі AMD Ryzen AI Max+ 395 з 126 TOPS AI-потужності, стартова ціна $3600

Сарфраз ХанNVIDIA Vera: Архітектура для епохи AI-агентів з рекордною продуктивністю одного ядра проти x86 17

Дефіцит HBM змушує AMD випустити свій перший SoC з пам’яттю на чіпі: зустрічайте Versal Gen 2 з на 60% меншою площею, у 10 разів більшою обчислювальною потужністю та підтримкою PCIe6

Хасан Муджтаба

Подробиці можна знайти на сайті: wccftech.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *