
Процесор NVIDIA Vera CPU розроблено для систем навчання з підкріпленням та агентного ШІ, пропонуючи 88 ядер Olympus для максимальної продуктивності одного ядра.
CPU NVIDIA Vera – “Вбивця x86” – вже доступний, створений виключно з орієнтацією на агентний ШІ
Зростання кількості завдань агентного ШІ та навчання з підкріпленням, що стає ключовим механізмом масштабування для покращення можливостей моделей, зробило процесори життєво важливим компонентом систем ШІ. Без швидкого процесора (для виконання, оцінки, оркестрації) графічний процесор не зможе отримувати контекст, що призводить до значних недоліків та неефективності. Саме тому NVIDIA розробила Rubin, процесор, спеціально створений для агентів, чіп, який усуває ці вузькі місця, забезпечуючи пропускну здатність та ефективність, яких вимагає галузь.

Сьогодні ми детально розглянемо Vera, новітній та найдосконаліший процесор NVIDIA для ШІ, побудований на користувацьких ядрах Arm.
Внутрішня будова CPU Vera
На високому рівні, процесор NVIDIA Vera базується на архітектурі ядер Olympus, яка використовує власні IP-блоки Armv9.2. Він побудований на монолітному обчислювальному кристалі та оснащений такими технологіями, як NVIDIA Scalable Coherency Fabric 2-го покоління (SCF), Confidential Computing (TEE-I/O Capable) та x16 PCIe Gen6 CXL 3.1.
Ключові переваги NVIDIA Scalable Coherency Fabric включають:
- Комунікація між кластерами процесорів з низькою затримкою
- Ефективний доступ до ресурсів спільного кешу системного рівня
- Високошвидкісне підключення до контролерів пам’яті
- Нативна інтеграція з NVLink-C2C та інфраструктурою прискорювачів
Функція Brand Prediction включає нейронні та спеціалізовані предиктори з двома операціями розгалуження за цикл. Він має 10-кратне декодування інструкцій, новий графічний та розширений предиктор, 96 КБ кешу L1D, 64 КБ кешу L1I, 2 МБ кешу L2 та 164 МБ кешу L3. Кожне ядро має доступ до пропускної здатності 14 ГБ/с. Інтерконект NVLink C2C забезпечує до 1.8 ТБ/с узгодженої пропускної здатності CPU-GPU.
Загалом, Vera має 88 “високопродуктивних” ядер Olympus та 176 просторових багатопотокових потоків NVIDIA. Чіп інтегрує широку мікроархітектуру з високим IPC, розроблену для забезпечення максимальної продуктивності одного потоку, досягаючи ефективної паралельності в тисячах програмних середовищ.
| Ядра / Потоки | 88 / 176 |
| Кеш L2 | 2 МБ на ядро |
| Кеш L3 | 164 МБ на процесор |
| Пам’ять | До 1.5 ТБ SOCAMM2 LPPDDR5X |
| Швидкість пам’яті | До 9600 МТ/с |
| Пропускна здатність пам’яті | До 1.2 ТБ/с (сукупна), 14 ГБ/с (на ядро) |
| PCIe | 88 ліній PCIe 6.4 (тільки CPU), 96 ліній PCIe 6.4 (Vera Rubin), розподіл до x2, CXL 3.1 |
| Конфігурований TDP | 250Вт – 450Вт |
Olympus – Вершина ШІ
Olympus, ядро, що живить Vera, називається обчислювальним рушієм процесора. Воно розроблено з нуля з єдиною метою: максимізувати IPC (інструкції за цикл) для нерегулярного, інтенсивного розгалуження, чутливого до затримок та високопаралельного програмного забезпечення. Порівняно з Grace, Vera досягає 50% приросту IPC. Архітектура процесора Vera має чотири ключові компоненти:
- Front End: Оптимізовані предиктори розгалуження
- Mid Core: Прискорення критичного шляху
- Execution Engine: Оптимізація складних векторів
- Cache Subsystem: Шляхи інструкцій та даних, оптимізовані для затримки
Нижче наведено блок-схему ядра Olympus:
Нейронний предиктор розгалуження Olympus
Починаючи з розбору ядра Olympus, перш за все, ми маємо Нейронний предиктор розгалуження, який розроблений для підвищення точності прогнозування складного програмного забезпечення з інтенсивним розгалуженням.

NBP вивчає довгострокову поведінку керування потоком та статистично упереджені шаблони розгалуження, які поширені у великих середовищах виконання, інтерпретаторах, базах даних, компіляторах та агентних навантаженнях. Покращення прогнозування розгалужень дозволяють фронтальній частині Olympus отримувати корисні інструкції, що, у свою чергу, забезпечує вищу пропускну здатність інструкцій та більш стабільну продуктивність.
Середнє ядро Olympus (Mid Core)
Mid Core в Olympus перетворює декодовані інструкції на виконувані операції, максимізуючи паралелізм на рівні інструкцій та пам’яті. Olympus Mid Core розроблено для виявлення та виконання незалежної роботи, прихованої за цими вузькими місцями, забезпечуючи вищу утилізацію ресурсів виконання та покращений загальний IPC.

Mid Core оснащено широким механізмом перейменування та виділення ресурсів, який підтримується великим буфером повторного замовлення та значними ресурсами фізичних регістрів. Перейменування регістрів Mid Core усуває помилкові залежності між інструкціями, дозволяючи процесору виявляти додатковий паралелізм та виконувати інструкції, як тільки їхні справжні операнди стають доступними. Велике вікно інструкцій дозволяє Olympus заглядати значно далі в потік інструкцій, знаходячи корисну роботу, тоді як інші інструкції чекають на пам’ять або вирішення гілок.
Olympus також містить кілька технологій для розриву залежностей, таких як:
- Перейменування пам’яті: Прискорює ланцюжки залежностей від запису до читання, дозволяючи виконувати залежні інструкції до завершення читання, коли зв’язок даних може бути передбачений або визначений. Це особливо корисно для програм з інтенсивним використанням вказівників, обходу графів, середовищ виконання та складних об’єктно-орієнтованих навантажень.
- Прогнозування значень: Виявляє стабільні ланцюжки залежностей і передбачає майбутні значення до їх створення, дозволяючи залежним інструкціям виконуватися спекулятивно, поки правильність перевіряється пізніше. Ця можливість особливо ефективна для повторюваних програмних шаблонів та послідовних структур даних.
- Усунення переміщень та оптимізація значень: Техніки для досягнення вищої утилізації.
Виконавчий механізм Olympus (Execution Engine)
Виконавчий механізм ядра Olympus розроблений для підтримки високої пропускної здатності інструкцій для різних навантажень, включаючи середовища агентного ШІ, RL-середовища, бази даних тощо. Після проходження інструкцій через етапи перейменування та планування, вони динамічно розподіляються на спеціалізовані ресурси виконання, оптимізовані для цілочисельної арифметики, обробки розгалужень, векторних обчислень та операцій з пам’яттю.
Поєднання широкого виконавчого бекенду та глибокого механізму позачергового виконання дозволяє ядрам Olympus продовжувати прогресувати, навіть коли деякі частини робочих навантажень сповільнюються доступом до пам’яті, вирішенням розгалужень або довгими ланцюжками залежностей.
Таким чином, для виконавчого механізму NVIDIA інтегрує 8 простих АЛП, 2 складні АЛП та 4 виділені одиниці виконання розгалужень. Прості АЛП обробляють стандартні арифметичні та логічні операції, тоді як складні АЛП прискорюють операції з вищою затримкою, такі як множення, ділення, CRC та навантаження, інтенсивні щодо зсувів.

Виділені одиниці розгалуження працюють у поєднанні з розширеною підсистемою прогнозування розгалужень для швидкого вирішення рішень щодо потоку керування та мінімізації збоїв конвеєра. Це поєднання особливо корисне для сучасних агентних навантажень, які часто демонструють нерегулярний потік керування та часті розгалуження, коли агенти міркують, оцінюють стан та виконують дії.
Для векторних обчислень та обчислень, орієнтованих на ШІ, Olympus інтегрує шість 128-бітних векторних виконавчих блоків SVE, включаючи два конвеєри векторів, здатні до криптографії, та підтримує точність FP8. Ці блоки прискорюють векторизовані робочі навантаження, які зазвичай зустрічаються в обробці даних, попередній обробці машинного навчання, стисненні, шифруванні, наукових обчисленнях та аналітичних фреймворках. Підтримка Arm Scalable Vector Extension (SVE) забезпечує ефективне виконання як традиційних HPC-навантажень, так і нових конвеєрів обробки даних ШІ.
Виконавчий механізм тісно інтегрований з високошвидкісною підсистемою пам’яті через чотири конвеєри завантаження та 2 конвеєри збереження. Разом ці ресурси дозволяють Olympus підтримувати високу утилізацію як обчислювально-інтенсивних, так і пам’ятно-інтенсивних робочих навантажень.
Просторове багатопотоковість Vera забезпечує вищу пропускну здатність одного потоку, ніж традиційні підходи SMT
NVIDIA використовує нове рішення для багатопотоковості в процесорах Vera, яке називається Spatial Multi-Threading (Просторове багатопотоковість). Порівняно з традиційним SMT (Simultaneous Multi-Threading – одночасна багатопотоковість), підхід NVIDIA дозволяє розділяти ресурси між двома апаратними потоками всередині ядра Olympus, а не покладатися переважно на вужче ядро.
Традиційний SMT досягає цього, дозволяючи обом апаратним потокам вибірково використовувати одні й ті самі ресурси ядра. У щільних пісочницях з великою кількістю потоків таке спільне використання може створювати конфлікти між прогнозуванням розгалужень, декодуванням, виконанням, завантаженням/збереженням, кешуванням та ресурсами пам’яті. Це створює ефект “шумного сусіда”, коли активність одного потоку може знизити продуктивність іншого потоку, що спільно використовує те саме ядро в межах пісочниці. Для агентного ШІ, навчання з підкріпленням та хмарних сервісів – де одночасно виконується багато короткотривалих завдань, а затримка хвоста має значення – це може збільшити варіативність та зробити продуктивність менш передбачуваною.
Таким чином, Vera пропонує високопродуктивне ядро з одним потоком, коли це необхідно, тоді як пара потоків керує управлінням. Маючи 88 ядер та 176 потоків, NVIDIA Vera є гнучким процесором, який пропонує як високу продуктивність одного потоку, так і щільне розгортання типу vGPU.

Просторова багатопотоковість покращує детермінізм, ізоляцію та якість обслуговування порівняно з традиційними підходами SMT. Результатом є архітектура процесора, яка може запускати велику кількість одночасних агентних завдань, підтримуючи при цьому більш стабільну затримку та пропускну здатність.
Підсистема пам’яті Vera – LP5X знижує енергоспоживання порівняно з DDR DIMM
NVIDIA обрала пам’ять LPDDR5X для своїх процесорів Vera, інтегрувавши чіп з вісьмома контролерами, що забезпечують пропускну здатність до 1.2 ТБ/с. Пам’ять LPDDR5X має клас ECC (Error-Correcting Code) для центрів обробки даних та дозволяє платформі значно знизити енергоспоживання порівняно з традиційними серверами на базі DDR4. Чіп підтримує до 1.5 ТБ ємності LPDDR5X.

Використання пам’яті LPDDR5X у форм-факторі SOCAMM2 також відіграє важливу роль у підвищенні енергоефективності, тоді як три основні цілі використання цього типу пам’яті включають:
- Висока пропускна здатність – забезпечення пропускної здатності пам’яті, необхідної для сучасних робочих навантажень ШІ, аналітики та HPC.
- Енергоефективність – максимальна пропускна здатність на ват за допомогою технології LPDDR5X для зниження загального енергоспоживання платформи.
- Можливість обслуговування підприємства – забезпечення модульної, ремонтопридатної в польових умовах архітектури пам’яті, придатної для розгортань у гіпермасштабі та корпоративному секторі.
Пам’ять LPDDR5X на Vera працює на швидкості 9600 МТ/с, забезпечуючи до 14 ГБ/с пропускної здатності пам’яті для кожного ядра Olympus. Ємність пам’яті повністю масштабується від 256 ГБ до 1.5 ТБ.

Використання LP5X також має вагому причину, і це зниження енергоспоживання. Традиційні стандарти DRAM, такі як DDR5 (DIMM, RDIMM, MRDIMM), пропонують вищу пропускну здатність, але також споживають набагато більше енергії. Платформи RDIMM можуть споживати понад 100 Вт, тоді як рішення MRDIMM можуть використовувати понад 200 Вт енергії при роботі з великими навантаженнями пам’яті. SOCAMM2, з іншого боку, досягає швидкості до 1.2 ТБ/с, споживаючи лише 30-40 Вт, і це для повністю завантаженої системи.
IOs – PCIe 6.4, NVLink 2-го покоління, двопроцесорне масштабування та конфіденційні обчислення
У сфері IO, безпеки та масштабування процесори NVIDIA Vera пропонують безліч технологічних інновацій, таких як:
- NVLink-C2C другого покоління – високошвидкісний узгоджений інтерконект для комунікації CPU-GPU та CPU-CPU.
- Двопроцесорне масштабування – високошвидкісне узгоджене з’єднання процесор-процесор для масштабованих двопроцесорних систем.
- PCI Express 6.4 – високопродуктивне IO-підключення для пристроїв зберігання, мережі та прискорювачів.
- Compute Express Link (CXL) 3.1 – Розширює інфраструктуру PCIe для підтримки розширення пам’яті, пулінгу та композиційних системних архітектур.
- Confidential Computing – безпечне середовище масштабування для 2-процесорних та NVL-стійок.
Починаючи з PCIe, Vera використовує найновіший стандарт PCIe 6.4, при цьому кожен чіп пропонує до 88 ліній PCIe, а двопроцесорні конфігурації – 176 ліній. Вони працюють на швидкості до 64 ГТ/с, подвоюючи пропускну здатність стандарту PCIe 5, і забезпечують достатню пропускну здатність для AIC та рішень зберігання. Vera також поставляється з широким набором біфуркацій ліній PCIe, як детально описано в таблиці нижче:

Подальше розширення до CXL 3.1 забезпечує розширення пам’яті нового покоління та композиційну інфраструктуру з підтримкою пристроїв пам’яті CXL Type-3, окрім стандартного рішення LPDDR5X.
Vera підтримує Arm CCA, RME-DA та RME-CDA, забезпечуючи основу для ізоляції конфіденційних VM та безпечного призначення пристроїв. Ключі шифрування для кожного VM забезпечують криптографічну ізоляцію між орендарями, що працюють на процесорі Vera, тоді як підтримка пристроїв, здатних до TDISP, розширює середовище довіреного виконання за межі процесора.

Як перший у галузі процесор Confidential Computing, що підтримує TDISP для узгоджених пристроїв, таких як GPU, Vera забезпечує високопродуктивний, узгоджений доступ без буферів відскоку або непотрібного копіювання даних, зберігаючи при цьому сильну ізоляцію робочих навантажень. У сфері безпеки, надійності та доступності Vera пропонує наступне:

| Функція RAS | Опис |
|---|---|
| Багатосимвольне виправлення ECC | Виправляє багатосимвольні помилки пам’яті, забезпечуючи надійність пам’яті корпоративного класу. |
| Звіт про багатобітові виправні помилки | Повідомляє про багатобітові виправні ECC-події до прошивки та операційної системи, дозволяючи проводити ранню діагностику та профілактичне обслуговування. |
| Записи про помилки RAS | Реалізує записи RAS для послідовного звітування про помилки, діагностики та інтеграції з операційною системою. |
| Жорстке відновлення після пакування (PPR) | Постійно відновлює дефектні місця пам’яті, виявлені під час виробництва або розгортання, покращуючи довгострокову надійність пам’яті. |
| Виведення сторінок з роботи | Виводить з роботи сторінки пам’яті, що зазнали невідновлюваних помилок, зменшуючи радіус ураження від збоїв та підвищуючи доступність системи. |
| Резервування каналу | Перенаправляє доступи до пам’яті подалі від деградованих каналів або ресурсів каналу, підвищуючи доступність платформи та відмовостійкість. |
| Модульна підтримка SOCAMM2 | Дозволяє замінювати модулі пам’яті в польових умовах без заміни процесора або материнської плати. |
| Підтримка введення помилок | Забезпечує апаратну підтримку введення помилок для перевірки прошивки, потоків відновлення операційної системи та механізмів RAS платформи. |
Процесор NVIDIA Vera є революційним досягненням у дизайні процесорів, створеним спеціально для наступної ери робочих навантажень агентного ШІ та навчання з підкріпленням. Використовуючи інноваційну архітектуру ядра Olympus з власною технологією Armv9.2, Vera забезпечує виняткову продуктивність одного потоку завдяки мікроархітектурі з високим IPC, що включає розширене нейронне прогнозування розгалужень, складні методи паралелізму середнього ядра, такі як прогнозування пам’яті та значень, потужний виконавчий механізм з векторними можливостями та оптимізовану підсистему кешу.

Його підхід до просторової багатопотоковості забезпечує чудовий детермінізм та ізоляцію порівняно з традиційними підходами SMT, тоді як інтеграція високошвидкісної пам’яті LPDDR5X, NVLink-C2C другого покоління, PCIe 6.4, CXL 3.1 та комплексні функції конфіденційних обчислень забезпечують безперебійну оркестрацію CPU-GPU, масивне масштабування та підвищену безпеку.
Усунувши традиційні вузькі місця у виконанні, оцінці та переміщенні даних, Vera досягає до 50% кращого IPC порівняно з попередніми моделями, пропонуючи безпрецедентну ефективність, пропускну здатність та продуктивність з низькою затримкою, адаптовану для складних, одночасних середовищ ШІ – позиціонуючи його як справжню альтернативу x86 та наріжний камінь для майбутніх систем ШІ.

Про автора: Хассан Муджтаба, інженер-програміст за освітою та ентузіаст ПК за покликанням, є старшим редактором розділу апаратного забезпечення Wccftech. Маючи багаторічний досвід у галузі, він спеціалізується на глибокому технічному аналізі процесорних та графічних архітектур наступного покоління, материнських плат та систем охолодження. Його робота включає не лише новини про майбутні технології, але й розширені практичні огляди та бенчмарки.
Слідкуйте за Wccftech у Google, щоб отримувати більше наших новин у своїх стрічках.
Подальше читання

Apple може реально використовувати лише низькоспецифічні чіпи LPDDR5X від CXMT в iPhone 18e, але Bank of America вважає, що головна мета Apple — посилити свою переговорну силу
Рохаіл Салім
Apple A20 Pro зламає 13-річну традицію за допомогою 96-бітної LPDDR6, але заощадить на NAND в iPhone 18 Pro Duo як противагу
Рохаіл Салім
GMKtec випустила EVO-X3 на базі AMD Ryzen AI Max+ 395 з потужністю ШІ до 126 TOPS, ціна від $3600
Сарфраз Хан
Дефіцит HBM спонукає AMD випустити свій перший SoC з пам’яттю на чіпі, зустрічайте Versal Gen 2 з на 60% меншою площею на платі, обчисленнями в 10 разів більшими та підтримкою PCIe6
Хассан Муджтаба
Інформація підготовлена на основі матеріалів: wccftech.com
