
Процесор NVIDIA Vera значно перевершує x86-чіпи, як-от AMD EPYC, у робочих навантаженнях Agentic AI, демонструючи на 6x вищу продуктивність та на 40% нижчу затримку.
Монолітна архітектура та інноваційні зміни NVIDIA Vera забезпечують понад 2-кратне зростання продуктивності порівняно з x86-процесорами, такими як AMD EPYC, маючи лише 88 ядер проти 128
Сьогодні NVIDIA розкриває повні дані про продуктивність свого процесора Vera у порівнянні з рішеннями x86. Ми вже детально розглянули його архітектуру, а тепер зосередимося на продуктивних можливостях цього чіпа. NVIDIA оцінює Vera за чотирма ключовими критеріями, що є найважливішими в епоху Agentic AI:
- Пропускна здатність та затримка пам’яті – демонструє, як Vera забезпечує ядра даними завдяки високопродуктивній пам’яті, низькій затримці доступу та швидкій когерентній шині.
- Продуктивність прикладних робочих навантажень – показує результати на агентних бенчмарках, при обробці даних, графових обчисленнях та інших CPU-інтенсивних завданнях.
- IPC ядер – оцінює вплив мікроархітектури Olympus, включаючи ширший фронтенд, вдосконалене передбачення розгалужень, глибоке виконання поза чергою та розширені ресурси виконання.
- Продуктивність RL та Agentic AI – висвітлює переваги Vera для чутливих до затримок, складних у розгалуженнях та висококонкурентних агентних середовищ.

Перш ніж перейти до бенчмарків, зазначимо, що NVIDIA активно використовувала в порівнянні чіп AMD EPYC Turin “Zen 5”, підкреслюючи монолітну природу свого чіпа та його переваги над x86-рішеннями.

Архітектурні бенчмарки
NVIDIA розділила бенчмарки на дві категорії: одна зосереджена на архітектурних аспектах, а інша – на тому, як архітектура покращує робочі процеси ШІ. Перший архітектурний бенчмарк демонструє приріст IPC Vera в різних робочих навантаженнях, що навантажують великі інструкційні поля, щільний потік керування, поведінку компілятора та середовища виконання, а також довгі ланцюжки залежностей. Тут Vera забезпечує приріст до 1.9x порівняно з AMD Zen 5 (EPYC Turin), демонструючи значне зростання однопотокової продуктивності, що є ключовим фактором для додатків Agentic AI та RL.

Передбачення розгалужень на ядрах Olympus від NVIDIA працює до 2.3x швидше, а в середньому на 2x швидше порівняно з AMD Zen 5. Показник взятих розгалужень за цикл демонструє приріст у 3.5x.

Olympus розроблено для забезпечення стабільної обробки великої кількості розгалужень у щільних та різноманітних патернах, що стало можливим завдяки нейронному передвіснику розгалужень, на додаток до інших спеціалізованих передвісників. Блок передбачення розгалужень (BPU) Olympus працює з вищою ефективною швидкістю, зберігаючи при цьому перевагу MPKI (промахи передбачення на 1000 інструкцій), що забезпечує більш корисні потоки інструкцій для широкого конвеєра декодування та виконання. Результатом є краще використання фронтенду, менше витрачених циклів та більше корисних інструкцій, що забезпечує до 3.5x вищу кількість взятих розгалужень за цикл.
Ядро Olympus має 64 КБ кешу інструкцій з високою пропускною здатністю 128 байт за цикл та 10-широким декодуванням, не покладаючись на кеш uOP у стилі x86, що забезпечує до 2.4x виграшу над Zen 5 в операціях вибірки інструкцій за цикл.

І, нарешті, операції в бекенді за цикл, які до 4.3x швидші та в середньому понад 3x швидші порівняно з Zen 5.

Olympus розроблено для забезпечення стабільної обробки великої кількості розгалужень у щільних та різноманітних патернах, що стало можливим завдяки нейронному передвіснику розгалужень, на додаток до інших спеціалізованих передвісників. Блок передбачення розгалужень (BPU) Olympus працює з вищою ефективною швидкістю, зберігаючи при цьому перевагу MPKI (промахи передбачення на 1000 інструкцій), що забезпечує більш корисні потоки інструкцій для широкого конвеєра декодування та виконання. Результатом є краще використання фронтенду, менше витрачених циклів та більше корисних інструкцій, що забезпечує до 3.5x вищу кількість взятих розгалужень за цикл.

Бенчмарки робочих навантажень ШІ
Перший бенчмарк зосереджений на затримці доступу до пам’яті. NVIDIA стверджує, що традиційні x86-процесори наразі використовують чіплетну архітектуру. Такий дизайн призводить до недоліків у підсистемах пам’яті при великій кількості запитів між ядрами. Це створює вузькі місця в підсистемі пам’яті та когерентній шині, в результаті чого додаткові переходи збільшують затримку та зменшують ефективну пропускну здатність, що призводить до зниження продуктивності.

У порівнянні видно, що процесор AMD EPYC Turin 9755, починаючи з аналогічної початкової затримки (~120 нс), досягає 350 нс при зростанні попиту на пропускну здатність пам’яті. Vera ж, натомість, забезпечує втричі більшу пропускну здатність при 40-кратно нижчій піковій затримці при 90% використанні пам’яті.

Процесори NVIDIA Vera також пропонують значно вищу пропускну здатність пам’яті на ядро. Чіп Turin має 128 ядер, кожне з яких отримує приблизно 3.1 ГБ/с пропускної здатності. Vera має 88 ядер, і кожне ядро отримує близько 12.7 ГБ/с пропускної здатності, що в 4 рази більше, ніж у EPYC, а пікова пропускна здатність пам’яті на ядро досягає 14 ГБ/с у певних сценаріях використання. Такі характеристики пропускної здатності пам’яті на ядро є важливими для робочих навантажень Agentic AI, де багато потоків працюють з великими, нерегулярними наборами даних і можуть швидко обмежитися пропускною здатністю пам’яті, а не обчислювальними ресурсами.

Додатково впливає на продуктивність чіплетних рішень додавання десятків окремих I/O та обчислювальних чіплетів. Коли дані переміщуються з одного ядра на інше, вони можуть пройти через кристал джерела, транзитний пакет через I/O-кристал, досягти іншого ядра, а потім пройти подібний шлях назад для когерентних відповідей. Кожен перехід між кристалами додає затримку, споживає пропускну здатність пакету та створює варіативність залежно від фізичного розташування комунікуючих ядер. Результатом є вища затримка між ядрами та зниження продуктивності.
На тепловій карті затримки між ядрами видно, що NVIDIA Vera забезпечує на 50% меншу затримку порівняно з чіпом AMD EPYC 9755. Ще більш вражаючим є те, що Vera демонструє стабільну затримку між усіма парами ядер, що ще раз підкреслює, як її монолітна архітектура була розроблена з нуля для робочих процесів ШІ.

Далі ми переходимо до агентних бенчмарків, які є основною причиною створення Vera. У Spec CPU 2006 NVIDIA вимірює продуктивність на ядро для повністю завантаженої системи. Програмний стек тут вимірює продуктивність у виконанні Python, компіляції коду, статичному аналізі та програмних робочих процесах, керованих інструментами.
Повністю завантажена продуктивність на ядро відображає, наскільки добре кожне ядро підтримує пропускну здатність, ділячи ресурси сокету: потужність, пропускну здатність пам’яті, кеш та шину.
Процесор NVIDIA Vera показав до 1.8x вищу продуктивність у Python порівняно з AMD EPYC. Решта бенчмарків демонструють зростання продуктивності до 1.7x, що майже вдвічі перевищує показники конкурентів x86.

В алгоритмах обходу графів процесор NVIDIA Vera демонструє приріст продуктивності на 2.6x порівняно з AMD Turin. Графові робочі процеси чутливі до пропускної здатності та кешу, і тут підсистеми пам’яті та кешу NVIDIA в Vera демонструють свій повний потенціал.

NVIDIA також демонструє масштабування своего ядра для обходу графів у робочих навантаженнях Page Rank, які також навантажують конвеєр ядра, шину та пропускну здатність пам’яті. Тут Vera досягає монументального виграшу у 29.3x при кількості ядер 32.

Нарешті, ClickHouse — це високопродуктивна колонкова база даних, що використовується для онлайн-аналітичної обробки. Vera демонструє 20% приріст продуктивності порівняно з чіпом AMD EPYC Turin і показує себе як чудове рішення для аналітичних робочих процесів та ETL (Extract-Transform-Load), що вимагають інтенсивного сканування, агрегації та високої конкурентності.

Процесор NVIDIA Vera є значним архітектурним проривом для високопродуктивних обчислень, особливо у вимогливій сфері робочих навантажень Agentic AI. Використовуючи монолітний дизайн замість підходу на основі чіплетів, поширеного в сучасних x86-процесорах, Vera долає критичні вузькі місця в підсистемах пам’яті, когерентній шині та між’ядерній комунікації. Це призводить до різкого зменшення та підвищення стабільності затримки, водночас забезпечуючи значно вищу пропускну здатність пам’яті на ядро.

Цілиться на ринок з оборотом 200 мільярдів доларів
Процесор NVIDIA Vera претендує на лідерство в гонці CPU для Agentic AI. Компанія вже заявила, що Vera має потенціал стати провідним CPU, що постачається у 2026 році, і вже має багато ранніх користувачів, таких як OpenAI, Anthropic, SpaceX та Perplexity. Процесор розгортається в різних суперкомп’ютерних центрах і хмарних дата-центрах, а також матиме повноцінну підтримку від безлічі партнерів по екосистемі.




2 з 9
Оптимізований з нуля для нерегулярних, вимогливих до пропускної здатності та інтенсивних до конкуренції робочих навантажень ШІ, Vera не тільки підтримує вищу пропускну здатність на ядро під повним навантаженням, але й встановлює новий стандарт ефективної, масштабованої обробки в дата-центрах ШІ.

Про автора: Хассан Муджтаба, інженер-програміст за освітою та ентузіаст ПК за покликанням, є старшим редактором Wccftech, що відповідає за розділ апаратного забезпечення. Маючи багаторічний досвід роботи в галузі, він спеціалізується на глибокому технічному аналізі процесорів та графічних архітектур наступного покоління, материнських плат та рішень для охолодження. Його робота включає не тільки новини про майбутні технології, але й докладні огляди та тестування.
Підписуйтесь на Wccftech у Google, щоб отримувати більше новин у своїх стрічках.
Подальше читання

Perplexity робить ставку на процесор NVIDIA Vera, називаючи максимальний одноядерний чіп «ідеальним» рішенням після того, як він працював на 1.5x швидше в Agentic Coding
Hassan Mujtaba
Від ПК до серверів, DDR4 пам’ять знову в дії, оскільки дефіцит DDR5 триває
Hassan Mujtaba
Qualcomm стверджує, що її перший серверний процесор Dragonfly C1000 лідирує за одноядерною продуктивністю, пропонуючи 250+ ядер та 5 ГГц до 2028 року
Hassan Mujtaba
Перший власний чіп OpenAI — гарячий, як Халапеньйо, для ШІ, оскільки компанія називає його «найкращою платформою для інференсу» для LLM
Hassan Mujtaba
За даними порталу: wccftech.com
