Платформа NVIDIA Vera Rubin пропонує революційну пропускну здатність токенів за значно нижчою ціною, ніж Blackwell, демонструючи свої можливості в галузі Agentic AI.
Оптимізація програмного стеку NVIDIA продовжує розвивати Blackwell, але Vera Rubin належить до зовсім іншої ліги для випадків використання Agentic AI
Найновіші результати продуктивності agentic AI на чіпах були виміряні NVIDIA з використанням реальних агентських траєкторій кодування. Використаний бенчмарк — SemiAnalysis AgentX, який оцінює AI-інфраструктуру, як-от Vera Rubin, у задачах виведення agentic-coding для різних моделей, таких як Kimi K3, MiniMax M3, GLM5.3, Qwen3.5 та DeepSeek V4 Pro.
У наступній таблиці пояснюються ключові показники AgentX:
| Показник | Визначення | Корисність |
| E2E Normalized Interactivity | Середня швидкість вихідних токенів на користувача за повний запит, розрахована шляхом ділення загальної кількості вихідних токенів на час від надсилання запиту до доставки останнього токена. | Показує, скільки видимого користувачем виведення надає платформа на мегават для заданого кінцевого досвіду, включно з часом до першого токена. Чим вище, тим краще. |
| Standard Interactivity | Швидкість токенів на користувача під час генерації, розрахована як вихідні токени, поділені на час, що минув від першого до останнього токена. | Показує, скільки потокового виведення надає платформа на мегават після початку генерації, виключаючи час до першого токена. Чим вище, тим краще. |
| E2E Latency | Загальний час, що минув для одного запиту, виміряний від надсилання до надходження останнього вихідного токена. | Перевіряє, чи є результат пропускної здатності на мегават придатним для використання: висока ефективність не допоможе, якщо запити завершуються занадто довго. Чим менше, тим краще. |
| TTFT | Час, що минув від надсилання до надходження першого вихідного токена. | Показує, чи поєднується енергоефективна пропускна здатність із швидкою першою відповіддю, що є критично важливим, коли агенти неодноразово розпочинають довгі контекстні повороти. Чим нижче, тим краще. |
Спочатку результати NVIDIA Blackwell. Сервер GB300 NVL72 “Grace Blackwell” забезпечує в 15 разів вищу пропускну здатність на МВт порівняно з рішеннями H200 NVL8 “Hopper” у DeepSeek-v4-PRO 1.6T. Рішення Blackwell підтримує вищу та більш чуйну agentic-інференцію в межах того самого енергетичного бюджету.
2 з 9
Водночас NVIDIA Blackwell також пропонує в 10 разів нижчу вартість (за мільйон токенів) порівняно з попередником. Такий нижчий TCO означає, що AI-оператори можуть підтримувати більшу потужність агентів у межах того самого бюджету живлення та інфраструктури або забезпечувати таку ж потужність із ще нижчими експлуатаційними витратами.
Навіть більш вражаючим для Blackwell є те, що він демонструє надзвичайно високу продуктивність при масштабуванні моделей. Використовуючи Kimi K3 2.8T, рішення Blackwell забезпечило 80-кратне збільшення пропускної здатності на МВт порівняно з Hopper і підтримувало 215 токенів на секунду на користувача з точки зору інтерактивності, що значно перевищувало можливості рішення Hopper.
Після розгляду Blackwell, час перейти до наступної глави Agentic AI та Inference: Vera Rubin.
Платформа NVIDIA Vera Rubin NVL72 забезпечує масивне 30-кратне збільшення пропускної здатності порівняно з Grace Blackwell NVL72 у DeepSeek-v4-PRO 1.6T. При інтерактивності близько 160 токенів на секунду на користувача Vera Rubin просто випереджає Grace Blackwell, а також досягає до ~280 TPS на користувача, тоді як Blackwell досягає максимуму нижче 180 TPS на користувача.
Vera Rubin також пропонує значно нижчу вартість токенів у задачах Agentic Coding порівняно з Blackwell. Вартість за мільйон токенів, що на 35x нижча, свідчить про те, що NVL72 може безперервно запускати кілька агентів у великому масштабі для широкого спектра робочих навантажень. А завдяки таким технологіям, як NVIDIA DSX MaxLPS, що керують живленням між GPU, стійками та рівнями навантаження, AI-фабрики можуть встановити до 40% більше GPU в межах того самого бюджету мегават.
Крім того, ці бенчмарки ще не відображають продуктивність Vera CPU для виклику інструментів і зосереджені лише на чіпах Vera Rubin, а не на повній 7-чіповій платформі “Extreme Codesign”. Тому з появою більшої кількості платформ Vera Rubin ми побачимо ще більш вражаючі результати щодо AI-агентів та інференції. Зважаючи на це, NVIDIA розпочала виробництво всіх своїх AI-рішень, включно з процесорами Vera, GPU Rubin, серверами Vera Rubin, чіпами Groq 3 LPX та повним спектром мережевих технологій.
Про автора: Хассан Муджтаба, за освітою інженер-програміст, а за покликанням — ентузіаст ПК, є старшим редактором розділу обладнання Wccftech. Маючи багаторічний досвід роботи в галузі, він спеціалізується на глибокому технічному аналізі CPU та GPU наступного покоління, материнських плат і систем охолодження. Його робота включає не тільки новини про майбутні технології, але й розширені огляди та тестування.
Додатково до прочитання
mVolt+ розганяє RTX 5090 до 700 Вт без модифікації шунта, майже на 21% вище заявленого TDP NVIDIA 575 Вт
NVIDIA планує повернення до Китаю через новий чіп для виведення на основі LPU, тоді як SMIC використовує експортний контроль США для досягнення віртуальної монополії в Китаї [Оновлення: NVIDIA заперечує]
Шестирічний A100 від NVIDIA кидає виклик застаріванню, оскільки CoreWeave орендує його до 2029 року, подовжуючи життя Ampere до дев’яти років
Найшвидша відеокарта Blackwell від NVIDIA, 96 ГБ RTX PRO 6000, тепер коштує 16 000 доларів США, майже вдвічі більше за початкову ціну
Інформація підготовлена на основі матеріалів: wccftech.com
