
NVIDIA повністю розкрила архітектуру своїх ШІ-прискорювачів Rubin, забезпечивши монументальний стрибок продуктивності порівняно з Blackwell для епохи агентного ШІ.
NVIDIA Переосмислює Дата-Центри За Допомогою GPU Rubin, Досягаючи Найвищої Продуктивності ШІ У Світі
GPU Rubin лежить в основі платформ NVIDIA нового покоління для дата-центрів. Цей чіп, розробка якого тривала кілька років, нарешті стає загальнодоступним. З першими платформами на базі Rubin, які вже надходять до провідних технологічних компаній по всьому світу, настав час детально розкрити архітектуру цього надпотужного ШІ-чіпа, що визначатиме майбутнє агентного ШІ.

За даними NVIDIA, чіп Rubin забезпечує в 10 разів вищу пропускну здатність агентного ШІ на одиницю енергії порівняно з Blackwell, завдяки трьом ключовим архітектурним змінам:
- Покращені Тензорні Ядра з Розширеними Можливостями Точності
- Нова Підсистема Пам’яті HBM4
- Трансформерний Рушій 3-го Покоління
Але спочатку розглянемо архітектуру зсередини чіпа.
Розбір Архітектури Rubin: Чудовисько з Мільярдами Транзисторів
Чіп NVIDIA Rubin виготовлений за техпроцесом TSMC 3 нм (N3P) і складається з двох ретікл-лімітованих кристалів для досягнення високої щільності та ефективності. Ці два кристали з’єднані в одному уніфікованому корпусі за допомогою інтерфейсу NVIDIA High-Bandwidth Interface (NV-HBI). Чіп містить 336 мільярдів транзисторів, що на 62% більше, ніж у чіпа Blackwell GB300.
Під капотом кожного GPU Rubin знаходяться 8 GPC (Graphics Processing Clusters) із загалом 224 SM (Streaming Multiprocessors) та 896 тензорними ядрами. Це має становити 28 SM та 112 тензорних ядер на GPC, але, виходячи з блок-схеми, існують два типи GPC: один з 30 SM, а інший з 26 SM.

На кожному кристалі розташовано чотири GPC, які підключені до двох блоків великого децентралізованого кешу L2, Gigathread Engine, чотирьох каналів HBM (4096-біт на кристал) та інтерфейсу NVLink. Чіп також має контролер PCIe Gen6 для взаємодії з хост-процесором, а NVLink v6 IO забезпечує 3600 ГБ/с зв’язку з NVLink-свічем. Контролер MIG сегментує GPU для кількох робочих навантажень, а також є NV-DEC для прискореного декодування.

Чіп також оснащено функцією Confidential Computing через TEE-I/O, яка захищає дані у стані спокою, під час передачі та використання в робочих процесах ШІ.
Найшвидша HBM4 На Ринку Для Прискорення Передачі Даних
З точки зору пам’яті, NVIDIA Rubin використовує HBM4, найновіший стандарт HBM. Швидкість передачі даних стала критично важливою в сучасному ландшафті ШІ, і Rubin максимально задовольняє цю потребу, пропонуючи 288 ГБ пам’яті через вісім 12-шарових стеків (36 ГБ на стек та 3 ГБ на DRAM). Ці стеки забезпечують пікову пропускну здатність 22 ТБ/с, що робить їх найшвидшим рішенням HBM4 на ринку.
NVIDIA також використовує свій новий та вдосконалений Tensor Memory Accelerator (TMA) для ефективного переміщення складних даних чіпом, тоді як NVLink 6 забезпечує 3600 ГБ/с масштабованих швидкостей для комунікації між усіма GPU. Інтерфейс NVLink-C2C забезпечує 1800 ГБ/с комунікації між CPU та GPU, а 16 ліній PCIe Gen6 надають пропускну здатність 256 ГБ/с для підключення хост-процесора.

HBM4 Прискорює Генерацію Токенів
Пам’ять HBM4 для Rubin розроблена для максимальної енергоефективності та обчислювальної потужності, що призводить до прискорення декодування та генерації токенів. Більшість сучасних робочих навантажень витрачають час на довгі контексти, великі KV-кеші та інтерактивну генерацію токенів, що робить пропускну здатність ще критичнішою. З 2,8-кратним збільшенням порівняно з рішенням пам’яті Blackwell (22 ТБ/с проти 8 ТБ/с), рішення HBM4 забезпечує:
- Ємність: Підтримує розміщення моделей, більші контекстні вікна, більші KV-кеші та вищу паралельність без зайвого вивантаження KV-кешу.
- Пропускна здатність: Підтримує фазу генерації токенів, під час якої ваги моделі та стан KV повинні переміщатися достатньо швидко, щоб обчислювальні ядра залишалися продуктивними.
- Підсистема пам’яті: TMA та стратегії локальності пам’яті допомагають програмному забезпеченню ефективно використовувати підсистему пам’яті, підтримуючи високу досягнуту пропускну здатність для складних структур даних.
HBM4 посилює Rubin, що є ключовим для підтримки моделей з трильйонами параметрів, розширення контекстної довжини без проблем з вивантаженням KV-кешу, а також підтримки значно вищих рівнів паралельності та довгострокових інференс-навантажень.
Прискорення MoE та Токенів Через Покращений Тензорний Прискорювач Пам’яті
Rubin також оснащений вдосконаленим Tensor Memory Accelerator (TMA), який ефективно визначає та переміщує ваги експертів у міру зростання кількості експертів у MoE-моделях. TMA зменшує накладні витрати на переміщення даних завдяки покращеній обробці дескрипторів, що дозволяє програмному забезпеченню ефективніше маршрутизувати та працювати. Inline Descriptor також отримав оновлену підтримку TMA і дозволяє ядру зберігати один уніфікований дескриптор для тензорів, що мають однаковий макет та перевизначають поля, такі як покажчик пам’яті та крок, безпосередньо в інструкції TMA під час виконання.

Результатом є більш ефективне масштабування MoE-моделей навіть при збільшенні кількості експертів. Це дозволяє чіпу виділяти більше часу на обчислення для інференсу, забезпечуючи вищу пропускну здатність.
Швидші Тензорні Ядра Для Вищої Пропускної Здатності
Покращені Тензорні Ядра тепер забезпечують подвоєну пропускну здатність на такт. Це досягається завдяки подвоєнню обсягу даних, які тензорне ядро може обробляти вздовж виміру K. Це допомагає ядрам, що обмежуються пропускною здатністю, а також ядрам, що обмежуються пам’яттю/затримкою.
NVIDIA пояснює, що перевага більшого виміру K полягає у зменшенні кількості ітерацій циклу K. Наприклад, GEMM, яка вимагала чотири ітерації K на Blackwell, може бути виконана лише за дві ітерації на чіпах Rubin.

Також вдосконалено обробку уваги шляхом поєднання розрідженості активацій з адаптивним стисненням та покращення пропускної здатності softmax. Конвеєр уваги починається з обчислення щільної матриці QK^T для генерації проміжних оцінок уваги.
Потім Rubin може завантажити ці проміжні дані з Tensor Memory у структуровану 2:4 розріджену стиснену форму, генеруючи як ненульові значення, так і метадані, необхідні для їх ефективного використання, одночасно зменшуючи витрати на запис оцінок та вимоги до зберігання. Це дозволяє пізнішим етапам обробки уваги працювати з меншим обсягом даних, зберігаючи при цьому щільний вихідний формат, очікуваний рештою моделі.

Також спостерігається зростання можливостей експоненційної пропускної здатності Rubin порівняно з базовим Blackwell. Rubin пропонує вдвічі більшу пропускну здатність FP32 (на такт на SM) порівняно з GB200 і таку ж, як у GB300, тоді як пропускна здатність BF16/FP16 подвоюється порівняно з базовим Blackwell (GB200) і вдвічі порівняно з Blackwell Ultra (GB300).
Rubin також забезпечує більш детальну координацію між залежними ядрами. Це дозволяє роботі споживача розпочатися раніше, як тільки стануть доступні необхідні вхідні дані, замість очікування завершення більшого набору роботи виробника.

Результатом є більш щільний графік роботи GPU, зменшення проміжків простою та краще перекриття між залежними ядрами. Це особливо цінно для агентного інференсу, де активації послідовно проходять через модель, а затримка між ядрами безпосередньо впливає на кількість токенів за секунду на користувача.
Інкрементне Підвищення Енергоефективності З DSX MaxLPS
Ще одним важливим фактором для сучасних дата-центрів ШІ є енергоефективність. Системи Vera Rubin NVL72 є найсучаснішими та включають нові функції для її розширення, такі як керування живленням та інтелектуальне згладжування енергії з накопиченням енергії в єдиній області виконання, призначеній для максимізації корисного виведення токенів у межах фіксованого енергетичного бюджету.

Короткочасні піки можуть знижувати загальну пропускну здатність, залишаючи доступну потужність фабрики ШІ невикористаною. Для вирішення цієї проблеми системи Vera Rubin оснащені інтелектуальними блоками живлення з функцією згладжування, що поглинають ці короткочасні коливання, зменшуючи середнє споживання енергії приблизно на 10% порівняно з попереднім поколінням. Вони також зменшують пікове споживання енергії на 50 мс на 20%, забезпечуючи оптимізований профіль живлення, який може підтримувати максимальні вимоги до потужності.
Для фабрик ШІ NVIDIA DSX OS, що включає DSX MaxLPS, охоплює GPU, стійки, рідинне охолодження та робочі навантаження, пропонуючи операційний рівень для планування, управління життєвим циклом та автоматизації стану, що дозволяє встановити на 40% більше GPU в межах того ж бюджету потужності, збільшуючи пропускну здатність кожного розгортання.

Все це в сукупності робить Rubin найсучаснішим чіпом для дата-центрів ШІ та чіпом, який розпочне нову подорож для майбутніх можливостей ШІ, охоплюючи робочі процеси агентного ШІ та те, що прийде за ними.

Про автора: Хассан Муджтаба, інженер-програміст за освітою та ентузіаст ПК за покликанням, є старшим редактором розділу апаратного забезпечення Wccftech. Маючи багаторічний досвід роботи в галузі, він спеціалізується на глибокому технічному аналізі процесорних і графічних архітектур нового покоління, материнських плат та рішень для охолодження. Його робота включає не лише термінові новини про майбутні технології, а й ґрунтовні огляди та бенчмаркінг.
Підписуйтесь на Wccftech у Google, щоб отримувати більше новин у стрічці.
Подальше Читання

Samsung Відкладає Гібридне Бондинг HBM до 2029 Року, Узгоджуючи Пам’ять Нового Покоління з ШІ-GPU Feynman від NVIDIA
Раміш Зафар
NVIDIA Таємно Набуває Величезні Обсяги Оптоволокна По США, Загальна Пропускна Здатність Може Досягти Неймовірних 7,6 Петабіт/сек
Рохайль Салім
AMD Представляє Helios, Свій Новий Потужний ШІ-Прискорювач З MI455X та EPYC 6-го Покоління, Кидаючи Виклик Домінуванню NVIDIA У Стійкових Рішеннях
Хассан Муджтаба
Детектор Синтетичного Відео від NVIDIA Виявляє Фейкові Новини та Контент, Згенерований ШІ, з Точністю 92%, Аналізуючи Відео 1080p Всього за 22 мс
Хассан Муджтаба
Джерело новини: wccftech.com
