NVIDIA Blackwell GB300 встановлює світові рекорди у попередньому навчанні MoE, а GB200 демонструє 4-кратне зростання продуктивності/ват завдяки оптимізаціям ПЗ для ШІ

NVIDIA Blackwell GB300 встановлює світові рекорди у попередньому навчанні MoE, а GB200 демонструє 4-кратне зростання продуктивності/ват завдяки оптимізаціям ПЗ для ШІ 1

Графічні процесори NVIDIA Blackwell GB300 та GB200 продовжують демонструвати провідні можливості у робочих навантаженнях зі штучного інтелекту завдяки постійним оптимізаціям.

NVIDIA не зупиняється на Blackwell: GB300 та GB200 отримують оновлення для підвищення продуктивності та ефективності по всьому світу

Можна було б подумати, що NVIDIA перейде на свої GPU Rubin, враховуючи, що її наступне покоління AI-платформ вже розгортається по всьому світу. Але ні, NVIDIA Blackwell вже встановлено в незліченних дата-центрах, і, як і Hopper до нього, покоління Blackwell продовжує отримувати оптимізації. Настільки, що GB300 досі встановлює рекорди продуктивності в AI-завданнях.

За даними NVIDIA, постійні оптимізації її платформи Blackwell призвели до значного зростання продуктивності та ефективності (perf/watt). Лише за три місяці NVIDIA збільшила пропускну здатність на мегават (TPS/MW) у 4 рази на тій самій конфігурації GB200 NVL72, що працює з DeepSeek R1 0528 – 1K/1K.

NVIDIA Blackwell GB300 встановлює світові рекорди у попередньому навчанні MoE, а GB200 демонструє 4-кратне зростання продуктивності/ват завдяки оптимізаціям ПЗ для ШІ 2

За ці чотири місяці компанія додала 38 значних оптимізацій до платформи Blackwell, провівши понад 250 000 симуляцій конфігурацій, що еквівалентно 1,4 мільйона годин тестування оптимізацій на GPU. Понад 90% цих оптимізацій застосовні до інших AI-моделей, що демонструє відданість NVIDIA своїм AI-платформам, навіть коли виходять нові.

З іншого боку, платформа NVIDIA GB300 “Blackwell Ultra” продовжує домінувати в тренуванні AI. На моделі DeepSeek-V3 671B, що працює на 256 GPU, Megatron Core досяг рекордних 1648 TFLOPs на GPU, що на 3x більше порівняно з 606 TFLOPs у GB200.

Попереднє тренування DeepSeek-v3 671B з 256 GPU досягає світового рекорду 1648 TFLOPs на GPU з GB300 NVL72, дозволяючи тому самому завданню тренування досягати такої ж продуктивності з часткою апаратного забезпечення порівняно з попереднім поколінням.

NVIDIA Blackwell GB300 встановлює світові рекорди у попередньому навчанні MoE, а GB200 демонструє 4-кратне зростання продуктивності/ват завдяки оптимізаціям ПЗ для ШІ 3

І оптимізації знову підкреслюються, оскільки та сама система GB300 NVL72 зараз пропонує 1,5-кратне покращення порівняно з попередніми 6 місяцями.

NVIDIA Blackwell GB300 встановлює світові рекорди у попередньому навчанні MoE, а GB200 демонструє 4-кратне зростання продуктивності/ват завдяки оптимізаціям ПЗ для ШІ 4

NVIDIA також тісно співпрацює зі спільнотами PyTorch та JAX для впровадження оптимізацій у своєму AI-портфоліо. В результаті, використовуючи TorchTitan (рідну стек-систему тренування PyTorch) на DeepSeek-V3 671B, стійка Blackwell Ultra забезпечує 6-кратне покращення продуктивності порівняно з базовою конфігурацією без будь-яких оптимізацій.

NVIDIA Blackwell GB300 встановлює світові рекорди у попередньому навчанні MoE, а GB200 демонструє 4-кратне зростання продуктивності/ват завдяки оптимізаціям ПЗ для ШІ 5

JAX демонструє ще більший приріст, досягаючи 1025 TFLOPs/GPU та до 4082 Токенів/с на GPU, що на 10x більше порівняно з оптимізаціями з січня 2026 року.

NVIDIA Blackwell GB300 встановлює світові рекорди у попередньому навчанні MoE, а GB200 демонструє 4-кратне зростання продуктивності/ват завдяки оптимізаціям ПЗ для ШІ 6

NVIDIA також забезпечує першокласну продуктивність масштабування для попереднього тренування у всіх фреймворках, від 256 до 1024 GPU. Для 1024 GPU Megatron Core забезпечує до 98,5% масштабування, тоді як TorchTitan та JAX — до 97% ефективності. Основним компонентом, що забезпечує таке масштабування, є мережевий чіп NVIDIA 800 Гбіт/с Scale-Out в кожному стійці NVL72.

NVIDIA Blackwell GB300 встановлює світові рекорди у попередньому навчанні MoE, а GB200 демонструє 4-кратне зростання продуктивності/ват завдяки оптимізаціям ПЗ для ШІ 7

Від тренування до виведення результатів, NVIDIA встановлює вражаючі рекорди в сегменті AI, і іншим доведеться докласти чимало зусиль, щоб наздогнати, особливо враховуючи, що платформа NVIDIA Vera Rubin вже розгортається і демонструє ще більші переваги над платформами Blackwell.

NVIDIA Blackwell GB300 встановлює світові рекорди у попередньому навчанні MoE, а GB200 демонструє 4-кратне зростання продуктивності/ват завдяки оптимізаціям ПЗ для ШІ 8

Про автора: Хассан Муджтаба, інженер-програміст за освітою та ентузіаст ПК за покликанням, є старшим редактором розділу обладнання Wccftech. Маючи багаторічний досвід роботи в галузі, він спеціалізується на глибокому технічному аналізі процесорних і графічних архітектур наступного покоління, материнських плат і рішень для охолодження. Його робота включає не тільки висвітлення новин про майбутні технології, але й розширені огляди та тестування.

Слідкуйте за Wccftech на Google, щоб отримувати більше новин у своїй стрічці.

NVIDIA Blackwell GB300 встановлює світові рекорди у попередньому навчанні MoE, а GB200 демонструє 4-кратне зростання продуктивності/ват завдяки оптимізаціям ПЗ для ШІ 9

GPU NVIDIA Rubin забезпечують 10-кратне збільшення продуктивності агентського AI порівняно з Blackwell, а їхня архітектура повністю розкрита, містить 336 мільярдів транзисторів

Hassan MujtabaNVIDIA Blackwell GB300 встановлює світові рекорди у попередньому навчанні MoE, а GB200 демонструє 4-кратне зростання продуктивності/ват завдяки оптимізаціям ПЗ для ШІ 10

NVIDIA додає локальних AI-агентів до свого найпотужнішого робочого ПК DGX Station за допомогою NVIDIA Agent Toolkit та Omniverse

Hassan MujtabaNVIDIA Blackwell GB300 встановлює світові рекорди у попередньому навчанні MoE, а GB200 демонструє 4-кратне зростання продуктивності/ват завдяки оптимізаціям ПЗ для ШІ 11

NVIDIA RTX Spark отримує перші драйвери для розробників, а підтримка Windows on Arm з’являється перед осіннім запуском

Hassan MujtabaNVIDIA Blackwell GB300 встановлює світові рекорди у попередньому навчанні MoE, а GB200 демонструє 4-кратне зростання продуктивності/ват завдяки оптимізаціям ПЗ для ШІ 12

NVIDIA GeForce RTX 50 SUPER GPU, за повідомленнями, вже надійшли до AIB, але їх постачання призупинено через невизначеність щодо цін на пам’ять

Sarfraz Khan

За даними порталу: wccftech.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *