NVIDIA DGX Spark: Перший міні-суперкомп’ютер для ШІ
2025 рік Тип: Міні-ПК Ціна: $4699 Стрімкий розвиток сфери штучного інтелекту спричинив справжню революцію на ринку ПК. Ми спостерігаємо, як великі виробники чипів активно випускають “AI PC”, що поєднують програми Windows із локальними ШІ-підсистемами. Паралельно з’являються спеціалізовані пристрої, призначені виключно для локального прискорення моделей та агентів. Минулого року NVIDIA представила DGX Spark PC — перший у своєму роді комп’ютер, створений для роботи з великими мовними моделями (LLM) та агентами, який позиціонується як “ШІ-суперкомп’ютер”. Невдовзі після запуску інші виробники почали маркувати свої міні-ПК як спеціалізовані ШІ-пристрої, що призвело до зростання конкуренції. DGX Spark фактично започаткував тренд локальних ШІ-пристроїв, і через рік ми нарешті отримали можливість протестувати його.
NVIDIA DGX Spark — характеристики та розбір GB10
NVIDIA DGX Spark став першою системою, анонсованою з Superchip GB10. Цей же чіп буде встановлений і на майбутніх платформах RTX Spark, що вийдуть наступного місяця. NVIDIA називає GB10 Superchip, який масштабує архітектуру Grace Blackwell до рівня міні-ПК для розробників та робочих станцій.
Ідея DGX Spark полягала у створенні міні-ШІ-суперкомп’ютера на базі архітектури Blackwell. Для цього NVIDIA розробила Superchip GB10, який поєднує інновації з дата-центрів, такі як NVFP4, CUDA, SLANG, TensorRT, vLLM, CX-7 NIC, NVLINK C2C, TMEM та інші, в міні-ПК. Це стало можливим завдяки використанню компактного форм-фактору, багаточіпової упаковки, низьковольтного інтерфейсу C2C та уніфікованої архітектури пам’яті (UMA).
Таким чином, робоча станція DGX Spark Workstation має такі ключові особливості та переваги:
• GB10 Grace Blackwell Superchip: Прискорює ШІ, наукові обчислення, рендеринг та візуалізацію.
• 128 ГБ когерентної уніфікованої системної пам’яті: Працює з великими моделями ШІ до 200 мільярдів параметрів; дозволяє доналаштовувати моделі до 70 мільярдів параметрів.
• Мережа ConnectX-7: Дозволяє об’єднати два системи DGX Spark для роботи з моделями до 405 мільярдів параметрів.
• DGX Base OS та NVIDIA AI Software Stack: Забезпечує плавний перехід робочих навантажень з DGX Spark на DGX Cloud або будь-яку іншу прискорену інфраструктуру дата-центрів чи хмарних сервісів.
• Гнучкі конфігурації розгортання: Можна налаштувати як ШІ-робочу станцію або як персональну ШІ-хмару, підключену до мережі.
• Чудовий досвід роботи на робочому столі: Підтримка кількох дисплеїв та гнучкі можливості підключення.
• Компактний, енергоефективний дизайн: Легко розміщується на будь-якому столі, живиться від стандартної розетки.
Перейдемо до специфікацій GB10 Superchip. Склад SoC показує, що чіп складається з двох дієлетів: S-Dielet (CPU, система пам’яті тощо) та G-Dielet (GPU). Ці дієлети об’єднані за допомогою 2.5D-пакування та виготовлені за 3-нм техпроцесом TSMC.
CPU базується на архітектурі ARM Arch v9.2 і має 20 ядер: 2 кластери по 10 ядер кожен. Кожне ядро має приватний кеш L2, а кожен кластер — 16 МБ кешу L3 (32 МБ загалом). Перший кластер побудований на базі Cortex-X925, другий — на базі Cortex-A725.
GPU базується на архітектурі GB100 Blackwell і вважається iGPU, оскільки розташований на одному кристалі. Він оснащений Tensor Cores 5-го покоління з підтримкою DLSS 4 та ядрами RTX Ray Tracing. Продуктивність становить до 31 TFLOPs FP32 та 1000 TOPS NVFP4 (FP4) для ШІ-навантажень. GPU також має додатковий кеш L2 об’ємом 24 МБ. Система пам’яті Superchip GB10 підтримує LPDDR5x (UMA) зі швидкістю до 9400 MT/s, забезпечуючи пропускну здатність до 301 ГБ/с та максимальний об’єм до 128 ГБ. Шинна система — високопродуктивна когерентна, що підтримує протокол CHI-E. GPU має доступ до загальної пропускної здатності системи 600 ГБ/с (агрегована) через інтерфейс C2X.
Також є 16 МБ кешу системного рівня (System Level Cache), який слугує L4 для CPU та забезпечує енергоефективний обмін даними між компонентами SoC. Інтерфейс C2C відзначається високою пропускною здатністю та низьким енергоспоживанням завдяки архітектурі NVLINK від NVIDIA. З точки зору підключень, Superchip GB10 SoC підтримує PCIe, USB, Ethernet через PCIe та може керувати до 4 одночасними дисплеями (3 DP + 1 HDMI) з роздільною здатністю до 4K @120Hz через DP Alt-mode, та до 8K @120Hz через HDMI 2.1a. Функції безпеки включають Dual Secure Root, процесори SROOT та OSROOT, а також підтримку fTPM і дискретних TPM. Загальний TDP чіпа становить 140 Вт.
Наступний блок-схема Superchip GB10 SoC від NVIDIA:
Масштабованість GB10 Superchip — ще один цікавий аспект. Можна об’єднувати кілька чіпів GB10 за допомогою технології ConnectX від NVIDIA для збільшення пропускної здатності, пропускної здатності пам’яті та обсягу DRAM для підтримки більших моделей ШІ. NIC ConnectX підключається до GB10 SoC через інтерфейс PCIe Gen5 x8, а пристрої взаємодіють через Ethernet.
NVIDIA називає GB10 Superchip SoC успішною співпрацею з MediaTek, оскільки IP-адреса процесора походить від MediaTek. Чіп пройшов ретельне моделювання продуктивності графічної пам’яті для інтеграції в систему пам’яті MediaTek.
NVIDIA DGX Spark оснащений 4 ТБ NVMe-накопичувача, який працює зі швидкістю Gen5x4.
Налаштування
Налаштування NVIDIA DGX Spark може здатися складним для новачків, але NVIDIA надає посібники для базової функціональності.
Складність полягає в тому, що якщо ви звикли до Windows, то до NVIDIA DGX OS, яка базується на Ubuntu 24.04.4 (LTS), доведеться звикати.
На момент запуску DGX Spark постачався без більшості базових програм, які потрібно було встановлювати окремо. Однак, у новіших версіях Spark PC вже встановлено DGX Dashboard та NVIDIA Sync. Ці програми необхідні для моніторингу стану ваших Spark PC.
Якщо потрібно встановити їх, налаштування DGX Dashboard та NVIDIA Sync займе всього 15-30 хвилин через вбудований термінал, оскільки достатньо скопіювати/вставити команди та слідувати інструкціям у плейбуках.
З коробки ПК постачається з попередньо встановленими Firefox, Firmware Updater та базовими програмами, які можна знайти в інших дистрибутивах Linux, але адаптованими під тему DGX Spark. Також, під час першого завантаження Spark завантажить оновлення, що займе деякий час (близько 45 хвилин у нашому випадку). Меню налаштувань дозволяє конфігурувати різні аспекти, включаючи роздільну здатність. Робота з 4K-дисплеєм на 240 Гц не викликала проблем. Тут же знаходиться повне меню оновлень, яке гарантує, що програмне забезпечення та програми працюють з найновішими версіями.
Більшість операцій на DGX Spark виконуються через додаток терміналу або JupyterLab. Інтерфейс JupyterLab можна запустити безпосередньо з DGX Dashboard, який також пропонує окреме меню оновлень для локальних програм. DGX Dashboard забезпечує приємну візуалізацію використання системної пам’яті та GPU.
Оскільки у нас був ще один Spark, ми використали кабель Connect-X7 для об’єднання їх в один кластер. Це можна зробити як через термінал (вручну), так і за допомогою програми NVIDIA Sync, яка виявилася ефективнішою. Плейбук був простим, і ми змусили два DGX Spark PC працювати під одним IP-адресом через мережу 200 Гбіт/с.
Додаток Sync також проводить тест швидкості мережі, після чого ви готові запускати локальні моделі в конфігурації подвійного кластера з доступом до 256 ГБ пам’яті.
Можна об’єднувати стільки одиниць DGX Spark, скільки потрібно. Ми чули про приклади до 18 одиниць, але NVIDIA стверджує, що можна об’єднувати значно більше. Враховуючи, що розміри моделей продовжують зростати, пара або чотири DGX Spark PC стануть оптимальним вибором для локальних ШІ-розробників.
Тести CPU
Перейдемо до тестів. NVIDIA DGX Spark не об’єднує ядра CPU або GPU, тому для базових тестів ви обмежені одним Spark. Нам вдалося запустити Geekbench 7 на нашій системі.
В одноядерних тестах DGX Spark набрав 2568 балів, а в багатоядерних — 23 656 балів.
DGX Spark Geekbench 7 ST
Одноядерна продуктивність 20-ядерного Arm CPU DGX Spark є гідною. Вона виявилася вищою за Ryzen AI MAX+, який працює на частоті до 5.1 ГГц, тоді як DGX Spark працює значно повільніше.
DGX Spark Geekbench 7 MT
У багатоядерному режимі DGX Spark демонструє значно кращий результат, наближаючись до настільних x86-рішень з вищою кількістю потоків і випереджаючи мобільні SoC. Чіп, який буде використовуватися в майбутніх ПК RTX Spark, матиме схожий CPU, але з оптимізованими тактовими частотами, тому очікуйте кращих результатів порівняно з DGX Spark, призначеним для цілодобової роботи як робоча станція для розробників.
Ігри — смак RTX Spark
Для ігор ми спробували Cyberpunk 2077, запущену через Steam з використанням Proton 11.0 “Experimental” та Steam Linux Runtime 4.0. Ми слідували інструкціям, опублікованим на Reddit кілька місяців тому, і змогли запустити гру в ідеальному стані з увімкненими всіма можливостями RTX.
Спочатку ми хотіли оцінити можливості GPU Superchip GB10. Він має таку ж кількість ядер, як RTX 5070, але через обмеження TDP у 140 Вт, яке розподіляється між пам’яттю та CPU, на GPU залишається приблизно 90-100 Вт. При роздільній здатності 1440p з пресетом RT Ultra ми отримали 28.70 FPS, а при 1080p — 59.34 FPS. Використання налаштувань High при 1080p без RT на DGX Spark забезпечує понад 100 FPS, тоді як AMD Ryzen AI MAX+ здатен лише близько 80-90 FPS.
Але є й приємні доповнення, такі як підтримка DLSS MFG, DLSS 4.5 Transformer та DLSS 4.5 Ray Reconstruction, як і в серії RTX 50. З цими функціями ми досягли 95.15 FPS при 1440p з пресетом RT Ultra та 140 FPS при 1080p. Знову ж таки, це лише тизер того, що запропонують ПК RTX Spark, які матимуть кращу оптимізацію та підтримку в ОС Windows.
Тести ШІ — локальні ШІ-агенти та багатокластерна продуктивність
Ми тестували різні LLM на різних пристроях. NVIDIA DGX Spark — це наш перший досвід роботи зі спеціалізованим ШІ-пристроєм, і ми хотіли перевірити, чи достатня його ШІ-продуктивність для більшості розробників у цьому сегменті.
Хоча існує безліч LLM та рушіїв для виведення, ми хотіли побачити, як продуктивність співвідноситься з найпопулярнішими моделями. Для цього ми обрали моделі, популярні, але відносно нові на Hugging Face, і запустили їх у llama.cpp. NVIDIA надає плейбуки для налаштування різноманітних рушіїв для виведення, таких як llama.cpp, vLLM, LM Studio тощо. Згідно з нашими попередніми тестами, llama.cpp має найменші накладні витрати при роботі з LLM. Водночас, використання певного рушія має свої переваги, і використання LLM варіюватиметься залежно від типу необхідного виведення.
DGX Spark (один вузол) PP
DGX Spark (один вузол) TP
NVIDIA DGX Spark показав солідні результати в роботі з різними моделями. Тести на одному вузлі проводилися на моделях від 4B до 120B (GPT-OSS). DGX Spark надзвичайно швидкий у генерації токенів, а також демонструє чудову продуктивність у обробці запитів, враховуючи його компактні розміри.
Ми також протестували кілька моделей MoE (Mixture of Experts), які, по суті, є LLM з величезною базою знань, але зі швидкістю обробки набагато меншої моделі. Наші тести включали бенчмарки як на одному вузлі, так і на подвійному кластері (2 x DGX Spark). Найновіша DeepSeek V4 Flash з NVFP4 (завантажені трансформатори) показала 21.3 TPS на одному вузлі та 59.13 TPS на подвійному кластері. Це більш ніж удвічі більше завдяки 256 ГБ доступної VRAM для цієї моделі з 284 мільярдами параметрів.
У MiniMax-M2.5 (4-біт) ми не змогли розмістити його на одному Spark, але подвійний кластер Spark забезпечив нам швидкість генерації 40.12 TPS. Інші моделі, такі як відкритий Nemotron 3 Super від NVIDIA зі 120 мільярдами параметрів, також працювали непогано в кластерній конфігурації.
DGX Spark Швидкість генерації токенів у моделях MoE
Наразі дуже важливо мати правильне програмне забезпечення та підтримку для цих моделей. Саме тут з’являється тюнінг та оптимізація. NVIDIA постійно оптимізує продуктивність LLM, а також можливості агентів своїх платформ DGX/RTX. Компанія нещодавно випустила останні оновлення, які будуть доступні цього місяця, забезпечуючи ще вищу продуктивність на провідних платформах виведення та надаючи користувачам можливість встановлення в один клік для агентських ШІ-платформ, таких як OpenClaw, і багатьох інших.
Ми також трохи поекспериментували з GenAI, використовуючи різні моделі через ComfyUI, такі як Flux.2 та SDXL Turbo. Їх було легко налаштувати, оскільки NVIDIA також надає повний посібник з локального налаштування ComfyUI. Швидкість обробки зображень була хорошою, генеруючи 6-7 зображень (1024×1024) за хвилину.
Тепловий режим та живлення
Щодо температури, NVIDIA DGX Spark стає досить гарячим, але ви навряд чи почуєте роботу його вентиляторів. Тепло, що виходить, відчутне, але лише тоді, коли ви дійсно витискаєте з пристрою максимум. Ми зафіксували температуру в простої 48°C, а пікові температури досягали 81°C на нашому пристрої.
Щодо живлення, хоча DGX Spark розрахований на 140 Вт, ми майже ніколи не бачили, щоб він споживав понад 100 Вт, навіть у сценаріях Prefill Heavy. Середнє споживання одного Spark становить близько 80 Вт, а коли об’єднані два, другий пристрій зазвичай споживає на 5-10 Вт менше, ніж основний Spark.
Висновок
NVIDIA DGX Spark з’явився не просто як чергова компактна робоча станція. Він став машиною, яка визначила цілу категорію. Те, що ми маємо тут, — це оригінальний локальний ШІ-пристрій: тиха система, що живиться від розетки, яка обробляє доналаштування моделей з 70 мільярдами параметрів та виведення моделей з 200 мільярдами параметрів як повсякденну роботу, а не як завдання для дата-центру.
Сам GB10 — справжня історія. Два тісно пов’язаних дієлети, 128 ГБ когерентної уніфікованої пам’яті, NVLink-C2C, Tensor Cores п’ятого покоління та тканина ConnectX-7, яка дозволяє об’єднати два пристрої в 256 ГБ кластер за лічені хвилини. Саме ця комбінація дозволяє моделі DeepSeek V4 Flash з 284 мільярдами параметрів зрости з 21 TPS на одному Spark до 59 TPS на двох, і робить можливим використання моделей, які просто не вміщуються на одному вузлі. Посібники NVIDIA та різноманітні плейбуки були дуже корисними, але ми часто знаходили їх трохи застарілими. Більшість з них вимагали більше, ніж простого копіювання/вставлення, і нам доводилося переглядати різні репозиторії та форуми, щоб переконатися, що обрана модель найкраще підходить для Spark.
Програмний стек: DGX OS, Dashboard, NVIDIA Sync та зростаюча бібліотека плейбуків “в один клік” перетворюють те, що могло б бути суто Linux-проектом для ентузіастів, на щось, чим розробник може реально користуватися після першого оновлення. Хоча DGX Spark не призначений для ігор, його апаратне забезпечення натякає на те, що запропонують майбутні платформи RTX Spark. Cyberpunk 2077 при 1440p з повним трасуванням променів та DLSS 4 Multi Frame Generation, що досягає 95 FPS при споживанні менше 100 Вт, є гідним попереднім переглядом. Однак, головною подією залишаються локальні агенти, RAG з великим контекстом та багато вузлові експерименти, не встаючи з-за столу. Температурний режим залишається в межах норми, вентилятори працюють тихо, а реальне споживання енергії рідко перевищує 80–100 Вт. Ці цифри мають значення. Вони означають, що ви можете запускати пару Spark протягом ночі, не турбуючись про рахунки за електроенергію чи шум.
Через рік DGX Spark все ще відчувається як референсний дизайн, з яким порівнюють усі інші. Це не найдешевший спосіб запускати локальні моделі, коштуючи наразі вражаючі 4699 доларів США за один пристрій, але це найбільш цілісна, масштабована та перспективна ШІ-робоча станція малого форм-фактору, доступна сьогодні. Коли наступного місяця з’являться варіанти RTX Spark, вони успадкують те саме кремнієве ядро з кращими тактовими частотами та більш звичну ОС. А до того часу оригінальний Spark залишається машиною, яка довела, що персональний ШІ-суперкомп’ютер може реально розміститися на столі та працювати.
Додаткову інформацію про процес огляду апаратного забезпечення та нашу етичну політику можна знайти тут.
Про автора: Хассан Муджтаба, розробник програмного забезпечення за освітою та ентузіаст ПК за покликанням, є старшим редактором відділу апаратного забезпечення Wccftech. Маючи багаторічний досвід роботи в галузі, він спеціалізується на глибокому технічному аналізі процесорних та графічних архітектур наступного покоління, материнських плат та систем охолодження. Його робота включає не тільки новини про майбутні технології, але й обширні огляди та тестування.
Додатково для читання
Моддер увімкнув DLSS 5 Neural Rendering на AMD Radeon RX 9070 XT; Продуктивність значно впала, але остання версія покращила FPS на 12%
Сарфраз Хан
Тести DLSS 5 показали, що один 12-контактний роз’єм живлення 12V-2×6, можливо, обмежує GeForce RTX 5090
Сарфраз Хан
Останній драйвер Game Ready від NVIDIA, за повідомленнями, забезпечує до 8.1% збільшення продуктивності в трасуванні променів, хоча ігри отримують невелику вигоду
Сарфраз Хан
M6 запропонує подвійну ігрову продуктивність M4 у Cyberpunk 2077, натякаючи на значне покращення та з незначними компромісами щодо налаштувань візуалізації
Омар Сохаїл
Оригінал статті: wccftech.com
