Ноутбучна відеокарта NVIDIA RTX 5090 має достатній обсяг відеопам’яті (VRAM) для роботи з максимальними налаштуваннями графіки у найвимогливіших AAA-іграх. Проте, у завданнях штучного інтелекту (ШІ) 24 ГБ VRAM відкривають зовсім інші можливості. Серія тестів показує, що RTX 5090 здатна конкурувати з Apple M5 Max, значно випереджаючи його у навантаженнях з великими мовними моделями (LLM). Однак, ситуація змінюється, коли тестування включає більш потужні моделі ШІ з великою довжиною контексту.
Уніфікована архітектура пам’яті M5 Max рятує ситуацію, значно випереджаючи RTX 5090 у генерації токенів при збільшеній довжині контексту
Оновлений Razer Blade 18 змагався з 16-дюймовим MacBook Pro від Apple. Алекс Зіскінд порівняв різні бенчмарки, включно з навантаженнями ШІ. Почавши з моделі Qwen3 4B з 4-бітною квантизацією та довжиною контексту 262 144, стало очевидно, що необробленої графічної потужності RTX 5090 недостатньо. Майже весь 24 ГБ VRAM було використано, що призвело до швидкості генерації токенів 25.28 токенів/секунду.
Для порівняння, M5 Max досяг показника 181.40 токенів/секунду. Однак, щойно довжина контексту зменшилася до 68 014, звільнилася значна частина VRAM для RTX 5090, дозволивши відеокарті досягти швидкості 160.36 токенів/секунду. Причина, чому графічний чіп все ще повільніший за M5 Max, ймовірно, полягає у різниці програмного забезпечення. У Windows використовувався LM Studio, тоді як для Apple Silicon застосовувався MLX.
На щастя, RTX 5090 ще не здається. Ютубер протестував низку LLM, таких як Gemma 4 12B, Qwen3.5 27B та Qwen3.6 35B A3B, використовуючи llama.cpp. Як у обробці запитів, так і у генерації токенів, RTX 5090 мала перевагу над M5 Max. Знову ж таки, варто пам’ятати, що найшвидший ноутбучний GPU від NVIDIA завжди буде лідером, доки він не заповнює свій 24 ГБ VRAM.
На жаль, якщо ви плануєте запускати надзвичайно щільні моделі, як-от Qwen3.5 122B, RTX 5090 не має жодних шансів вийти з цього тесту неушкодженою. M5 Max зі своєю 128 ГБ уніфікованої пам’яті досягає обробки запитів зі швидкістю 139 токенів/секунду та генерації токенів 47.4, споживаючи 94 ГБ оперативної пам’яті. Якщо ви дивуєтеся, чому NVIDIA так прагне випустити RTX Spark, запуск потужніших моделей ШІ, безумовно, є однією з причин.
Для детального ознайомлення з тестами ви можете переглянути відео Алекса Зіскінда вище. Поділіться своєю думкою у коментарях.
За матеріалами: wccftech.com
