NVIDIA спрощує локальний ШІ для відеокарт із 24+ ГБ VRAM, оптимізації vLLM та llama.cpp збільшують продуктивність у 1.9 раза

NVIDIA спрощує локальний ШІ для відеокарт із 24+ ГБ VRAM, оптимізації vLLM та llama.cpp збільшують продуктивність у 1.9 раза 1

NVIDIA оптимізує свої графічні процесори на платформах RTX і DGX для спрощення локальних можливостей штучного інтелекту та підвищення продуктивності.

Локальні агенти працюватимуть до 1,9 раза швидше завдяки новітнім оптимізаціям на платформах NVIDIA RTX/DGX

Перша новина — це прискорення роботи локальних агентів завдяки подальшим оптимізаціям, розробленим NVIDIA у співпраці зі спільнотами open-source llama.cpp та vLLM. Результати вимірювалися на SpeedBench-Coding 8K Throughput з AIPerf.

У llama.cpp платформи NVIDIA RTX, як-от GeForce RTX 5090, тепер забезпечують до 50% зростання пропускної здатності токенів (ток/с) для Qwen3.6-27B та 90% прискорення для Qwen3.6-35B.

NVIDIA спрощує локальний ШІ для відеокарт із 24+ ГБ VRAM, оптимізації vLLM та llama.cpp збільшують продуктивність у 1.9 раза 2

NVIDIA RTX PRO 6000 Blackwell також демонструє прискорення до 20% в vLLM для обох моделей.

Платформи NVIDIA DGX Spark показують 1,4-кратне зростання у vLLM для Qwen3.6-27B та 20% прискорення в AI-інференсі для DeepSeek v4 Flash. Завдяки цим оптимізаціям ядер, NVIDIA RTX і DGX матимуть покращені методи спекулятивного декодування та швидший префікс (prefill). В vLLM нові ядра XQA attention в FlashInfer та оптимізації бекенду допомагають прискорити локальний AI-інференс на обох платформах.

Окрім прискорення локального ШІ, NVIDIA також спрощує його використання завдяки новій функції встановлення ШІ в один клік для Hermes Agent, OpenClaw і Perplexity Computer. Ці можливості будуть доступні для відеокарт NVIDIA з обсягом пам’яті 24 ГБ і вище.

NVIDIA спрощує локальний ШІ для відеокарт із 24+ ГБ VRAM, оптимізації vLLM та llama.cpp збільшують продуктивність у 1.9 раза 3

Минулого місяця Perplexity представив свій агент Portable Computer, надавши користувачам простий спосіб локального запуску Perplexity на Linux-системах, як-от NVIDIA DGX Spark, з моделями, оркестрацією та інструментами, об’єднаними в один додаток.

NVIDIA спрощує локальний ШІ для відеокарт із 24+ ГБ VRAM, оптимізації vLLM та llama.cpp збільшують продуктивність у 1.9 раза 4

У вересні Perplexity Portable Computer буде доступний для відеокарт NVIDIA RTX з щонайменше 24 ГБ відеопам’яті, що працюють під керуванням Linux або Windows. Це надасть ширшій групі користувачів ПК такий самий спрощений процес налаштування. Користувачі зможуть запускати повні робочі процеси локально, не витрачаючи кредити, водночас обираючи, чи передавати частини завдань до одного з 15+ передових хмарних моделей, коли потрібні додаткові дослідження або обчислення. Portable Computer запитує дозвіл перед надсиланням вмісту до хмари, допомагаючи користувачам зберігати конфіденційну інформацію на своїх пристроях.

Hermes Agent, розроблений Nous Research, є універсальним агентом, яким користуються мільйони користувачів. Він вирізняється надійністю та здатністю до самовдосконалення. Hermes, незалежний від моделей і постачальників, створений для роботи цілий день на локальних системах, що робить ПК RTX, робочі станції RTX PRO та DGX Spark природним вибором.

NVIDIA спрощує локальний ШІ для відеокарт із 24+ ГБ VRAM, оптимізації vLLM та llama.cpp збільшують продуктивність у 1.9 раза 5

Незабаром конфігурація локальної моделі в Hermes надасть користувачам можливість налаштування в один клік на системах RTX і DGX під керуванням Windows і Linux. Агент автоматично виявлятиме відеокарту NVIDIA, вибиратиме відповідну модель та конфігурацію, і запускатиме її через інтегрований llama.cpp з уже наявними оптимізаціями інференсу NVIDIA, усуваючи потребу в ручному завантаженні та налаштуванні моделей.

Після запуску Hermes працює так само, як і будь-де. Він використовує інструменти, зберігає контекст між завданнями, запам’ятовує інформацію між сесіями та з часом створює багаторазові навички, дозволяючи агенту ставати більш ефективним при постійному використанні. Запуск моделі локально на відеокарті забезпечує високу продуктивність, зберігаючи при цьому дані на системі. Налаштування локальної моделі в один клік з’явиться незабаром. Дізнайтеся більше про Hermes Agent.

NVIDIA спрощує локальний ШІ для відеокарт із 24+ ГБ VRAM, оптимізації vLLM та llama.cpp збільшують продуктивність у 1.9 раза 6

OpenClaw став одним із визначальних проєктів руху open-agent — найбільшим проєктом ШІ на GitHub, який має понад 380 тисяч зірок і спільноту, що швидко зростає. Вона створює інструменти та навички для досліджень, інженерії, управління проєктами та повсякденної продуктивності.

NVIDIA, Microsoft та OpenClaw працюють разом, щоб полегшити налаштування цього досвіду на ПК з Windows. Щоб зменшити складність інтеграції, OpenClaw Windows App спрощує процес налаштування оптимізованої локальної моделі на будь-якій відеокарті RTX з щонайменше 24 ГБ відеопам’яті.

Дізнатися більше на: wccftech.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *