
NVIDIA Groq 3 LPX вже перебуває у повному виробництві, забезпечуючи значне прискорення генерації токенів для платформ Vera Rubin у сфері Agentic AI.
NVIDIA підвищує можливості генерації токенів Vera Rubin NVL72, демонструючи 3400 TPS з прискорювачами ШІ-інференсу Groq 3 LPX
У рамках своїх анонсів на Hot Chips 2026 NVIDIA оголосила про повне виробництво свого ШІ-інференс-прискорювача Groq 3 LPX. Ця новина йде слідом за анонсами масового виробництва процесорів Vera та серверів Vera Rubin, що свідчить про стрімку реалізацію дорожньої карти NVIDIA у сфері ШІ.

Стійки Groq 3 LPX слугують розширенням платформи NVIDIA Vera Rubin, надаючи покращені можливості ШІ-інференсу, які забезпечують надшвидку генерацію токенів для чутливих до часу відгуку агентських робочих навантажень. Ці системи можуть генерувати величезну кількість токенів за сотні або навіть тисячі кроків інференсу, що робить швидку генерацію токенів критично важливим етапом для ШІ-фабрик.
Хоча NVIDIA Vera Rubin NVL72 є передовим рішенням для Agentic AI, його можливості можуть бути додатково посилені рішенням Groq 3 LPX.
В одній з демонстрацій NVIDIA показала свою платформу Vera Rubin NVL72 із Groq 3 LPX, яка видавала рекордні 3400 токенів за секунду в Artificial Analysis, працюючи з відкритою моделлю Gemma 4 31B. З контекстним вікном у 100 000 токенів це був найшвидший показник продуктивності, зареєстрований для цієї моделі.
GPU NVIDIA Rubin обробляють великомасштабну контекстну інформацію, тоді як LPX прискорює робочі навантаження декодування, чутливі до затримок. Результатом є швидша та більш передбачувана генерація токенів, що допомагає ШІ-фабрикам забезпечувати швидке обґрунтування, плавнішу взаємодію агентів та підвищення ефективності інфраструктури.

З Groq 3 LPX NVIDIA також дозволяє виконувати агентські ШІ-завдання, такі як кодування, за лічені хвилини замість годин, забезпечуючи 4-кратне прискорення часу відгуку порівняно з найближчою альтернативною платформою. Це справді вагомі слова!
«Інференс – це рушій зростання ШІ. NVIDIA Grace Blackwell та NVL72 революціонізували інференс великих мовних моделей, забезпечивши безпрецедентний стрибок у продуктивності та ефективності», — сказав Дженсен Хуанг, засновник і генеральний директор NVIDIA.
«Vera Rubin розширює це бачення конфігураціями ШІ-фабрик, оптимізованими під робоче навантаження, призначеними для епохи агентського ШІ, розширюючи межі продуктивності за допомогою LPX для надшвидкої генерації токенів. Це трансформує спосіб вироблення інтелекту, забезпечуючи ще один гігантський стрибок у пропускній здатності, ефективності та швидкості реагування ШІ, саме тоді, коли попит на обчислення ШІ зростає в усьому світі».
Рішення NVIDIA Groq 3 LPX також розглядається провайдерами хмарних ШІ-сервісів як рішення для зростаючих потреб, надаючи підприємствам і розробникам доступ до передової інфраструктури для навчання, обґрунтування та інференсу в масштабі. Зокрема, Nebius планує використовувати Groq 3 LPX у своїй Token Factory.
«Генерація — це фаза інференсу, яка визначає, наскільки чутливою є система ШІ, і саме це прискорює NVIDIA Groq 3 LPX», — сказав Даніла Штан, технічний директор Nebius. «Як перша хмара ШІ, що впроваджує його у виробництво через Nebius Token Factory, ми гарантуємо, що кожен крок циклу агента відчувається миттєвим — через той самий API, який розробники вже використовують, без міграції на новий стек».
Groq 3 LPX та Vera Rubin у комбінації призначені для епохи Agentic AI, пропонуючи спеціалізовану архітектуру інференсу, розроблену для максимізації швидкості реагування, пропускної здатності та ефективності, що сприяє розвитку ШІ-фабрик наступного покоління.
Дізнатися більше на: wccftech.com
