Nemotron 3.5 Lightning прискорює генерацію токенів у 4 рази, але агентичні завдання лише на 30%

Nemotron 3.5 Lightning прискорює генерацію токенів у 4 рази, але агентичні завдання лише на 30% 1

Гонка за моделями з відкритими параметрами в США загострюється, навіть попри те, що Китай продовжує домінувати в цьому сегменті. Це підтверджує випуск NVIDIA нової ШІ-моделі Nemotron 3.5 Lightning, яка з’явилася всього через кілька годин після того, як Meta представила свою модель Muse Glimmer в понеділок.

Nemotron 3.5 Lightning від NVIDIA намагається вирішити проблему “вузького горла” токенів, тоді як справжні обмеження лежать в рівні оркестрації

Introducing NVIDIA Nemotron 3.5 Lightning⚡

An open 30B MoE model with 3B active parameters, built for always-on agents to complete high-volume, specialized tasks faster.

It delivers up to 4x the output speed of similar-sized models. pic.twitter.com/ENWrZe76pU

— NVIDIA AI (@NVIDIAAI) August 11, 2026

Як було зазначено раніше, NVIDIA щойно випустила Nemotron 3.5 Lightning — модель з відкритими параметрами, засновану на архітектурі Mixture-of-Experts (MoE), що має 30 мільярдів параметрів (3 мільярди активних). Вона розроблена для роботи та координації постійно активних агентів, які обробляють величезні обсяги рутинних завдань.

Для тих, хто, можливо, не знає: оркестрація — це процес координації кількох спеціалізованих ШІ-агентів для їх ефективної спільної роботи над комплексними, багатоетапними завданнями, які один ШІ-агент не може виконати самостійно. Ця оркестрація на рівні агентів включає ряд кроків: отримання та декомпозиція завдання, вибір агента, обмін контекстом та станом (коли Агент А завершує свій крок, оркестратор передає результат і відповідні дані Агенту Б, щоб прогрес ніколи не скидався), а також періодична валідація та виправлення помилок. Слід зазначити, що оркестрація на рівні обладнання відбувається всередині процесора, який зазвичай керує потоком даних між пам’яттю та обчислювальними ядрами для мінімізації затримок та максимізації пропускної здатності.

Архітектурні елементи

Nemotron 3.5 Lightning від NVIDIA має 4 ключові архітектурні елементи:

  1. Гібридна Mamba-Transformer: Поєднує глибоке розуміння контексту Transformer з блискавично швидкою, апаратно ефективною обробкою Mamba (моделі простору станів). Transformer — це нейронні мережі глибокого навчання, призначені для обробки вхідних послідовностей та розуміння взаємозв’язків між їхніми компонентами, тоді як моделі простору станів — це математичні каркаси, які використовуються для моделювання та прогнозування того, як змінюються складні динамічні системи з часом.
  2. Багатокрокове передбачення токенів (MTP): Замість передбачення тексту слово за словом (один токен за раз), модель передбачає кілька токенів одночасно, значно скорочуючи час генерації.
  3. Прихована суміш експертів (Latent Mixture of Experts, MoE): Система маршрутизації, яка динамічно розширює доступні “експертні” мережі під час виведення, підвищуючи продуктивність без значних обчислювальних витрат. По суті, модель MoE має кілька нейронних мереж, кожна з яких відмінно справляється з конкретним завданням. Оркестратор динамічно обирає нейронну мережу або “експерта”, найбільш придатного для виконання певного завдання.
  4. Спекулятивне декодування: Менша, швидша “чернеткова” модель спочатку передбачає текст, а основна модель миттєво перевіряє його, радикально прискорюючи пропускну здатність. Це той самий підхід, який використовує Muse Glimmer від Meta для прискорення генерації токенів (відповіді/виведення).

Чому Nemotron 3.5 Lightning від NVIDIA пропонує зменшення віддачі

NVIDIA released software this morning built to consume fewer tokens and push work away from expensive models.

The announcement covered two things. Nemotron 3.5 Lightning is a 30B parameter MoE model with 3B active parameters, distilled down from Nemotron 3 Ultra and aimed at… https://t.co/hPG3DRohx3

— Ryan Shrout (@ryanshrout) August 11, 2026

Nemotron 3.5 Lightning від NVIDIA досягає 24 балів за індексом Artificial Analysis Intelligence Index — це композитний бенчмарк, розроблений для оцінки та відстеження загальних можливостей LLM на шляху до загального штучного інтелекту (AGI), який вимірює агентні, кодувальні, наукові міркування та загальні можливості моделі. Цей результат є значним покращенням порівняно з попередньою моделлю Nemotron 3 Nano.

Тим не менш, NVIDIA стверджує, що Nemotron 3.5 Lightning здатна генерувати токени в 4 рази швидше, ніж “моделі схожого розміру”, але це прискорює фактичні агентні завдання лише на 30%. Іншими словами, модель подвоює виведення токенів, але забезпечує зменшення віддачі щодо прискорення агентних завдань. Це свідчить про те, що справжнє “вузьке горло” лежить у рівні оркестрації та системі керування агентами — програмному забезпеченні, яке визначає, що, де і в якому порядку виконується.

Nvidia is developing Nemotron 4, a new open-source AI model expected to have at least 1 trillion parameters.$NVDA is aiming for it to compete with the world’s best open models, while using open source to broaden AI adoption and ultimately drive more demand for its GPUs.

The… pic.twitter.com/A2gXuIkfol

— Wall St Engine (@wallstengine) August 11, 2026

Хоча Nemotron 3.5 Lightning, безумовно, сприяє поступовому покращенню, їй бракує “вау-фактору”, необхідного для виведення американських моделей з відкритими параметрами на передові позиції. Це може частково пояснити, чому NVIDIA вже почала розхвалювати Nemotron 4 як свою наступну велику ставку.

Nemotron 3.5 Lightning прискорює генерацію токенів у 4 рази, але агентичні завдання лише на 30% 2

Про автора: Письмо — моя єдина незаперечна пристрасть. Протягом останніх шести років я написав понад 2200 окремих статей на фінансові та технологічні теми, загальним обсягом майже 1 мільйон слів. Я є членом команди Wcctech mobile з 2025 року. Як випускник Університету Торонто, програми Rotman Commerce, я вношу нюанси, глибокі знання та унікальну перспективу до кожної теми, яку висвітлюю. Коли я не пишу, я подорожую світом, досліджуючи приховані кондитерські та ресторани як початківець гурман.

Пропозиція дня

Nemotron 3.5 Lightning прискорює генерацію токенів у 4 рази, але агентичні завдання лише на 30% 3Nemotron 3.5 Lightning прискорює генерацію токенів у 4 рази, але агентичні завдання лише на 30% 4

Додатково до читання

Nemotron 3.5 Lightning прискорює генерацію токенів у 4 рази, але агентичні завдання лише на 30% 5

Середня ціна NVIDIA RTX 5060 Ti 16GB зросла до 805 доларів США, що на 88% перевищує рекомендовану роздрібну ціну

Nemotron 3.5 Lightning прискорює генерацію токенів у 4 рази, але агентичні завдання лише на 30% 6

Китай забороняє своїм найкращим ШІ-інженерам виїзд за кордон та починає масове будівництво центрів обробки даних у Монголії, тоді як NVIDIA пародіює, мобілізуючи 500 мільярдів доларів США на фінансування ШІ

Nemotron 3.5 Lightning прискорює генерацію токенів у 4 рази, але агентичні завдання лише на 30% 7

Частка ринку NVIDIA та AMD у Китаї впаде до 10% до 2026 року, оскільки вітчизняні чіпи займуть 90%, свідчить звіт

Nemotron 3.5 Lightning прискорює генерацію токенів у 4 рази, але агентичні завдання лише на 30% 8

Витрати на пам’ять сервера NVIDIA Vera Rubin подвоюються порівняно з Grace Blackwell, оскільки вартість DRAM зростає в 2,5 рази за одне покоління, при цьому одна стійка містить обсяг пам’яті, еквівалентний 4500 смартфонам

За матеріалами: wccftech.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *