
Nvidia опублікувала нове дослідження, яке свідчить про те, що саме “обгортка” (harness) моделі штучного інтелекту, а не сама модель, відіграє ключову роль у виконанні завдань, що потребують довгострокового планування.
Обгортка — це програмний шар навколо моделі ШІ, який включає інструменти, управління пам’яттю та правила, що перетворюють сиру модель на самостійний дієвий компонент.
Суть дослідження: команда Nvidia, використовуючи спеціальну обгортку, оптимізовану для ефективного керування пам’яттю та оснащену компонентом-«наглядачем» (supervisor), змогла досягти 100% результату з моделлю Claude Opus 5 на бенчмарку інтерактивного міркування ARC-AGI-3. Цей бенчмарк складається з 2D-ігор, до яких не надаються інструкції, і вимагає від моделі самостійно вивчити правила гри та перемогти, подібно до людини. Без такої обгортки Claude Opus 5 показала лише 30% результату, що, однак, було найвищим показником серед інших протестованих моделей.
Дослідження Nvidia підтверджує, що хоча вибір моделі є важливим, сама модель, яка виступає «мозком» агента, становить меншу частину системи, ніж зазвичай вважають користувачі ШІ, особливо коли йдеться про довгострокові завдання. Обгортка, що керує пам’яттю, контекстом і зворотним зв’язком, перетворює модель на агента.
«Зазвичай агента сприймають як API моделі», — зазначив Адель Ель-Халлак, віцепрезидент з продуктового розвитку в підрозділі ШІ Nvidia. — «Але агент — це більше, ніж просто модель. Це ще й каркас навколо моделі, який ми називаємо обгорткою, тобто набір інструментів, якими вона користується. Це також середовище виконання (runtime) та пов’язані з ним навички й бібліотеки, до яких ми надаємо доступ».
Довгострокові завдання вимагають послідовності рішень, іноді протягом кількох днів, для досягнення кінцевого результату. Це відрізняється від простого генерування відповіді на запит. Одним із головних викликів у дослідженні агентних систем є те, як змусити ШІ виконувати довгострокові завдання, не відволікаючись та не втрачаючи цілі.
Наприклад, у квітні Microsoft опублікувала дослідження, в якому тестувала 19 великих мовних моделей (LLM) на довгострокових завданнях, пов’язаних з редагуванням документів. Результати показали, що всі моделі, включно з найсучаснішими, заповнювали документи помилками. Якби таку роботу виконала людина, її б негайно звільнили.
Були випадки, коли моделі, що послідовно приймали рішення, видаляли файли користувачів або цілі бази даних, а також вдавалися до злочинної поведінки, такої як змова чи хакерські атаки, для досягнення своїх цілей.
Вибір Nvidia використати для тестування бенчмарк інтерактивного міркування є значущим і дещо іронічним. 100% результат означає, що модель може перемагати в іграх на рівні людини.
OpenAI була настільки розчарована вкрай низькими показниками своїх моделей (менше 10%) на ARC-AGI-3, що провела власне дослідження. Як і Nvidia, OpenAI виявила, що просте налаштування двох параметрів обгортки потроїло результати їхніх моделей.
Однак жодна з моделей не наблизилася до 100% результату, досягнутого дослідниками Nvidia. Вони продемонстрували, що обгортка потребує компонента-«наглядача», який скеровує агента у правильному напрямку, якщо він застрягає.
«Найцікавішим моментом стало введення додаткового наглядового агента, який допомагає основному агенту, що виконує роботу», — сказав Ель-Халлак. — «Він діє майже як генеральний директор, який підштовхує агента, коли він відхиляється від курсу, починає досліджувати шлях, який може завести в глухий кут, або повторно досліджує шлях, який вже був пройдений».
Хоча концепція наглядового агента не є новою, сьогодні більшість користувачів агентів покладаються лише на один шар обгортки, як-от Claude Code, Codex або Hermes. Дослідники Nvidia створили власну вдосконалену обгортку під назвою Agentic Variation Operators (AVO).
Варто зазначити, що це не новий продукт Nvidia. Компанія виробляє багато відкритих компонентів та технологій для створення обгорток під брендом Nemo. Частина цих технологій є комерційною, тоді як значна частина доступна відкрито.
Результати Nvidia додають до зростаючої кількості доказів того, що вибір моделі — далеко не єдиний фактор, що впливає на продуктивність агентних систем. Наприклад, у липні Databricks опублікувала дослідження, яке показує, що обгортка, а не модель, суттєво впливає на витрати ШІ.
«Ви можете обрати ту саму модель, але різні обгортки, і отримати значно вищі витрати, якщо використовуєте неправильну обгортку», — повідомив TechCrunch генеральний директор Databricks Алі Годсі. — «Ви думаєте: “О, це дорога модель. Це дешева модель”. Але зачекайте, яку обгортку ви використовуєте? Це саме по собі може подвоїти ваші витрати».
Головний висновок Nvidia полягає в тому, що відкриті обгортки, як і відкриті моделі, надають користувачам значно більше контролю, ніж вони усвідомлюють.
«Ми віримо, і демонструємо це разом з екосистемою, як відкриті обгортки дозволяють вам натискати набагато більше кнопок, щоб підвищити точність», — сказав Ель-Халлак. — «Це пов’язано з тим, що OpenAI уповільнює навчання своїх моделей» через те, що моделі створюють порушення безпеки.
«Ми віримо, що відкритий стек агентів — де ви маєте контроль над обгорткою, інфраструктурою, середовищем виконання — це те, що необхідно для безпечного розвитку екосистеми», — додав він.
Подробиці можна знайти на сайті: techcrunch.com
