Nvidia: лінійна математика замінить дорогі переключення AI-моделей

Nvidia: лінійна математика замінить дорогі переключення AI-моделей 1

Коли агентна ШІ-система передає завдання від меншої моделі до більшої — або навпаки — це вимагає значних витрат: приймаюча модель мусить обчислювати всю розмову з нуля, що збільшує витрати обчислень та час виконання. Це є серйозним обмеженням для компаній, що створюють довготривалі робочі процеси з використанням кількох великих мовних моделей (LLM).

Для вирішення цієї проблеми дослідники з Nvidia представили техніку передачі KV-кешу між моделями, яка безпосередньо переносить попередньо обчислений KV-кеш із моделі-джерела до моделі-призначення. Ця техніка відповідає реальним агентним застосуванням, де великі контексти накопичуються протягом багатьох ітерацій.

Для реальних ШІ-застосувань передача KV-кешу між моделями може зменшити витрати обчислень та час виконання для довготривалих робочих процесів з використанням кількох LLM, і це робиться за допомогою простої лінійної математики, а не дорогої моделі глибокого навчання.

Експерименти показують, що для сумісних пар моделей цей процес лінійного відображення працює в 2,7–25 разів швидше, ніж повторне обчислення розмови, зберігаючи до 98% точності цільової моделі порівняно з її самостійною роботою.

Чому зміна моделей під час сесії є такою дорогою

Аналіз того, як LLM керують пам’яттю, допомагає зрозуміти, чому робочі процеси з кількома моделями стикаються з продуктивною стіною в реальному використанні. Коли LLM отримує запит, вона спочатку мусить виконати етап «prefill» (попереднє заповнення), який є першим проходом обчислень, що генерує ключі та значення для всіх вхідних токенів і заповнює KV-кеш (Key-Value cache).

Після цього вона переходить до фази «decode» (декодування), де обчислює та генерує наступні токени в послідовності. Під час цієї фази модель читає з KV-кешу, щоб передбачати нові токени по одному, уникаючи необхідності повторно обробляти всю історію розмови для кожного нового токена.

У багатоходових розмовах або довготривалих агентних сесіях контекст поступово стає довшим. Оскільки обчислювальна вартість етапу попереднього заповнення прямо пропорційна розміру моделі та довжині вхідних даних, обробка таких довгих сесій стає все дорожчою та призводить до значних затримок, якщо KV-кеш недійсний.

Це стає недійсним, коли ШІ-система намагається змінити модель посеред сесії, наприклад, спрямовуючи складний етап міркувань до більшої моделі або переходячи до меншої моделі для економії витрат. Оскільки різні LLM мають різні архітектури, вони очікують вхідні дані для кешу в різних форматах.

Як результат, будь-яка зміна моделі змушує приймаючу модель знову оплачувати всю вартість попереднього заповнення, щоб переобчислити KV-кеш для накопиченого контексту.

Відображення пам’яті між моделями без повторного старту

Дослідники Nvidia вивчали передачу KV-кешу між моделями, щоб зрозуміти, як розробники можуть трансформувати KV-кеш однієї моделі у формат, очікуваний іншою, без повторного виконання етапу попереднього заповнення.

Якщо це буде вирішено, передача KV-кешу між моделями матиме переваги в обох напрямках. Передача від малої до великої моделі покращує якість виведення. Наприклад, дешева, мала модель обробляє рутинні частини агентного робочого процесу, але стикається з труднощами у складній проблемі міркування. Тоді ви відображаєте KV-кеш до більшої моделі та плавно продовжуєте процес.

З іншого боку, передача від великої до малої моделі зменшує витрати на обчислення. Високопродуктивна, велика модель може використовуватися для розпакування величезного, складного системного запиту або синтезу щільного PDF-файлу на початку сесії. Після виконання важкої роботи KV-кеш сесії відображається на меншу, більш економічну модель для обробки швидких, розмовних ітерацій, що йдуть далі.

Існували попередні спроби вирішити проблему передачі KV-кешу, але вони мали кілька ключових обмежень. До них належить необхідність дорогого навчання на основі градієнтів або дуже суворі архітектурні обмеження.

Nvidia: лінійна математика замінить дорогі переключення AI-моделей 2

Для цього початкового дослідження автори обмежили свою увагу передачею всередині сімейства моделей, наприклад, переходом між моделями різних розмірів із сімейств Qwen, Llama або Ministral. Ці моделі мають спільні токенізатори, ДНК навчальних даних та основні архітектурні стилі, але відрізняються за розміром і глибиною. Однак ця структура залишає багато простору для майбутніх експериментів. Дослідники зазначають, що техніка може бути розширена до передачі між родинами, невідповідної кількості KV-голів або гібридних архітектур, що поєднують стандартну увагу з іншими механізмами пам’яті.

Ключовим висновком дослідження Nvidia є те, що KV-кеш між моделями має значно лінійну структуру. Це означає, що ви можете виконати відображення за допомогою простих алгебраїчних трюків і без необхідності важкого навчання нейронної мережі. Наприклад, експериментуючи з передачею KV-кешу з моделі Qwen3 з 14 мільярдами параметрів до версії з 32 мільярдами параметрів, автори виявили, що просте лінійне регресійне відображення з одного вихідного шару до цільового шару може відновити 56% дисперсії в ключах цільової моделі та 32% дисперсії в її значеннях. При комбінуванні кількох вихідних шарів ці показники зросли до 79% і 65% відповідно.

Nvidia: лінійна математика замінить дорогі переключення AI-моделей 3

Щоб перевести цей лінійний зв’язок у практичну систему, дослідники розробили замкнутий за формою згортовий відображувач для кожної голови (per-head ridge mapper) із трьома ключовими компонентами:

  • Регресія для кожної голови (Per-head ridge regression): Замість використання складного глибокого навчання для тренування системи, вони застосували просту лінійну регресію, використовуючи невеликий калібровочний набір із кількох сотень текстових послідовностей. Ця техніка незалежно розв’язує класичну задачу найкращої прямої для кожної уважної голови.

  • Вибір вихідних шарів (Cross-layer source selection): Оскільки вихідна та цільова моделі мають різну кількість шарів, відображувач оцінює та вибирає найбільш прогностичні вихідні шари для подачі в кожен конкретний цільовий шар. Таким чином, система вибирає лише найкорисніші частини пам’яті зі старої моделі для побудови пам’яті нової моделі.

  • Відображення в просторі вмісту (Content-space mapping): Перед перетворенням даних відображувач видаляє кодування RoPE. RoPE, або Rotary Position Embedding, є стандартним механізмом, який застосовує математичний, залежний від позиції поворот до даних, щоб модель розуміла порядок токенів у послідовності. Видалення значень RoPE дозволяє відображувачу узагальнювати послідовності довжиною, що перевищує його навчальні дані.

Тестування лінійного відображувача

Щоб перевірити, чи працює техніка, дослідники оцінили конвеєр передачі на шести сімействах моделей з “відповідними KV” (matched-KV). “Відповідні KV” означає, що вихідна та цільова моделі мають однакову кількість KV-голів та розміри на голову, що є типовим для моделей різних розмірів в межах одного сімейства.

До сімейств моделей увійшли Qwen3, Llama 3.1 та Ministral 3, з тестами передачі KV-кешу між різними розмірами, що варіюються від 3 до 70 мільярдів параметрів. Їхні експерименти включали масивний стрибок у 8,8 разів за кількістю параметрів від Llama 3.1 8B до 70B.

Щоб охопити широкий спектр завдань, вони оцінювали моделі на п’яти основних бенчмарках точності (ARC-Challenge, HellaSwag, WinoGrande, MMLU та GSM8K), а також на мовному моделюванні з перплексією на WikiText-2 та завданні багатоходової розмови під назвою CoQA. Для налаштування лінійного відображувача перетворення вони використовували невеликий калібровочний набір даних лише з 500 текстових послідовностей по 1024 токени кожна.

Дослідники порівняли фреймворк із базовим стельовим рівнем точності, де цільова модель виконує повне, традиційне попереднє заповнення. Вони також порівняли свою повну систему з аблетованими конфігураціями, такими як зменшення кількості вибраних шарів або деактивація різних компонентів. Крім того, вони порівняли свій простий метод із глибокою нейронною мережею, навченою методом зворотного поширення помилки, щоб побачити, чи може важче глибоке навчання відновити точність для пар, де лінійний метод мав труднощі.

Для чотирьох із шести протестованих пар швидкий, замкнутий за формою лінійний згортовий відображувач зберігав від 73% до 98% точності цільової моделі порівняно з її самостійною роботою — включаючи масивний стрибок від Llama 3.1 8B до 70B, який зберіг 72,8% цільової точності.

Відображувач також працює в 2,7–25 разів швидше, ніж повторне попереднє заповнення. Наприклад, при перетворенні KV-кешу довжиною 32 768 токенів з Qwen3 14B до моделі 32B, передача зайняла лише 278 мілісекунд, порівняно з майже 7 секундами для стандартного повторного попереднього заповнення.

Система також продемонструвала високу стабільність на завданнях, які виконуються протягом багатьох кроків. При тестуванні на багатоходових розмовах дрейф, або втрата точності, між цільовою базовою лінією та переданим кешем залишався надзвичайно малим протягом 10 ходів, доводячи, що він не призведе до збою під час довгих агентних сесій.

Однак простий лінійний підхід зіткнувся з обмеженнями для конкретних пар моделей. Для двох конфігурацій Ministral лінійний відображувач різко погіршився, оскільки просте лінійне налаштування не змогло екстраполювати поза межі калібровочних даних. Щоб виправити це, дослідники замінили лінійний відображувач на нелінійний багатошаровий перцептрон (MLP) з двома прихованими шарами по 1024 одиниці, навчений на тих самих даних. Це додало складності та витрат на навчання до системи, але відновило їхню точність до понад 90%.

Більша проблема галузі, ніж може вирішити одна стаття

Впровадження міжмодельної передачі є частиною ширшого, загальногалузевого поштовху до розв’язання проблеми вузького місця KV-кешу, яка стала однією з ключових перешкод для масштабування корпоративного ШІ. Оскільки розробники змушують LLM обробляти величезні документи або бази коду та виконувати довготривалі завдання міркування, управління цим рівнем пам’яті стає настільки ж важливим, як і самі моделі.

За останній рік дослідники атакували цю проблему обчислень та пам’яті з різних боків. Наприклад, Nvidia нещодавно представила динамічну розрідженість пам’яті (Dynamic Memory Sparsification, DMS), техніку, яка інтелектуально видаляє менш важливі токени з KV-кешу, щоб зменшити витрати на міркування до 8 разів.

Інші підходи зосереджені на агресивному стисненні даних. Дослідники MIT розробили техніку алгебраїчного ущільнення під назвою Attention Matching, яка стискає KV-кеш у 50 разів без втрати якості. Подібним чином Nvidia представила KV Cache Transform Coding (KVTC), яка використовує концепції стиснення медіа для зменшення пам’яті в 20 разів без зміни базових ваг моделі.

Окрім стиснення, дослідники також вирішують обчислювальні накладні витрати на пошук даних у пам’яті. Оптимізатори, такі як IndexCache, усувають надлишкові обчислення шарів, забезпечуючи значно швидший час до першого токена в додатках з довгим контекстом. А моделі, такі як DeepSeek та серія GLM, оптимізують KV-кеш через архітектурні інновації.

Оскільки ШІ-системи беруть на себе завдання з довшим горизонтом і складнішими архітектурами, базова інфраструктура пам’яті стає настільки ж важливою, як і самі моделі. Передача KV-кешу між моделями надає розробникам ще один інструмент для зниження витрат на висновки при масштабуванні бага 모델них агентних систем.

Подробиці можна знайти на сайті: venturebeat.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *