
Керівник служби безпеки (CISO), який бачить низьку кількість CVE та знецінює атаки через ін’єкції підказок (prompt injection), неправильно читає табло. Ін’єкції підказок утримують перше місце в OWASP Top 10 для LLM Applications три роки поспіль. Коли два керівники цього списку перевірили його на 6 639 позначених реальних інцидентах, результат показав 12-те місце. Цей спад відображає видимість, а не небезпеку, оскільки атака діє там, де сканер вразливостей не може її побачити.
Це дослідження належить Кіріакосу «Року» Ламбросу та Стіву Вілсону, керівникам проєкту OWASP Top 10 для LLM Applications. Вони опублікували його на arXiv 18 серпня з відповідним застереженням. Аналіз є попереднім, не пройшов рецензування експертів і не є офіційним релізом OWASP. Автори зазначають, що він не скасовує чинності офіційного списку чи його процесу.
Механізм, що стоїть за цим, є реальним: 7 714 інцидентів безпеки LLM з CVE, GitHub Security Advisories, OSV та бази даних AI-шкоди AIAAIC, 6 639 з них класифіковані за 20-елементною таксономією, і байєсівська модель, яка коригує кожен підрахунок на помилку класифікатора перед встановленням рейтингу на основі даних поруч із експертною оцінкою.
Порівняння не виявило статистично виявленої згоди між експертною думкою та публічним реєстром інцидентів. Коефіцієнт Капа Коена становить 0,20 з 90% інтервалом від -0,16 до 0,57. «Інтервал перетинає нуль, тому ми не можемо виключити, що два рейтинги збігаються лише випадково», — пишуть вони. «Чесний підсумок: слабка згода, а не підтвердження».
Ламброс, співкерівник OWASP GenAI Security Project Top 10 для LLM Applications та директор зі стандартів та управління ШІ в Zenity, висловив результати в евристичних термінах у письмовій відповіді VentureBeat. «Ми мали два способи вимірювання одного й того ж ризику: експертну думку та публічний реєстр інцидентів, і вони суперечать один одному. Жоден з них не є правдою», — сказав Ламброс. «Двоє свідків суперечать один одному, і ми не можемо сказати вам, хто бреше».
Ланцюг атак, який сканер ніколи не реєструє
Розрив є структурним. Ін’єкції підказок приховують інструкції всередині контенту, який читає модель: від запису журналу, запиту до служби підтримки до документа, отриманого через вилучення. Потім агент виконує виклик інструменту, який бажав зловмисник, використовуючи свої законні облікові дані. Жодна частина цього ланцюга не є дефектом продукту, тому атака не залишає жодного CVE для сканера.
Засоби захисту, які виявляють це, — це конфліктні тести розгорнутої системи та жорсткі обмеження на те, до чого агент може отримати доступ, тому ошукана модель не може торкнутися нічого цінного. Та ж логіка закликає фінансувати пам’ять агента та межі інструментів MCP зараз, на архітектурному рівні, а не чекати на обсяг консультацій, який завжди надходитиме із запізненням.
Перший контроль, який Вілсон запровадив би
Вілсон, головний спеціаліст з ШІ та продуктів у Exabeam та співкерівник проєкту OWASP Top 10 для LLM Applications, назвав контроль, який він запровадив би першим проти саме такого ланцюга: агент, який читає корисне навантаження зловмисника у файлі журналу, розглядає його як інструкцію та переписує DNS за допомогою дійсних облікових даних, у письмовій відповіді VentureBeat.
«Перш за все, я б поставив шлюз авторизації поза моделлю: агент може запропонувати точну зміну DNS, але він не може надати собі повноважень для її виконання», — сказав Вілсон. «Правила безпеки, написані в підказках, можуть формувати поведінку моделі, але вони залишаються пропозиціями для моделі, а не примусовими засобами контролю безпеки».
Шлюз має свою ціну, і Вілсон чітко це зазначає. «Компроміс полягає в тому, що агент втрачає здатність самостійно виконувати довільні, високопріоритетні зміни інфраструктури, зберігаючи при цьому автономне розслідування та звичайне, обмежене виправлення», — сказав він.
Чому ризик №1 виглядає малим у звіті
«Ін’єкція підказок — це найбільш зрозуміла атака на LLM, і розгорнуті системи активно захищаються від неї», — пишуть автори, стискаючи всю розбіжність в одне речення. «Експерти ранжують її першою, оскільки поверхня атаки залишається величезною, навіть коли захист переважно тримається; дані бачать успіхи, що прослизнули».
Вілсон спостерігав за цією розбіжністю з обох сторін. «Дані про інциденти надзвичайно цінні, але вони за своєю суттю дивляться назад і їх надзвичайно складно інтерпретувати», — сказав він. «Вони показують нам, що було спостережено, розпізнано, класифіковано та повідомлено. Це не обов’язково говорить нам, що є найнебезпечнішим у системах, які люди будують зараз».
Він порівнює ін’єкції підказок з «відправленням і податками», а все частіше — з «законом фізики для систем LLM», оскільки одній моделі доводиться інтерпретувати довірені інструкції та недовірений контент одночасно.
Кращий захист не розв’язав проблему. «Контроль, який працює в 99% випадків, недостатній, коли випадок збою надає зловмиснику значний доступ. І, відверто кажучи, я не думаю, що ми досягли 99%», — сказав Вілсон. «Стійка відповідь — це не вірити, що ми можемо повністю усунути ін’єкції підказок. Це проєктування систем з припущенням, що ін’єкції підказок відбуватимуться, розуміння, чому вони працюють, і обмеження того, що зловмисник може досягти, коли це станеться».
Низька кількість консультацій може означати, що захист працює. Це може так само легко означати, що ніхто не дивився, і публічний реєстр не може сказати команді безпеки, що саме це.
Обсяг спроб задокументований. Звіт CrowdStrike’s 2026 Global Threat Report показав, що зловмисники впроваджували шкідливі підказки в легітимні GenAI-інструменти більш ніж у 90 організаціях у 2025 році, викрадаючи облікові дані та криптовалюту, у розділі під назвою «Підказки — це нове шкідливе програмне забезпечення». Телеметрія демонструє тиск на поверхню атаки, не доводячи, що захист призвів до 12-го місця, але це модель, яку прогнозує механізм.
Розрив діє й в інший бік, і далі
Ін’єкція підказок — це головна новина, а дезінформація — ще більша.
Експертна оцінка ставить дезінформацію на 13-те місце, тоді як реєстр інцидентів — на 2-ге. У статті це називається «найширшою розбіжністю між двома свідками», і повідомляється, що його прапорець узгодженості «ставить ймовірність того, що два сигнали суперечать один одному, на 99 відсотків».
Автори не вважають свої власні дані переможцем. Щодо дезінформації вони зазначають, що корпус «містить великий обсяг діпфейків та штучно згенерованої дезінформації», записи, які часто «описують шкоду, завдану ШІ, а не вразливість всередині LLM». Автори називають це записом, щодо якого реєстр найбільше сперечається, не роблячи висновку, що експерти помилилися.
Де «занадто новий, щоб виміряти» стикається з записом CVE
Два абсолютно нові записи в таксономії знаходяться на найгострішому краю. Постійне отруєння пам’яті знаходиться на експертному 4-му місці та на 16-му за інцидентами, експлуатація інтерфейсу інструментів MCP — на експертному 7-му та на 16-му за інцидентами, кожен з інтервалом інцидентів від 6 до 20, що охоплює більшу частину таксономії.
Публічні CVE 2026 існують для обох. Щодо інтерфейсів інструментів MCP, Azure Data Explorer MCP Server містив KQL-ін’єкцію, а запис CVE описує, що він дозволяє «зловмиснику (або ін’єкційно-підказному AI-агенту) виконувати довільні KQL-запити до кластера Azure Data Explorer», оцінений у 8,3 (Високий). Kong Konnect MCP Server містив непряму ін’єкцію підказок, яка дозволяє віддаленому зловмиснику спрямовувати сервер на виконання ненавмисних API-запитів, що є саме тим збоєм, який названо в записі MCP.
Пам’ять агента має власний запис. Фреймворк агента Ruflo виявив незахищені кінцеві точки мосту MCP, які дозволили мережевому зловмиснику отримати оболонку, прочитати ключі API провайдера та отруїти сховище навчання, оцінено як 10,0 (Критичний).
Реєстр настільки тонкий і невизначений, що модель не може розмістити жоден запис у межах 14 позицій рангу. Команда, яка чекає на обсяг консультацій, щоб виправдати контроль над пам’яттю агента або межею інструменту MCP, все ще чекала б, поки накопичуються CVE з критичним та високим рейтингом.
Ламброс викладає бюджетне обґрунтування в операційних термінах. Отруєна пам’ять «не повідомляє про себе», — сказав він. Це виглядає так, ніби агент з закупівель одного разу сказав, що рахунки-фактури від певного постачальника менше ніж за 50 000 доларів США проходять без другого підпису, і оскільки агент пам’ятає, кожне наступне схвалення виглядає як робочий процес. «Ніхто не подає консультацію щодо цього, тому що ніхто не знає, що це сталося. Кількість нуль вимірює вашу сліпоту, а не вашу безпеку». Аргумент, який, за його словами, схвалить фінансовий директор, — це терміни, оскільки дозволи на пам’ять і інструменти вбудовуються в ці системи один раз, на ранньому етапі, а все інше сидить зверху. «Вбудуйте це зараз, і це буде похибка округлення. Поверніться через два роки, і вам доведеться переробляти та перенавчати ваші системи».
Автори першими вказують на власні проблеми вимірювання
Експертна сторона є слабкою. «Експертний сигнал — це опитування практиків: приблизно 29 респондентів оцінили важливість кожного кандидата на ризик», — пишуть автори. Двадцять дев’ять голосів визначають рейтинг, який несе три чверті ваги опублікованого списку, точка стиснення для понад 25 000 членів спільноти OWASP.
З боку даних, класифікатор є слабкою ланкою. Точність «різко варіюється між записами, від 93% (LLM01, LLM03) до 13% (LLM08)», чотири записи нижче 50%, і базовий класифікатор «ніколи не передбачає «поза межами сфери» і класифікує кожен інцидент до деякої категорії, включаючи приблизно 38% золотого набору, який не належить до жодної».
Автори самі називають центральне обмеження. Один рецензент розглянув усі 1 200 золотих інцидентів і подолав консенсус моделі в 553 з них. «Один анотатор не може виміряти надійність між рецензентами», — пишуть вони. «Золотий набір одного автора залишається центральним обмеженням».
Ламброс покладає слабкий коефіцієнт Капа на саму таксономію. «Це число говорить вам про наші категорії, а не про наших експертів», — сказав він. Коли люди, які написали таксономію, не можуть надійно сортувати інциденти відповідно до неї, він стверджує: «Слабкий бал за порядком цих кошиків є фактом щодо кошиків».
Кращий класифікатор не виправить розбіжності. Попередньо зареєстроване змагання чотирьох передових моделей не виявило переможця. Жодна не перевищила базову точність 0,863, а перевірка істинного стану залишила базовий порядок на місці зі співвідношенням рангової кореляції Спірмена 0,918. Автори опублікували двигун та артефакти на GitHub, щоб будь-хто міг їх перезапустити.
Результат стійкості протестував лише одну сторону розриву. Кожна перевірка за словом «стійкий» в анотації проводиться з боку інцидентів, показуючи, що рейтинг, отриманий з інцидентів, залишається незмінним при зміні механізму маркування, і жодна з них не торкається опитування 29 голосами. Дошка, яка чує «стійкий», припускатиме підтверджений, проте запис підтримує лише стабільність.
Що з цим зробив опублікований список
OWASP випустив GenAI LLM Top 10 2026 4 серпня, перше видання, яке включило дані про інциденти до рейтингу, з вагою думки практиків 75% та корпусу інцидентів 25%. Ін’єкції підказок залишилися на 1-му місці, дезінформація піднялася на два місця, надмірна агентність піднялася з 6-го до 3-го місця як запис, де два сигнали погоджуються найчіткіше, неконтрольоване споживання піднялося на чотири позиції до 6-го місця, а неправильна обробка виведення впала з 5-го до 10-го місця, найбільше падіння.
Вілсон відмовляється захищати цю суміш як арифметичну. «Немає нічого магічного у ваговій категорії 75/25», — сказав він, «або у її перевертанні до 25/75. Цінність даних полягала не в тому, що вони дали нам математичну відповідь; вони змінили розмову». Запис про надмірну агентність — це те, де ця розмова торкнулася його найбільше. «Якби я був CISO, який оцінював нове розгортання агентів сьогодні, я б почав з Надмірної Агентності», — сказав Вілсон.
Ламброс пішов би далі наступного циклу, точку зору, яку він відзначає як власну та окрему від робочої групи. Суміш надає однакову 25% вагу інцидентів кожній категорії, тоді як класифікатор, перевірений вручну, має точність приблизно від дев’яти з десяти для ін’єкцій підказок та ланцюга поставок до приблизно одного з восьми для слабкостей векторів та вбудовування. Чверть ваги на першому місці спирається на щось надійне, стверджує він, а така ж чверть на другому — на шум. «Співвідношення повинно відстежувати, наскільки добре ми насправді вимірюємо кожну категорію», — сказав Ламброс.
Чому це актуально зараз
Дослідження Ivanti’s 2026 State of Cybersecurity показало, що 87% команд безпеки вважають впровадження агентного ШІ пріоритетом, а 77% повідомляють про певний рівень комфорту, дозволяючи ШІ діяти без людського контролю. Команди схвалюють автономію агентів, тоді як експертний рейтинг того, що може піти не так з цими агентами, не демонструє статистично виявленої згоди з реєстром інцидентів.
Що з цим робити в понеділок
Зміна поведінки є вузькою, і це вся суть.
-
Використовуйте OWASP LLM Top 10 як карту покриття, а не чергу. Позиції рангу спираються на 29 голосів і корпус, автори якого самі називають згоду слабкою, тому створюйте власний пріоритетний порядок на основі власної експозиції: охоплення продукту, дані сповіщень про злом та контролі, які фактично були протестовані. Ламброс проводить лінію фінансування так само. «Я б пріоритезував витрати там, де думка експертів та реєстр інцидентів вказують в одному напрямку, тому що це два незалежних свідків, що погоджуються», — сказав він. «Там, де вони розходяться, припиніть дозволяти ранжируванню розподіляти ваші гроші та подивіться, що роблять ваші власні системи».
-
Записуйте, що насправді роблять ваші ШІ-системи, по кожному полю. Підказка, що пішла, що повернулося, документи, отримані для побудови відповіді, інструменти, що були викликані, та аргументи, передані їм, а також рівень впевненості моделі в кожній відповіді. Впевненість — це поле, за яке боровся б Ламброс, тому що більшість керівників безпеки не усвідомлюють, що це можна виміряти, і саме там знаходяться поверхні атаки. «Модель, що працює на отруєній інструкції, не поводиться зламано. Вона поводиться впевнено», — сказав він. «Впевненість — це те, що ваш моніторинг розглядає як здорову систему». Вартість — це один-два спринти інженерної роботи. Обмеження — це людина, тому що SIEM обробляє події, а це — тенденції. «Хтось повинен аналізувати ці тенденції щотижня і говорити, чи означає зміна щось, і в більшості команд безпеки немає нікого, хто б міг це зробити».
-
Припиніть очікувати, що вивід сканера відтворить порядок Top 10. Виявлення сканерів живуть на стороні інцидентів розриву, підраховуючи, що було розкрито, а не те, чого слід боятися розгорнутій системі, і змагання класифікаторів показують, що розумніша модель не скорочує цю дистанцію. Тест, який бачить ін’єкції підказок, є конфліктним, запущеним проти живої системи, у поєднанні зі шлюзом авторизації Вілсона, щоб зміна, яку пропонує ін’єкційний агент, ніколи не була зміною, яку він може виконати.
-
Фінансуйте тонкі категорії записів на рівні архітектури, а не обсягу інцидентів. Пам’ять агента та межі інструментів MCP знаходяться на експертному 4-му та 7-му місцях з інтервалами інцидентів, що охоплюють більшу частину таксономії, а CVE, які існують, отримують рейтинги «Високий» та «Критичний». Кейн МакГладрі, старший член IEEE, який консультує підприємства з питань ризиків, прямо сформулював логіку фінансування в інтерв’ю VentureBeat. «Будь-що, що має відтінок кібербезпеки, зазвичай вписується в категорію ризиків кібербезпеки, що є повною фікцією», — сказав МакГладрі. «Вони повинні зосередитися на бізнес-ризиках, тому що якщо це не впливає на бізнес, наприклад, фінансові втрати, то ніхто не звертатиме на це уваги, і вони не виділятимуть на це належний бюджет». Ранговий номер з 29-голосного опитування є слабшим аргументом для бюджету, ніж бізнес-система, до якої торкається агент.
-
Викрадіть базовий тест МакГладрі для самих ШІ-систем. «Якби ви не виставляли свою базу даних в Інтернет без ідентифікації та контролю доступу, чому б ви робили це для своєї моделі ШІ?» — сказав він у аналізі вартості зломів 2026 року в CSO Online.
Питання для правління на наступному засіданні є коротким. Якщо наш рейтинг ризиків ШІ базується на 29 голосах та корпусі, який з ним не згоден, що ми насправді використовуємо для прийняття рішення про те, які контролі будуть фінансуватися наступного року?
Подробиці можна знайти на сайті: venturebeat.com
