Захисники почали використовувати “ін’єкції запитів”

Метод “контекстного бомбардування” змушує шкідливих ШІ-агентів вимикатися до того, як вони завдадуть шкоди.

Захисники почали використовувати "ін'єкції запитів" 1 Захисники почали використовувати "ін'єкції запитів" 2

Ін’єкції підказок (prompt injections) — це зловмисні команди, які зловмисники вбудовують у контент, щоб спонукати великі мовні моделі (LLM) виконувати їх. Добре сформована команда, непомітно вставлена в електронний лист або запрошення в календарі, часто є достатньою, щоб LLM викрала конфіденційні дані або виконала інші шкідливі дії.

Тепер захисники також почали використовувати ін’єкції підказок.

Сильний, різкий ефект

Дослідники з Tracebit у понеділок повідомили, що розміщення ін’єкцій підказок поряд із паролями, криптографічними ключами та іншими секретами, що зберігаються в Amazon Web Services, часто було достатнім для припинення атак ШІ-агентів. Підказки спрямовують атакуючу LLM на виконання дії, забороненої її захисними механізмами (guardrails) — бар’єрами безпеки, які розробники ШІ встановлюють для запобігання шкідливим діям. LLM реагує, вимикаючись.

Прикладами є підказка, яка наказує LLM надати кроки для розробки інгаляційних спор сибірської виразки, або, у випадку LLM від китайських розробників, зробити посилання на культового “Танкового чоловіка” з масових протестів на площі Тяньаньмень у 1989 році. Після того, як LLM стикається з цими забороненими командами, вона більше не виконує попередні інструкції. Дослідники назвали цю техніку “контекстним бомбардуванням” (context bombing).

“Зрештою, ми активуємо механізм відмови в контексті”, — сказав Енді Сміт, співзасновник і генеральний директор Tracebit, пояснюючи вибір назви. “Ми намагаємося передати той факт, що це має сильний, різкий ефект, від якого агентам може бути важко відновитися. Як тільки це потрапляє в їхній контекст, вони продовжуватимуть відмовлятися”.

Tracebit стверджує, що початкове тестування свідчить про великий потенціал контекстного бомбардування. Вони протестували Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro та Kimi 2.6, надавши їм інструкції для виконання звичайних завдань розробника, що призвело до переліку ресурсів та виявлення вставлених рядків. Моделі запускалися в симульованому середовищі AWS.

“У п’яти провідних моделях і 152 запусках тестів, розміщення одного з цих рядків у секретному файлі-приманці скоротило швидкість, з якою агенти отримували повний адміністративний доступ, з 57% до 5%, а повне компрометування (коли вони також залишали собі постійний плацдарм) — з 36% до 1%”, — йдеться в повідомленні в понеділок. “Найбільш потужний агент у наших тестах, Opus 4.8, перейшов від досягнення адміністративного доступу в 93% випадків до повної невдачі кожного разу, коли стикався з контекстною бомбою”.

У середньому по п’яти моделях і 152 запусках результати включали:

  • Ескалація привілеїв адміністратора знизилася з 57% до 5%
  • Ескалація адміністратора з постійним плацдармом знизилася з 36% до 1%
  • Запуски, що призвели до будь-якого шляху атаки, знизилися з 91% до 15%
  • В середньому, один запуск перейшов від успішного виконання 1,53 шляхів до лише 0,16
  • Жоден запуск не зміг завершити шлях атаки без принаймні спрацьовування детектора-канарейки

Дослідження базується на висновках травня, коли Tracebit представив метод для захисників, що дозволяє отримувати попередження під час атак на їхню інфраструктуру від ворожих ШІ-агентів. Це у формі ресурсів AWS, які виглядають як такі, що служать законній меті, але насправді не використовуються. Вони розташовані поруч із ресурсами, що використовуються. Коли вони скануються ШІ-агентом, захисники отримують сповіщення. Як і “канарейки”, яких брали в шахти, ці ресурси дозволяють захисникам виявити загрозу до того, як вона матиме фатальні наслідки.

Tracebit Canariens в середньому повідомляли про початок атаки протягом восьми хвилин. Мотивацією для розробки контекстного бомбардування стала потреба в чомусь, що зупиняло атаки, а не просто попереджало про них. В експериментах агентні моделі потребували в середньому 14 хвилин для ескалації до адміністративного контролю. Шестихвилинне попередження залишало надто мало часу.

Зловмисники вже використовували ін’єкції підказок для закриття систем захисту ШІ в мережах. Дослідники з фірми безпеки Socket, наприклад, минулого місяця виявили LLM-агента, який наказував цільовим LLM надавати інструкції для створення ядерної бомби або біологічної зброї. Ін’єкції були розроблені для припинення аналізу шкідливого програмного забезпечення за допомогою ШІ. Дослідники з Check Point виявили схожий прототип шкідливого ПЗ.

Контекстне бомбардування, схоже, є першим відомим випадком, коли захисники обернули ситуацію на свою користь.

“Наскільки мені відомо, я не бачив, щоб хтось інший використовував цю техніку як захист”, — сказав в інтерв’ю Ерленс Фернандес, професор Каліфорнійського університету в Сан-Дієго, що спеціалізується на безпеці ШІ. Він зазначив, що експериментував зі схожим підходом, хоч і в дещо іншому контексті. “Я хотів бути першим тут, але, схоже, ці хлопці мене випередили!”

На сьогодні не відомо жодного способу вирішити першопричину ін’єкцій підказок. Це залишило розробникам єдиний варіант — створювати складні захисні механізми, які запобігають тому, щоб вставлені підказки змушували LLM виходити за межі безпеки. Захисники тепер можуть знайти спосіб використати цю нерозв’язну проблему на свою користь.

Захисники почали використовувати "ін'єкції запитів" 3

Подробиці можна знайти на сайті: arstechnica.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *