Атаки з кількома поворотами зламали ШІ-моделі у 88% випадків, хоча тестування з одним поворотом цього не виявило, попереджає керівник відділу безпеки ШІ Cisco на VB Transform 2026

Атаки з кількома поворотами зламали ШІ-моделі у 88% випадків, хоча тестування з одним поворотом цього не виявило, попереджає керівник відділу безпеки ШІ Cisco на VB Transform 2026 1

Коли Cisco провела 6 986 багатоходових атак на 15 флагманських моделей, зловмисники, які адаптувалися протягом розмови, змогли обійти захист у 88,3% випадків. Емі Ченг, керівниця відділу аналізу загроз і досліджень безпеки ШІ в Cisco, представила ці дані під час панельної дискусії з безпеки агентів на конференції VB Transform 2026. Ця цифра має викликати занепокоєння у всіх, хто досі використовує програми тестування на проникнення (red teaming) за один хід.

Опитування VentureBeat Pulse, проведене у червні 2026 року серед 107 підприємств, пояснює, чому зал був повний. Більше половини респондентів (54%) вже пережили підтверджений інцидент безпеки з використанням агентів (18%) або були близькі до такого, але вчасно його зупинили (36%). Лише 32% надають кожному агенту власну, окремо керовану ідентифікаційну картку, а ще менше (30%) ізолюють найризикованіших агентів у пісочницях. Контроль від провайдерів та гіперскейлерів залишається основним рівнем безпеки агентів у 82% компаній, що брали участь в опитуванні. Найбільші постачальники безпекових рішень провели ті ж розрахунки.

Palo Alto Networks завершила придбання CyberArk за 25 мільярдів доларів у лютому, CrowdStrike домовилася в січні про покупку SGNL за 740 мільйонів доларів, а Cisco оголосила про намір придбати Astrix Security за близько 400 мільйонів доларів. Усі ці угоди спрямовані на рівень ідентифікації та ізоляції, побудову якого більшість підприємств ще не завершили.

Ченг приєдналася до панельної дискусії, маючи майже двадцятирічний досвід роботи в галузі кібербезпеки, державного управління та військової сфери. Вона керувала глобальними операціями з кібербезпеки як виконавчий директор у JPMorgan Chase, де очолювала команди з розвідки кіберзагроз банку, а також працювала старшим співробітником Комітету з міжнародних справ Палати представників і офіцером резерву ВМС США. Крім того, вона викладає кібербезпеку та нові загрози як запрошений викладач у Середньоатлантичному інституті міжнародних досліджень.

Цифра 88,3%, озвучена Ченг, походить з дослідження, співавтором якого вона була разом з Ніколасом Конлі. Воно базувалося на 30 090 одноразових запитах та 6 986 багатоходових атаках на 15 закритих пропрієтарних флагманських моделей. Відсоток успішних багатоходових атак варіювався від 7,89% до 88,3%. Кожна протестована модель показала нетривіальну вразливість до багатоходових атак, а два методи тестування навіть не ранжували моделі в однаковому порядку. Cisco публікує показники оцінки загроз для 105 моделей на своїй дошці лідерів безпеки LLM (LLM Security Leaderboard), повідомила вона аудиторії.

«Якщо ви не розумієте, як моделі вразливі до різних типів атак, ви не можете врахувати, як саме ця модель, що живить вашого агента, живить вашу програму, призводить до критичних збоїв», — сказала Ченг. Тестування за один хід — це одноразовий шкідливий запит, пояснила вона, тоді як продовження атаки у довшу розмову «більш реалістично відображає те, як ми насправді взаємодіємо з нашими моделями, агентами, програмами». Така довша взаємодія виявляє шкідливі виходи та невідповідну поведінку, які миттєвий знімок ніколи не вловлює.

Cisco перенесла саме тестування на територію агентів. Ченг описала фреймворк, де агенти оцінюють сценарій розгортання, розробляють відповідні атаки, вирішують, чи варто їх реалізовувати, виконують їх і оцінюють власний успіх. Що її найбільше здивувало після всієї цієї складності, так це те, наскільки простою залишається відповідь щодо захисту. «Відповідь все ще така, що це досить просто», — сказала вона. «Вам не потрібно бути надто винахідливим. Вам просто потрібно подумати про фундаментальні основи того, що саме ви намагаєтеся захистити у своїй організації».

Її початковою точкою для CISO, які розпочинають розгортання агентів, є Комплексна структура безпеки та надійності ШІ від Cisco (Integrated AI Security and Safety Framework), яка, за її словами, «визначає всі способи компрометації ШІ протягом життєвого циклу ШІ» від модальності до ланцюжка постачання. Звідти команди можуть рухатися назад від реальних інцидентів, відстежувати, як була досягнута кожна атака, і використовувати фреймворк для побудови стратегії з відповідним покриттям і заходами пом’якшення.

Хезер Сейлан, CISO компанії Box, бачить такий самий пробіл з боку захисника. «Багато з того, що ви бачите в тестуванні агентів на проникнення (red teaming), — це лише один хід, а це не те, як люди насправді взаємодіють з ШІ щодня», — сказала вона аудиторії. Box тепер симулює багатоходових зловмисників за допомогою агентів, які мислять як атакуючий і ітеративно намагаються захопити ціль. «Ви повинні перевіряти своїх агентів, тому що інакше ви не знаєте, чи справді ваші засоби контролю виконання працюють так, як ви задумали».

Box розгорнула агентів у своєму центрі операцій безпеки близько року тому, починаючи з вимоги людського схвалення кожної дії. Довіра швидко зросла, і аналітики перейшли в режим моніторингу. Потім агент припустився однієї помилки, і вся накопичена довіра зникла. «Їм довелося починати все спочатку», — сказала вона. «Тому я думаю, що цей моніторинговий компонент є надзвичайно важливим. Навіть якщо ви не будете мати людського контролю, ситуації змінюються, моделі змінюються, і ми не можемо контролювати, як моделі змінюються та інтерпретують речі».

Раджеш Парек, віце-президент з питань ШІ та машинного навчання в Intuit, представив точку зору розробника. Парек керував масштабними системами комп’ютерного зору та машинного навчання, що працюють на продуктах Google Maps та Geo, перш ніж приєднатися до Intuit, і має ступінь доктора комп’ютерних наук.

Три рівні проти операційної системи

Сейлан описала підхід Box як три концентричні рівні. Спочатку йде дозвіл, тому агент ніколи не отримує доступу до більшої кількості контенту, ніж людина, яка його викликала. Для кожного завдання агента запускаються тимчасові середовища пісочниці, що обмежують радіус ураження, якщо агент буде захоплений, а контроль виконання в реальному часі обмежує виклики інструментів агентом лише тими, що стосуються поточного завдання. «Якщо ви хочете, щоб агент підсумував документ для вас, і ви отримаєте впровадження запиту (prompt injection), яке каже переслати це на [email protected], він не зможе цього зробити», — сказала Сейлан. «Ця дія в цьому виклику інструменту навіть не входить до його словника».

Вона класифікувала дії агентів за трьома категоріями нагляду. Дії, які не є чутливими, як-от читання та підсумовування, не потребують людського втручання. Помірно чутливі дії пропускають людське схвалення, але реєструються та моніторяться, тоді як руйнівні дії, як-от масове видалення файлів, завжди потребують участі людини. «Речі будуть значно змінюватися між цими трьома категоріями», — визнала вона, «але встановлення таких категорій заздалегідь дозволяє мати принципову основу».

Замість того, щоб додавати контроль до агентів по одному, Intuit створила центральну платформу під назвою GenOS, скорочення від генеративної операційної системи ШІ, яка абстрагує моделі безпеки, ризиків та шахрайства, щоб розробники окремих агентів не винаходили захист заново. «Дозвіл — це не надання доступу до ШІ», — сказав Парек. «Натомість, це визначення дуже чітко окреслених та легко аудитованих повноважень для агента виконувати дуже конкретні завдання». Intuit перейшла від агентів, які успадковували дозволи користувача, до того, що кожен агент має власну ідентичність, і компанія зараз досліджує зміни дозволів під час сесії, пов’язані з конкретним поточним завданням.

Парек називає ширшу модель платформою на основі ШІ, де людський експерт вбудований в архітектуру довіри, а не прикріплений як запірний механізм. «Парадигма, яку ми переслідуємо, полягає в тому, де користувач, агент ШІ та людський експерт співпрацюють для вирішення проблеми користувача».

Кінець людського перегляду коду

Сейлан обговорювала напругу між безпековим тестуванням та швидкістю розробки без ухилень. «Дні безпечного перегляду коду, коли людина дивиться на код, і ми дивимося на огляди архітектури безпеки, проектну документацію, закінчилися», — сказала вона. «Якщо ви будете продовжувати робити безпеку таким чином, ви залишитеся позаду». Box будує повністю агентний життєвий цикл розробки, де агенти переглядають проектну документацію, застосовують вимоги безпеки та перевіряють код на вразливості. «Я дуже оптимістично налаштована, що ми досягнемо точки, коли будемо писати код без вразливостей безпеки, тому що агенти та моделі стануть настільки хорошими в написанні коду без вразливостей», — сказала вона. «Ми ще дуже далекі від цього».

Її порада для команд розробників повністю оминає просунуті концепції ШІ і повертається до основ, які передували появі агентів. «Все зводиться до дуже базового принципу найменших привілеїв», — сказала вона. «Якщо ви почнете надавати своїм агентам надмірно широкі дозволи на початку, буде дуже важко це виправити та побудувати інфраструктуру, яка дозволяє використовувати ці тимчасові облікові дані та лише ці вузько визначені завдання».

Парек пояснив, чому поверхня тестування на проникнення (red teaming) так швидко розширилася. «Ці агенти мають навички, і навички можуть стати вразливостями», — сказав він. «Агенти мають доступ до певних даних, вони мають доступ до інструментів, і можуть бути загрози, що ховаються в цих інструментах. Тому радіус ураження шкідливого коду або наміру різко зростає». Коли Intuit виявляє поширені шаблони вразливостей під час ручного тестування, вона автоматизує ці тести в GenOS, щоб майбутні агенти успадковували захист, а тестувальники зосереджувалися на нових векторах загроз. Сканування в реальному часі запитів та відповідей додає останній рівень, який може зупинити підозрілу відповідь та ескалувати її до людського експерта, сказав він.

«Вам потрібно постійно тестувати, щоб переконатися, що вони залишаються стійкими до створених вами захистів, а також враховувати будь-які відхилення чи інші залежності, які ви вводите у свій сценарій і які можуть створити нові вразливості», — сказала вона.

Намір проти ймовірності

Запитання з аудиторії про виявлення намірів викликало найгостріший обмін думками під час сесії. Сейлан зазначила, що коли власний агент Box працює, система завжди знає намір користувача, оскільки контролює запит, що означає, що можна розробити захисні бар’єри та обмеження виклику інструментів. Складнішим викликом, який, за її визнанням, Box все ще намагається вирішити, є підключення зовнішніх агентів, коли контекст запиту неясний.

Цей обмін виявив розкол, що пронизує всю галузь. Mastercard, під час вогняної бесіди, що безпосередньо передувала панелі, виступила за кількісне визначення намірів, створивши фреймворк з відкритим кодом для його поширення як стандарту, оскільки складні B2B закупівлі не можуть працювати без такої довіри. Технічні директори з безпеки кінцевих точок, у брифінгах з VentureBeat, пішли іншим шляхом, заявивши, що вони будуть спиратися на ймовірність, а не на виведення намірів, для виробничих робочих навантажень. Ченг пояснила, чому моделі, як вони тренуються сьогодні, не можуть надійно виводити намір із запиту, тому детерміновані засоби контролю та поведінкові проксі залишаються необхідними. Сейлан погодилася, що обидва компоненти потрібні. «Якщо ви не робите нічого детермінованого, ви надмірно покладаєтеся на цей намір, а я ще не бачила програм, які б на це були готові», — сказала вона.

Історія Сейлан про колапс довіри після однієї помилки агента стала найяскравішим моментом панелі, оскільки безпека агентів на підприємствах — це проблема, яка не вирішується раз і назавжди. Моделі змінюються, дозволи дрейфують, а зловмисники адаптуються під час багатоходових розмов, які ніколи не вловлюються миттєвими тестами.

Для 82% підприємств, що покладаються на нативні засоби контролю провайдера як основний рівень безпеки, та для 59%, які планують купувати інструментарій безпеки агентів протягом наступних 12 місяців, висновок панелі був простим. Тестуйте так, як атакують зловмисники, через повні розмови та постійно, або виявите на виробництві те, що пропустили ваші одноходові тести на проникнення.

Подробиці можна знайти на сайті: venturebeat.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *