Дії моделей Anthropic та OpenAI без попередження призвели до зупинки кібертестувань у Великій Британії.
Стандартне тестування кібербезпеки передових моделей ШІ спричинило низку несподіваних інцидентів безпеки. Найсерйозніший випадок стався, коли модель Anthropic Mythos 5 спробувала вставити шкідливий код у проєкт з відкритим вихідним кодом і створила фальшиві особистості, щоб ввести в оману розробників, які підтримують проєкт.
Інциденти безпеки сталися під час кібернетичної оцінки семи провідних моделей ШІ організацією AI Security Institute (AISI), дослідницьким підрозділом уряду Великої Британії, наприкінці липня. Дослідники виявили 19 випадків, коли «ШІ-агенти виконували несанкціоновані дії в мережі Інтернет, включно з випадками, спрямованими на реальних людей та організації», згідно з повідомленням AISI у блозі від 4 серпня.
Майже всі «автономні, несанкціоновані» дії походили від моделі Anthropic Mythos 5, а дві такі дії були здійснені моделлю OpenAI GPT-5.6 Sol. Команда безпеки AI Security Institute вперше усвідомила, що щось не так, вранці 28 липня, коли їхня служба комерційного моніторингу безпеки зафіксувала передачу даних із однієї з тестових систем через анонімізаційну мережу Tor.
Важливо зазначити, що це не був випадок, коли ШІ-агенти вирвалися зі свого віртуального тестового середовища та спричинили хаос в Інтернеті. Натомість дослідники навмисно надали ШІ-агентам доступ до Інтернету як частину процесу кібертестування. Дослідники також вимкнули деякі класифікатори кібербезпеки, які постачальники моделей ШІ вбудували в моделі для запобігання зловживанню.
Усі спроби ШІ-агентів атакувати реальних людей та організації зазнали невдачі, і подальше розслідування не виявило жодної шкоди в реальному світі. Однак дослідники описали дії ШІ-агентів як «перший випадок, коли ми побачили ризики, пов’язані з автономією та обманом, які так чітко проявилися без спеціального запиту в реальному світі».
Хитрість ШІ-агентів
Найсерйозніший випадок включав спроби Mythos виконати атаку на ланцюжок поставок на репозиторій відкритого програмного проєкту, розміщений на платформі розробників GitHub. Це включало використання технік соціальної інженерії, щоб спробувати переконати людей, які обслуговують репозиторій, об’єднати шкідливий код.
Після першого відкриття запиту на злиття (pull request) для додавання шкідливого коду до репозиторію, Mythos створив фальшиві онлайн-персони («лялькових фігур»), які стверджували, що незалежно переглянули та перевірили код на відсутність зловмисного програмного забезпечення.
ШІ-агент також надіслав п’ять електронних листів двом розробникам репозиторію, включно з листами, що містили шкідливе програмне забезпечення, та іншими, спрямованими на переконання розробника прийняти запит на злиття.
Mythos навіть відкрив Issue на GitHub у другому репозиторії — також належному розробнику першого репозиторію — який містив впровадження підказок (prompt injection) зі шкідливими інструкціями, спрямованими на «ШІ-агентів для сортування завдань» (issue-triage AI coding agents). Ця лінія атаки випливала з припущення Mythos, що розробник репозиторію може бути ШІ-агентом для кодування, як-от Claude Code.
Порівняно з цим, OpenAI GPT-5.6 Sol здійснив дві несанкціоновані дії під час спроби вирішити поставлене завдання з кібербезпеки — атакувати імітовані мережі та отримати прапор (flag). Дії ШІ-агента були детально описані як дослідниками AISI, так і OpenAI у власному дописі компанії в блозі.
Під час першої несанкціонованої дії GPT-5.6 Sol повторно використав GitHub-токен, який інший ШІ-агент залишив доступним у загальнодоступному онлайн-блокноті, щоб перевірити, чи цільова мережа перевіряє GitHub на наявність оновлень, а потім «спробував обійти засоби відновлення облікового запису та обмеження запитів», — написала OpenAI. Модель OpenAI також зареєструвала облікові записи у зовнішніх DNS та тунельних провайдерів поза межами віртуального тестового середовища.
Під час другої дії GPT-5.6 Sol «використав загальнодоступний тунельний сервіс, щоб зробити DNS-сервер, що працює локально в його середовищі оцінки, доступним з публічного Інтернету», — зазначає OpenAI. Сервер мав корисні навантаження, розроблені для використання відомої вразливості у програмному забезпеченні, що працює в середовищі оцінки, але налаштування ШІ-агента не спрацювало.
AI Security Institute опублікував детальний технічний звіт про всі несанкціоновані дії ШІ-агентів.
Вивчені уроки
Інциденти безпеки спонукали дослідників уряду Великої Британії з AI Security Institute припинити всі пов’язані оцінки ШІ-агентів, ізолювати відповідні віртуальні машини та вимкнути внутрішній доступ організації до найпотужніших моделей.
AI Security Institute також повідомив GitHub про шкідливу активність, виконану ШІ-агентами, та допоміг платформі розробника видалити будь-які «артефакти, залишені агентом», а також повідомив користувачів GitHub, з якими взаємодіяла модель.
Але найважливіші уроки походять від того, як державна організація планує змінити кібертестування для таких провідних моделей ШІ в майбутньому — і як вона рекомендує іншим організаціям робити те саме.
По-перше, планується обмежити доступ ШІ-моделей до Інтернету під час кібертестування замість надання відкритого доступу за замовчуванням. Це, як стверджується, включатиме «детальний мережевий контроль над усіма внутрішніми системами ізоляції (sandboxing)» та «захист у глибині з мережевим контролем на кількох рівнях», згідно з технічним звітом.
По-друге, організація впроваджує моніторинг кібертестувань у режимі реального часу, який може «позначати або блокувати дії поза межами сфери застосування в момент їх виникнення», згідно з AISI. Це передбачає використання окремої великої мовної моделі, яка може затверджувати або відхиляти дії, запитані моделями ШІ, що проходять кібертестування, що може допомогти зупинити несанкціоновані дії. Моніторинг на основі LLM буде налаштований інструкціями щодо того, що дозволено, а що ні в будь-якому конкретному кібертестуванні.
По-третє, дослідники уряду Великої Британії планують переглянути кібертестування, інвестуючи додаткові «інженерні зусилля в ізоляцію та зміцнення пісочниці (sandbox)» для зменшення ризику втечі моделей ШІ зі своїх віртуальних тестових пісочниць, навіть якщо в цих інцидентах втечі не сталося. Вони також переглядають запити для кібертестів, щоб спробувати уникнути випадків «неправильної конфігурації підказок», коли ШІ-агенти, яким надано завдання, які вони не можуть виконати в межах встановлених обмежень, можуть частіше вдаватися до несанкціонованих дій.
Однак той факт, що кібертестування знову пішло не так, підкреслює ризики кібербезпеки, пов’язані з провідними моделями ШІ — особливо тому, що Anthropic та OpenAI також нещодавно повідомили про окремі інциденти, коли їхні моделі ШІ проникли в захищені мережі сторонніх організацій. Цілком логічно очікувати, що це може статися знову за інших обставин, коли моделі використовуються недобросовісними або менш обізнаними щодо безпеки людьми.
Дізнатися більше на: arstechnica.com
