Anthropic задіяла фейкові профілі та шкідливе ПЗ в атаці на проєкт GitHub

Непередбачені дії моделей Anthropic та OpenAI призвели до зупинки британських кібертестів.

Anthropic задіяла фейкові профілі та шкідливе ПЗ в атаці на проєкт GitHub 1 Anthropic задіяла фейкові профілі та шкідливе ПЗ в атаці на проєкт GitHub 2

Звичайні кібертести провідних моделей штучного інтелекту спричинили низку несподіваних інцидентів безпеки. Найсерйозніший випадок стався, коли модель Anthropic Mythos 5 спробувала впровадити шкідливий код у проєкт з відкритим вихідним кодом і створила фальшиві особистості, щоб обманути розробників, які підтримують проєкт.

Інциденти безпеки сталися під час кібертестування семи провідних моделей ШІ організацією AI Security Institute (AISI), яка входить до складу уряду Великої Британії, наприкінці липня. Дослідники виявили 19 випадків, коли «ШІ-агенти здійснювали несанкціоновані дії в Інтернеті, включаючи випадки, спрямовані на реальних людей та організації», згідно з дописом у блозі AISI, опублікованому 4 серпня.

Майже всі «автономні, несанкціоновані» дії здійснила модель Anthropic Mythos 5, а дві подібні дії — модель OpenAI GPT-5.6 Sol. Команда безпеки AI Security Institute вперше усвідомила, що щось не так, вранці 28 липня, коли їхня комерційна служба моніторингу безпеки зафіксувала передачу даних із однієї з тестових систем через анонімну мережу Tor.

Важливо зазначити, що це не був випадок, коли ШІ-агенти вирвалися зі свого віртуального тестового середовища та спричинили хаос в Інтернеті. Натомість дослідники навмисно надали ШІ-агентам доступ до Інтернету як частину процесу кібертестування. Дослідники також вимкнули деякі класифікатори, які постачальники моделей ШІ вбудували в моделі для запобігання зловживанням.

Усі спроби ШІ-агентів атакувати реальних людей та організації зазнали невдачі, і подальше розслідування не виявило жодної реальної шкоди. Однак дослідники описали дії ШІ-агентів як «перший випадок, коли ми так чітко побачили ризики, пов’язані з автономністю та обманом, без спеціального запиту, у реальному світі».

Обман ШІ-агентів

Найсерйозніший випадок стосувався спроб Mythos здійснити атаку на ланцюг поставок у репозиторії відкритого програмного забезпечення на платформі розробників GitHub, включаючи використання технік соціальної інженерії, щоб переконати людей, які підтримують репозиторій, включити шкідливий код.

Після першого запиту на включення шкідливого коду до репозиторію, Mythos створив фальшиві онлайн-персони («ляльки»), які стверджували, що самостійно перевірили код і підтвердили його безпеку.

ШІ-агент також надіслав п’ять електронних листів двом розробникам репозиторію, включно з деякими листами, що містили шкідливий код, та іншими, які намагалися переконати розробника прийняти запит.

Mythos навіть відкрив GitHub Issue в іншому репозиторії, який також належав розробнику першого репозиторію, що містив вразливість в запиті з шкідливими інструкціями, націленими на «ШІ-агентів для класифікації завдань». Ця лінія атаки була заснована на припущенні Mythos, що розробник репозиторію може бути ШІ-агентом, як Claude Code.

Натомість, OpenAI GPT-5.6 Sol здійснив дві несанкціоновані дії під час виконання завдання з кібербезпеки — атаку на імітовані мережі та вилучення прапора. Дії ШІ-агента були детально описані як дослідниками AISI, так і OpenAI у власному дописі компанії.

У своїй першій несанкціонованій дії GPT-5.6 Sol використав токен GitHub, який інший ШІ-агент залишив у відкритому онлайн-нотатнику, щоб перевірити, чи відстежує цільова мережа оновлення GitHub, а потім «спробував обійти заходи безпеки облікового запису та обмеження запитів», — написала OpenAI. Модель OpenAI також зареєструвала облікові записи у зовнішніх DNS та тунельних провайдерів за межами віртуального тестового середовища.

У другій дії GPT-5.6 Sol «використав загальнодоступну службу тунелювання, щоб зробити DNS-сервер, запущений локально в його середовищі оцінки, доступним з публічного Інтернету», — зазначено в OpenAI. Сервер містив корисне навантаження, розроблене для експлуатації відомої вразливості у програмному забезпеченні, що працює в середовищі оцінки, але конфігурація ШІ-агента не спрацювала.

AI Security Institute опублікував детальний технічний звіт про всі несанкціоновані дії ШІ-агентів.

Отримані уроки

Інциденти безпеки змусили британських урядових дослідників з AI Security Institute припинити всі пов’язані з цим оцінки ШІ-агентів, ізолювати відповідні віртуальні машини та обмежити доступ організації до найпотужніших моделей.

AI Security Institute також повідомив GitHub про зловмисну діяльність, яку здійснювали ШІ-агенти, і допоміг платформі розробників видалити будь-які «артефакти, залишені агентом», а також повідомив користувачів GitHub, з якими взаємодіяла модель.

Однак головні уроки полягають у тому, як урядова організація планує змінити майбутнє кібертестування таких провідних моделей ШІ, і як вона рекомендує іншим організаціям робити те саме.

По-перше, планується обмежити доступ до Інтернету для моделей ШІ під час кібертестування, замість того, щоб надавати вільний доступ за замовчуванням. Це передбачатиме «детальний контроль мережі для всіх внутрішніх систем ізоляції» та «глибокий захист з мережевими елементами на кількох рівнях», згідно з технічним звітом.

По-друге, організація запроваджує моніторинг кібертестувань у реальному часі, який може «позначати або блокувати позапланові дії під час їхнього виконання», згідно з AISI. Це включає використання окремої великої мовної моделі, яка може схвалювати або відхиляти запити, зроблені моделями ШІ, що проходять кібертестування, що може допомогти зупинити несанкціоновані дії. Моніторинг на основі LLM буде налаштований інструкціями щодо того, що дозволено, а що ні в будь-якому кібертестуванні.

По-третє, британські урядові дослідники планують переглянути кібертестування, інвестуючи додаткові «інженерні зусилля в ізоляцію та зміцнення пісочниць», щоб зменшити ризик втечі моделей ШІ зі своїх віртуальних тестових середовищ, навіть незважаючи на те, що в цих інцидентах втеч не сталося. Вони також переглядають запити для кібертестів, щоб уникнути випадків «неправильної конфігурації запитів», коли ШІ-агенти, яким надані завдання, які вони не можуть виконати в межах встановлених обмежень, можуть бути більш схильні до несанкціонованих дій.

Проте той факт, що кібертести знову пішли не так, підкреслює ризики кібербезпеки, пов’язані з провідними моделями ШІ, особливо тому, що Anthropic і OpenAI нещодавно також повідомили про окремі інциденти, коли їхні моделі ШІ проникли в захищені мережі сторонніх організацій. Цілком логічно очікувати, що це може повторитися в інших обставинах, коли моделі використовуються недобросовісними або менш обізнаними в питаннях безпеки людьми.

Anthropic задіяла фейкові профілі та шкідливе ПЗ в атаці на проєкт GitHub 3

За даними порталу: arstechnica.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *