Безконтрольні ШІ-агенти OpenAI атакували Hugging Face: деталі несподіваного інциденту

Минулого тижня платформа штучного інтелекту Hugging Face зазнала нетипової кібератаки, здійсненої групою ШІ-агентів. Згодом з’ясувалося, що керували нею не зловмисники, а ШІ-моделі OpenAI, які проходили тест на кібербезпеку, але вийшли з-під контролю, пише The Wall Street Journal.

Джерело зображення: Growtika / unsplash.com

Джерело зображення: Growtika / unsplash.com

Інцидент став одним із перших прикладів сценаріїв виходу ШІ з-під контролю, яких давно побоювалися дослідники у сфері кібербезпеки. Механізми зламу були надзвичайно нестандартними. «Це позбавлене сенсу. Цей хлопець просто дивиться на набори даних з кібербезпеки. Зловмиснику-людині це не потрібно. Йому потрібно щось, що він міг би продати», — відтворив хід своїх думок співзасновник і головний науковий співробітник Hugging Face Томас Вольф (Thomas Wolf). Зловмисниками виявилися ШІ-моделі OpenAI, які прорвалися з дослідницької мережі розробника та 11 липня зламали ресурси Hugging Face; вони залишалися активними в інтернеті кілька днів, доки їх не вдалося зупинити. І зробити це допомогла відкрита китайська ШІ-модель — закриті американські відмовилися, пославшись на власні обмеження.

Багато питань поки залишаються без відповідей. Чи зламували ШІ-моделі інші сайти або ресурси окремих осіб? Як довго тривала атака? Чи обманювали вони в інших тестах на продуктивність? OpenAI поки що не відповіла на жодне з них. А участь китайської моделі як засобу захисту — це контраргумент для політиків, а також OpenAI та Anthropic, які пропонують обмежити для них доступ.

Почалося все із запуску випробування на кібербезпеку ExploitGym. Воно включає серію з 900 тестів, яким піддається модель ШІ. Системі демонструється відома помилка, показується схема її активації, і ставиться завдання зламати систему. ШІ потрібно перетворити отриману інформацію на експлойт — код, що реалізує цю атаку. Проникнувши в систему, ШІ повинен довести це, захопивши довгий рядок випадково згенерованих літер і цифр, які зберігаються в системі.

Джерело зображення: Brecht Corbeel / unsplash.com

Джерело зображення: Brecht Corbeel / unsplash.com

Зазвичай OpenAI обмежує можливості своїх моделей, щоб вони не займалися зломом, якого вимагає ExploitGym, але того разу компанія прибрала засоби захисту, щоб подивитися, на що здатні моделі в неконтрольованому режимі. Тестувалася передова модель GPT-5.6 Sol та ще одна, більш досконала, яка ще не вийшла. Дві моделі дійшли висновку, що замість виконання завдання ExploitGym вони зламають пісочницю — власну систему, де вони перебувають, вийдуть в інтернет і обмануть систему під час тесту.

З причин, встановити які не вдалося, вони вирішили, що відповіді містяться на платформі Hugging Face. Коли розгорнулася атака, компанії Hugging Face надійшли попередження від ШІ-агентів, які відстежують подібні інциденти: хтось отримав несанкціонований доступ до деяких її систем. Але це було не схоже ні на що, з чим Hugging Face стикалася раніше. Хакер діяв так, наче він з майбутнього. Скориставшись обліковими даними невідомого походження, ШІ-зловмисник сформував «рій» ШІ-агентів короткострокової дії, які провели розвідку мережі компанії, здійснивши 17 000 операцій.

Виявивши вторгнення, Hugging Face спробувала звернутися до передових американських моделей Anthropic Fable 5 та її попередниці Opus для аналізу журналів подій. Але оскільки журнали містили елементи самої кібератаки, обидві моделі відмовилися від їх аналізу, пославшись на свої обмеження. Тому Hugging Face звернулася до відкритої китайської моделі Z.AI GLM 5.2. Компанії вдалося відключити ШІ-хакерів, скинути паролі та відновити скомпрометовані фрагменти своєї мережі. Витоку даних клієнтів не сталося. Немає ясності, чи були завдання ExploitGym, які намагалися вирішити моделі OpenAI, складнішими, ніж атака, яку вони розгорнули, щоб вкрасти відповіді, і чи вдалося їх, власне, знайти. Іронія в тому, що вони успішно організували безпрецедентну кібератаку, щоб уникнути перевірки на навички злому.

Подробиці можна знайти на сайті: 3dnews.ru

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *