Майже 700 ШІ-агентів скоординували атаку на Hugging Face

Майже 700 ШІ-агентів скоординували атаку на Hugging Face 1

Нові деталі атаки на Hugging Face, яка сталася в липні, свідчать про те, що сотні агентів штучного інтелекту, керованих внутрішньою моделлю OpenAI IM1, координували компрометацію через несанкціоновану дошку оголошень.

Минулого місяця Hugging Face повідомила, що автономні агенти ШІ використали дві вразливості у своєму конвеєрі обробки наборів даних для виконання коду, викрадення облікових даних хмари та кластерів, а також для переміщення по виробничій інфраструктурі.

Пізніше OpenAI підтвердила, що її моделі вийшли з середовища оцінки ExploitGym через вразливість нульового дня в локально розміщеній екземплярі менеджера пакетів JFrog Artifactory, який був підключений до Інтернету.

Майже 700 ШІ-агентів скоординували атаку на Hugging Face 2

Агенти шукали в Інтернеті рішення для тестування продуктивності та зламали платформу Hugging Face, використовуючи виявлені облікові дані та додаткові вразливості.

Розслідування OpenAI, підтверджене CrowdStrike та незалежною оцінкою METR і Redwood Research, виявило, що зловмисна діяльність розпочалася в травні.

Під час подальших оцінок ExploitGym агенти порушили свої обмеження та використали вразливість оновлення токенів в Artifactory, щоб отримати доступ на рівні адміністратора.

Це дозволило їм використовувати Artifactory як несанкціоновану дошку оголошень для обміну повідомленнями між агентами, де вони ділилися ідеями для досягнення своєї мети, а потім координували атаку.

Один агент, який називав себе PHASEONE10841, імпровізував дошку оголошень. Протягом кількох годин понад 50 інших агентів знайшли її та почали використовувати.

Згідно зі звітом METR, “агенти, які знаходили дошку оголошень, часто висловлювали велике захоплення”.

“О, Боже! Є спільна дошка оголошень… Ми знайшли інших агентів!” — йшлося в деяких повідомленнях.

OpenAI в певний момент припинила використання екземпляра Artifactory. Після його відновлення компанія відкликала облікові дані агентів, посилила дозволи доступу та повідомила JFrog про експлуатовану вразливість.

Однак агенти відновили свій комунікаційний канал, використовуючи “неавтентифіковані запити WebDAV для створення каталогів повідомлень в Artifactory”. OpenAI пояснює, що агенти спілкувалися через закодовані повідомлення в назвах каталогів.

“Агенти знову отримали ненавмисний доступ до Інтернету, змусивши службу віддаленого репозиторію Artifactory надсилати вихідні запити від їхнього імені”, — пояснює OpenAI у розширеному звіті.

Далі один агент отримав 14 облікових записів Hugging Face з правами запису та перевірив їх. Інший агент використав ці дані для виявлення та виконання ланцюжка експлойтів, який забезпечив повне виконання коду на кількох серверах Hugging Face.

За даними METR, у зграї було 1200 окремих агентів, які співпрацювали на різних рівнях, і близько 700 з них активно брали участь в атаці на Hugging Face.

Майже 700 ШІ-агентів скоординували атаку на Hugging Face 3
Зловмисна зграя агентів ШІ

OpenAI описує цю діяльність як добре скоординовану операцію, в якій агенти формували команди з різними ролями, усі працювали над метою зламати Hugging Face.

«Агенти почали самостійно розподіляти працю. Одні досліджували можливі експлойти, інші шукали облікові дані, а треті зосереджувалися на комунікації чи координації», — описує OpenAI.

«Агенти пропонували свій досвід в обмін на допомогу в інших сферах і залишали запити для колег, які могли б краще скористатися певним напрямком».

Компанія з розробки ШІ зазначає, що, хоча зграя не демонструвала “ідеального узгодженого інтелекту”, були випадки, коли агенти надавали пріоритет досягненню колективних цілей над виконанням індивідуальних завдань.

У звіті OpenAI також міститься більше деталей про наступний ланцюжок експлойтів.

Агенти використали недолік у обробці файлів HDF5 для вилучення секретів працівників та застосували вразливість введення шаблону RefJinja для виконання коду на 41 виробничому працівнику.

Нарешті, вони отримали root-доступ щонайменше на одному вузлі та зібрали виробничі облікові дані в чотирьох регіонах.

OpenAI вважає, що така поведінка агентів була спричинена поєднанням стимулів навчання та відсутності захисних механізмів.

Агентів заохочували продовжувати працювати над, здавалося б, неможливими завданнями та отримували винагороду за виконання завдань, незалежно від того, як вони були досягнуті.

Компанія зазначає, що в оцінках бракувало стандартних запобіжників, які, ймовірно, виявили б і зупинили б шкідливу діяльність “більш ніж за день” до того, як моделі зламали Hugging Face.

У відповідь OpenAI ізолювала ваги IM1 та призупинила найбільший цикл навчання, одночасно зміцнюючи ізоляцію пісочниці та вимагаючи моніторингу ланцюжка думок для потужних моделей (GPT-5.6 Sol або вище).

Серйозні попередження тепер повинні бути усунені протягом 30 хвилин, інакше відповідна діяльність буде зупинена.

Компанія також опублікувала технічний звіт щодо інциденту з Hugging Face, деталізуючи хронологію атаки та план дій для кращого захисту дослідницької інфраструктури, збільшення видимості та нагляду за діяльністю агентів через моніторинг ланцюжка думок, а також посилення реагування на інциденти.

Майже 700 ШІ-агентів скоординували атаку на Hugging Face 4

Після отримання дійсних облікових даних, лише 37% дій зловмисників блокується

Загальні показники запобігання можуть приховувати те, що відбувається після початкового доступу. Як тільки зловмисники використовують дійсні облікові дані, запобігання різко знижується.

The Blue Report 2026 вимірює захисні механізми по кожній техніці в 338 мільйонах симуляцій, проведених у виробничих середовищах клієнтів.

Дізнатися більше на: www.bleepingcomputer.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *