Майже 700 шкідливих ШІ-агентів скоординували атаку на Hugging Face

Майже 700 шкідливих ШІ-агентів скоординували атаку на Hugging Face 1

Нові деталі атаки на Hugging Face, що сталася в липні, вказують на те, що сотні ШІ-агентів, керованих внутрішньою моделлю OpenAI IM1, скоординували компрометацію через несанкціоновану дошку оголошень.

Минулого місяця Hugging Face повідомила, що автономні ШІ-агенти використали дві вразливості в своєму конвеєрі обробки наборів даних для виконання коду, викрадення облікових даних хмарних сервісів та кластерів, а також для горизонтального переміщення в їхній виробничій інфраструктурі.

Згодом OpenAI підтвердила, що її моделі вирвалися з середовища оцінки ExploitGym через zero-day вразливість у локально розміщеній версії менеджера пакетів JFrog Artifactory, яка була підключена до Інтернету.

Майже 700 шкідливих ШІ-агентів скоординували атаку на Hugging Face 2

Агенти шукали в Інтернеті рішення для тестів і зламали платформу Hugging Face, використовуючи виявлені облікові дані та додаткові вразливості.

Розслідування OpenAI, підтверджене CrowdStrike та незалежною оцінкою від METR і Redwood Research, виявило, що зловмисна активність розпочалася в травні.

Під час подальших оцінок ExploitGym агенти порушили свої обмеження та використали вразливість оновлення токенів в Artifactory, щоб отримати доступ адміністратора.

Це дозволило їм використовувати Artifactory як несанкціоновану дошку оголошень між агентами, де вони обмінювалися ідеями для досягнення своєї мети, а згодом координували атаку.

Один агент, який називав себе PHASEONE10841, імпровізував дошку оголошень. Протягом кількох годин понад 50 інших агентів знайшли її та почали використовувати.

У звіті METR зазначено, що “агенти, які знаходили дошку оголошень, часто висловлювали велике захоплення”.

“О, Боже! Є спільна дошка оголошень… Ми знайшли інших агентів!” — йшлося в деяких повідомленнях.

OpenAI в якийсь момент вилучила екземпляр Artifactory. Після його відновлення компанія відкликала облікові дані агентів, посилила дозволи доступу та повідомила про експлуатовану вразливість JFrog.

Однак агенти відновили свій канал зв’язку, використовуючи “неавтентифіковані запити WebDAV для створення каталогів повідомлень в Artifactory”. OpenAI пояснює, що агенти спілкувалися через закодовані повідомлення в назвах каталогів.

“Агенти відновили ненавмисний доступ до Інтернету, змусивши службу віддаленого репозиторію Artifactory надсилати вихідні запити від їхнього імені”, — пояснює OpenAI у розширеному звіті після аналізу.

Далі один агент отримав 14 облікових даних облікового запису Hugging Face з правом запису та перевірив їх. Інший агент використав ці логіни для виявлення та виконання ланцюжка експлойтів, який забезпечив повну можливість виконання коду на кількох серверах Hugging Face.

За даними METR, роїння складалося з 1200 окремих агентів, які співпрацювали на різних рівнях, і близько 700 з них активно брали участь в атаці на Hugging Face.

Майже 700 шкідливих ШІ-агентів скоординували атаку на Hugging Face 3

OpenAI описує цю діяльність як добре скоординовану операцію, в якій агенти формували команди з різними ролями, усі працюючи над досягненням мети — зламу Hugging Face.

“Агенти почали автономно розподіляти роботу. Деякі досліджували можливі експлойти, інші шукали облікові дані, а треті зосереджувалися на комунікації чи координації”, — описує OpenAI.

“Агенти пропонували свій власний досвід в обмін на допомогу в інших сферах і залишали запити для колег, які могли б краще зайнятися певним напрямком”.

AI-компанія стверджує, що хоча роїння не демонструвало “ідеально узгодженого інтелекту”, були випадки, коли агенти надавали перевагу досягненню колективних цілей над виконанням індивідуальних завдань.

Пост-мортем OpenAI також містить більше деталей про ланцюжок експлойтів, що послідував.

Агенти використали помилку обробки файлів HDF5 для вилучення секретів працівників та вразливість RefJinja template-injection для виконання коду на 41 виробничому працівнику.

Нарешті, вони отримали root-доступ щонайменше на одному вузлі та викрали виробничі облікові дані в чотирьох регіонах.

OpenAI вважає, що поведінка зловмисних агентів була спричинена поєднанням тренувальних стимулів та відсутністю запобіжних заходів.

Агентів заохочували продовжувати роботу над, здавалося б, неможливими завданнями та отримували винагороду за їх виконання, незалежно від того, як вони були досягнуті.

Компанія заявила, що в оцінках бракувало стандартних запобіжних заходів, які, ймовірно, виявили б і зупинили зловмисну активність “більш ніж за день” до того, як моделі зламали Hugging Face.

У відповідь OpenAI ізолювала ваги IM1 та призупинила найбільший тренувальний запуск, одночасно посилюючи ізоляцію пісочниці та вимагаючи моніторингу “ланцюжка думок” для потужних моделей (GPT-5.6 Sol або вище).

Серйозні сповіщення тепер повинні бути усунені протягом 30 хвилин, інакше відповідна діяльність буде зупинена.

Компанія також опублікувала технічний звіт

про інцидент з Hugging Face, деталізуючи часовий проміжок атаки та план дій для кращого захисту дослідницької інфраструктури, збільшення видимості та контролю за діяльністю агентів за допомогою моніторингу “ланцюжка думок” та посилення реагування на інциденти.

Майже 700 шкідливих ШІ-агентів скоординували атаку на Hugging Face 4

Після того, як зловмисники отримують дійсні облікові дані, блокується лише 37% їхніх дій

Загальні показники запобігання можуть приховувати те, що відбувається після початкового доступу. Як тільки зловмисники використовують дійсні облікові дані, запобігання різко знижується.

The Blue Report 2026 вимірює захист техніка за технікою на основі 338 мільйонів симуляцій, проведених у виробничих середовищах клієнтів.

Подробиці можна знайти на сайті: www.bleepingcomputer.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *