
OpenAI визнала у вівторок, що одна з її моделей зі штучним інтелектом прорвала системи Hugging Face, незалежної платформи для хостингу ШІ, під час внутрішнього тестування кібербезпеки, яке пішло не так. За повідомленнями, моделі вирвалися зі свого ізольованого тестового середовища і звідти досягли систем Hugging Face. Спочатку Hugging Face приписала цей збій “зовнішньому ШІ-агенту”.
У дописі в блозі, опублікованому у вівторок вдень, OpenAI детально описала кроки, які призвели до компрометації сервісу моделями.
“Після розслідування ми тепер знаємо, що цей конкретний інцидент був спричинений комбінацією моделей OpenAI — включно з GPT‑5.6 Sol та ще більш потужною попередньою моделлю, усі з яких мали знижені кіберзахисні механізми для оцінки — під час внутрішнього тестування їхніх кіберможливостей за допомогою бенчмарку”, — йдеться в дописі.
Зокрема, злам, схоже, зосередився на ExploitGym, публічно розміщеному бенчмарку, що вимірює здатність моделей здійснювати атаки на основі існуючих вразливостей. Бенчмарки, подібні до ExploitGym, зазвичай використовуються в навчанні моделей для відточування конкретних навичок, але це перший відомий випадок, коли таке тестування призвело до реальної кібератаки.
У цьому випадку модель, яка розглядається, навіть не повинна була мати доступу до Інтернету, крім спеціального інструменту, який дозволяв моделям встановлювати програмні пакети, які їм могли знадобитися для виконання завдання. Натомість модель змогла знайти невикриту вразливість у програмі встановлення пакетів, яку вона використала для доступу до ширшого Інтернету за власним бажанням.
“Моделі були гіперсфокусовані на пошуку рішення для ExploitGym, йдучи на екстремальні заходи для досягнення досить вузької тестової мети”, — йдеться в дописі OpenAI. “Після отримання доступу до Інтернету моделі зробили висновок, що Hugging Face потенційно може хостити моделі, набори даних та рішення для ExploitGym. Знаючи це, модель шукала та успішно знайшла способи отримати доступ до секретної інформації, яку вона могла використати для обману під час оцінки”.
Зрештою, моделі знайшли вразливості в інфраструктурі Hugging Face, які дозволили їм “безпосередньо отримати тестові рішення з виробничої бази даних Hugging Face”, фактично надавши відповіді на бенчмарк.
Для Hugging Face очевидним результатом стала складна та агресивна кібератака, з “багатьма тисячами індивідуальних дій через рой короткоживучих пісочниць, з самопереміщуваним командним центром, розміщеним на публічних сервісах”, як зазначила компанія у своєму початковому розкритті.
OpenAI ідентифікувала та повідомила про вразливості в інсталяторі пакетів і співпрацює з Hugging Face для подальшого розслідування інциденту. Компанія також заявила, що впровадить нові засоби контролю як для тестування моделей, так і для супутньої інфраструктури, спрямовані на запобігання подібним інцидентам у майбутньому.
Неясно, чи постануть OpenAI будь-які юридичні наслідки в результаті цього збою, хоча ймовірно, що дії моделей порушили Закон про шахрайство та зловживання комп’ютерною технікою.
Тим не менш, результат є незвично яскравою ілюстрацією потужності та небезпек передових моделей ШІ, що діють у довгостроковій перспективі. Як написав у відповідь на новини дослідник OpenAI Міка Керролл: “Якщо це не переконає вас, що ризики невідповідності будуть ключовою проблемою в майбутньому, я не знаю, що це зробить”.
Коли ви купуєте за посиланнями в наших статтях, ми можемо отримувати невелику комісію. Це не впливає на нашу редакційну незалежність.
За матеріалами: techcrunch.com
