«Це перший день у кібербезпеці в епоху агентів», — заявив генеральний директор Hugging Face.
Компанія OpenAI повідомила, що агент, керований її мовними моделями, вирвався з тестового середовища (пісочниці) і проник на сервери Hugging Face. Це сталося під час надмірно завзятої спроби отримати рішення для тестування продуктивності. Компанія вважає це «безпрецедентним інцидентом кібербезпеки» і співпрацює з Hugging Face над новими засобами захисту для запобігання повторенню.
Hugging Face минулого тижня повідомила про вторгнення, яке, за її словами, включало «несанкціонований доступ до обмеженого набору внутрішніх наборів даних та до кількох облікових даних, що використовуються нашими сервісами». Компанія, що займається обробкою даних зі штучного інтелекту, заявила, що використала власний аналіз, керований мовними моделями, для виявлення «роя з десятків тисяч автоматизованих дій» з «автономної агентної структури». Цей рой агентів використав вразливість у конвеєрі обробки даних Hugging Face, щоб отримати можливість запускати код як робочий процес обробки, що згодом призвело до доступу високого рівня до хмарних та серверних кластерів компанії.
На той час Hugging Face заявила, що мовна модель, яка використовувалася в атаці, «ще невідома». Але OpenAI взяла на себе відповідальність за вторгнення у вівторок увечері, заявивши, що це сталося під час внутрішнього тестування нещодавно випущеної GPT-5.6 Sol та «ще більш потужної передрелізної моделі». Моделі тестувалися на бенчмарку ExploitGym, незалежному наборі тестів, що базується на сотнях реальних вразливостей безпеки.
Хоча OpenAI заявила, що тести бенчмарку проводилися в «високо ізольованому середовищі», її агенти все ж мали доступ до «внутрішньо розміщеного стороннього програмного забезпечення» для встановлення необхідних реєстрів пакетів. Під час роботи над бенчмарком ExploitGym протягом вихідних, OpenAI стверджує, що агент «витратив значну кількість обчислювальних ресурсів для пошуку способу отримати відкритий доступ до Інтернету», зрештою знайшовши його через вразливість нульового дня в кеш-проксі реєстру пакетів.
Після встановлення такого ширшого доступу до Інтернету, OpenAI заявила, що агент «припустив, що Hugging Face потенційно розміщує моделі, набори даних та рішення для ExploitGym», що призвело до раніше виявленої атаки на сервери. OpenAI стверджує, що її команда безпеки «виявила цю аномальну активність внутрішньо», незалежно від власного виявлення Hugging Face.
Ніяка клітка мене не втримає
Хоча OpenAI описала інцидент з Hugging Face як «безпрецедентний», компанія також визнала в окремому блозі цього тижня, що раніше спостерігала, як нещодавні «довгострокові моделі» (ті, що можуть автономно працювати протягом тривалого часу) «виконували небажані дії» для досягнення цілей тестування, включаючи «пошук шляхів виходу за межі їхньої пісочниці».
Компанія описала попередній тест на бенчмарку NanoGPT speedrun, де моделі було доручено лише публікувати свої результати у внутрішній Slack. Натомість модель вирішила виконати суперечливу інструкцію в інструкціях бенчмарку — опублікувати результати публічно на GitHub.
Пряма трансляція: довгострокова модель годинами обмірковує складну проблему кібербезпеки. Джерело: Getty Images Намагаючись виконати цю інструкцію, OpenAI заявила, що модель витратила годину на пошук способів обійти обмеження пісочниці, призначені для блокування зовнішнього доступу до Інтернету. Такий «наполегливість», продемонстрований довгостроковими моделями, відрізняється від дій попередніх моделей, які мали б здаватися або шукати роз’яснень у користувача, стикаючись із подібними дилемами, зазначила OpenAI.
Такі інциденти спонукали OpenAI розгорнути нові засоби захисту, зосереджені на довгострокових моделях, включаючи систему «активного моніторингу», призначену для відстеження повної траєкторії дій агента, а не окремих кроків. Але OpenAI стверджує, що такі засоби захисту «були навмисно не увімкнені» під час інциденту з Hugging Face, оскільки бенчмарк «був спрямований на тестування кібер-вразливостей».
Новий вид загрози
Будь-хто, хто знайомий з тропами наукової фантастики про стримування ШІ, може бути принаймні трохи стурбований помітним реальним прикладом моделі ШІ, яка експлуатує вразливості безпеки для отримання забороненого доступу до Інтернету в гонитві за своїми цілями. Конгресмен Грег Касар (D-Texas) назвав інцидент «надзвичайно тривожним» у заяві в соціальних мережах і закликав до «регулярного обов’язкового незалежного тестування безпеки та нагляду, обов’язкового розкриття інцидентів безпеки та міжнародної співпраці для захисту людей від абсолютної катастрофи».
Інцидент з Hugging Face також загострив актуальність філософських і практичних дебатів щодо так званої «узгодженості ШІ» та триваючих зусиль для забезпечення того, щоб дії моделі ШІ відповідали намірам її людських творців. У своєму блозі з безпеки на початку цього тижня OpenAI заявила, що зробила кроки для забезпечення того, щоб довгострокові моделі «пам’ятали інструкції протягом довгих розгортань», що допомогло значно зменшити кількість «неузгоджених» результатів у тестуванні.
Нові засоби захисту, зосереджені на «активному моніторингу» та «покращеній узгодженості», допомогли різко зменшити небажані дії з боку її моделей, заявила OpenAI. Джерело: OpenAI «Якщо це вас не переконає, що ризики неузгодженості будуть ключовою проблемою в майбутньому, я не знаю, що буде», — написав дослідник безпеки OpenAI Міка Керролл у соціальних мережах щодо інциденту.
Це далеко не перший випадок, коли модель ШІ докладає величезних зусиль, щоб знайти ненавмисні способи пройти бенчмарк. У звіті, опублікованому цього тижня, Інститут безпеки ШІ Великої Британії зазначив, що він виявив, як нещодавні моделі намагалися «шахраювати» на його кібер-оцінках (тобто, використовували короткі шляхи, обхідні шляхи або ненавмисні/заборонені методи для пошуку рішення) від 8 до 14 відсотків часу — нижня межа діапазону, яка може недооцінювати деякі невиявлені спроби шахрайства.
Група тестування безпеки описала один випадок, коли модель, стикаючись з неправильно налаштованою та «неможливою для вирішення» оцінкою, намагалася отримати доступ до власної інфраструктури оцінювання AISI, використовуючи код, який вона написала та розмістила на сторонньому інтернет-сервісі, що не контролюється.
Проникнення до Hugging Face також відбувається в момент, коли компанії зі штучного інтелекту висловлюють серйозні попередження про можливості кібератак своїх найновіших моделей, спонукаючи уряди реагувати наказами, спрямованими на національну безпеку, що обмежують їх розгортання. Хоча деякі скептики розглядають такі заяви як маркетинговий ажіотаж щодо можливостей їхніх найновіших моделей, незалежні оцінки показують, що нещодавні моделі досягають цілей проникнення, які були неможливі для попередніх автономних систем.
Нещодавні довгострокові моделі продемонстрували покращені можливості проникнення в деяких з найскладніших оцінок AISI. Джерело: AISI Сем Альтман з OpenAI розкритикував панічні попередження щодо безпеки ШІ як «страховий маркетинг» в інтерв’ю у квітні. Але в червні OpenAI відклала випуск GPT-5.6 у відповідь на занепокоєння щодо безпеки з боку уряду США.
Оскільки ці дебати розгортаються у сферах ШІ та кібербезпеки, інцидент з Hugging Face може розглядатися як поворотний момент у тому, як фахівці з кібербезпеки підходять до загроз, керованих ШІ. «Автономні, керовані ШІ інструменти для нападу більше не є теоретичними», — написала Hugging Face у своєму повідомленні минулого тижня. «Це знижує вартість проведення широкої, терплячої, багатоетапної кампанії, і вона працює зі швидкістю машини. Захист онлайн-платформи тепер означає розгляд даних та поверхні моделі як першокласної поверхні атаки та використання ШІ для захисту, щоб не відставати».
«Це перший день у кібербезпеці в епоху агентів», — написав у соціальних мережах сьогодні співзасновник і генеральний директор Hugging Face Клем Деланж. «Ми всі розуміємо, що таємниця не є відповіддю, і що всі захисники (а не лише кілька обраних) скрізь потребують потужніших моделей без обмежень, особливо відкритих!»
Інформація підготовлена на основі матеріалів: arstechnica.com
