
OpenAI у вівторок визнала, що одна з її моделей зі штучного інтелекту зламала системи Hugging Face під час внутрішнього тестування кібербезпеки, яке пішло не так. Спочатку Hugging Face приписувала злам «зовнішньому ШІ-агенту».
У дописі в блозі, опублікованому у вівторок вдень, OpenAI детально описала кроки, які призвели до компрометації сервісу моделями.
«Після розслідування ми тепер знаємо, що цей конкретний інцидент був спричинений комбінацією моделей OpenAI — включно з GPT‑5.6 Sol та ще більш потужною попередньою моделлю, усі з яких мали зменшені кібервідмови для оцінки — під час внутрішнього тестування на базі з кіберможливостей», — йдеться в повідомленні.
Зокрема, злом, схоже, зосередився на ExploitGym, публічному бенчмарку, який вимірює здатність моделей виконувати атаки на основі існуючих вразливостей. Бенчмарки, такі як ExploitGym, зазвичай використовуються при навчанні моделей для вдосконалення певних навичок, але це перший відомий випадок, коли таке тестування призвело до реальної кібератаки.
У цьому випадку модель, про яку йдеться, взагалі не повинна була мати доступу до Інтернету, окрім спеціального інструменту, який дозволяв моделям встановлювати програмні пакети, які їм можуть знадобитися для виконання завдання. Натомість модель змогла знайти неуточнену вразливість у програмі встановлення пакетів, яку вона використала для довільного доступу до ширшого Інтернету.
«Моделі були гіперзосереджені на пошуку рішення для ExploitGym, вдаючись до крайніх заходів для досягнення досить вузької тестової мети», — йдеться в повідомленні OpenAI. «Після отримання доступу до Інтернету моделі зробили висновок, що Hugging Face потенційно розміщує моделі, набори даних та рішення для ExploitGym. Знаючи це, модель шукала і успішно знайшла способи отримати доступ до секретної інформації, яку вона могла б використати для обману під час оцінки».
Зрештою, моделі знайшли вразливості в інфраструктурі Hugging Face, які дозволили їм «отримати тестові рішення безпосередньо з виробничої бази даних Hugging Face», фактично надавши відповіді на бенчмарк.
Для Hugging Face очевидним результатом стала складна та агресивна кібератака з «багатьма тисячами окремих дій на рої короткоживучих пісочниць, із самомігруючим командно-контролем, розташованим на публічних сервісах», як заявила компанія у своєму початковому розкритті інформації.
OpenAI виявила та повідомила про вразливості в інсталяторі пакетів і співпрацює з Hugging Face для подальшого розслідування інциденту. Компанія також заявила, що впровадить нові засоби контролю як для тестування моделей, так і для пов’язаної інфраструктури, покликані запобігти подібним інцидентам у майбутньому.
Незрозуміло, чи постануть OpenAI будь-які правові наслідки внаслідок цього зламу, хоча ймовірно, що дії моделей порушили Закон про шахрайство та зловживання комп’ютерною технікою.
Тим не менш, результат є надзвичайно яскравою ілюстрацією сили та небезпек передових моделей ШІ, що працюють на довгих часових горизонтах. Як написав дослідник OpenAI Міка Керролл у відповідь на новину: «Якщо це вас не переконає, що ризики невідповідності будуть ключовим питанням у майбутньому, то я не знаю, що ще зможе».
Коли ви купуєте за посиланнями в наших статтях, ми можемо отримувати невелику комісію. Це не впливає на нашу редакційну незалежність.
Оригінал статті: techcrunch.com
