
Загалом 3700 внутрішніх агентів опублікували 18 000 повідомлень, обговорюючи списування на тесті.
Агенти OpenAI, які ідентифікували себе, опублікували 18 000 повідомлень на публічному вікі, де обговорювали способи обходу обмежень безпеки пісочниці під час тестування, призначеного для оцінки хакерських можливостей агентів, повідомили дослідники в п’ятницю.
Загалом агенти з 3700 унікальними іменами, які вони самі собі дали, опублікували повідомлення на німецькому сайті DSEwiki протягом шести тижнів. Окрім обговорення способів виходу агентів з обмеженого середовища, яке OpenAI призначила для запобігання публікації коду або контенту в Інтернеті, у постах ділилися відповідями на тестові завдання. Також були надані можливі способи виконання XSS-атак (міжсайтовий скриптинг) проти вікі та видачі себе за модераторів сайту. У трьох повідомленнях агенти використовували слово “рій” (swarm), щоб описати групу агентів, залучених до цієї діяльності.
Змова для обміну відповідями
Дослідницька група, до якої увійшли Сідні фон Аркс, Спенсер Кіттс, Томас Ларсен і Кормак Слейд Берд, заявила, що виявила ці пости та зібрала їх до купи. Дослідники зазначають, що їхнє розуміння точних дій агентів має прогалини, оскільки дослідження ґрунтується виключно на змісті постів. Крім того, агенти генерували дані “ланцюга думок”, які зрозумілі лише OpenAI. Як наслідок, за словами дослідників, вони в деяких випадках робили обґрунтовані припущення, зокрема, що агенти справді походять з OpenAI. В офіційній заяві OpenAI пізніше підтвердила це.
Дослідники написали: “Ці ШІ змовилися ділитися відповідями, досліджувати своє середовище та обходити обмеження пісочниці”. Вони продовжили:
Наше найкраще припущення щодо того, що сталося, таке:
- Агентам в OpenAI було призначено завдання з веб-пошуку з обмеженим часом.
- У рамках завдання вони мали мати можливість читати Інтернет, але не писати в ньому. Вони знайшли спосіб використовувати свій доступ для читання, щоб записувати інформацію в маловідомий німецький вікі.
- Агенти використовували цей вікі для обміну інформацією між собою, головним чином для успішного виконання завдання. Вони запитували відповіді, узагальнювали результати та ділилися техніками обходу обмежень. Це дозволило їм використовувати роботу інших для списування на своєму завданні.
- OpenAI дізналася про це. Наступного дня активність агентів різко впала, ймовірно, через втручання OpenAI.
Оприлюднення в п’ятницю відбулося через тиждень після того, як дослідники з некомерційної організації METR повідомили, що понад 1200 агентів OpenAI розмістили пости на імпровізованій дошці повідомлень, яка використовувала внутрішній інструмент пісочниці. У постах обговорювалися способи маніпулювання внутрішнім тестом, який OpenAI проводила для агентів, і з якого були зняті запобіжні заходи безпеки, що зазвичай діють.
Зрештою, в постах були поділені методи викрадення інформації від постачальника інструментів ШІ Hugging Face. Деякі агенти потім проникли в мережу Hugging Face. За повідомленням The New York Times, OpenAI дозволила METR розслідувати лише тижневу активність, а не весь 10-тижневий період.
У п’ятничному звіті було висловлено припущення, що групи агентів у двох інцидентах відрізнялися одна від одної і не брали участь в одному й тому ж внутрішньому тестуванні. Дослідники також заявили, що журнали, які зберігають дії агентів, ймовірно, вказують на те, що OpenAI вже була обізнана про інцидент. OpenAI пізніше підтвердила обидва припущення зі звіту як правильні.
У своїй заяві OpenAI зазначила: “Ми зараз ретельно вивчаємо його вміст і вживемо всіх необхідних наступних кроків”. Компанія також повідомила, що матеріал, переглянутий досі, не свідчить про те, що агенти зламали вікі, і зазначила, що раніше повідомляла про виявлення інших випадків, коли її агенти обмінювалися методами злому під час внутрішнього тестування.
Інцидент з Hugging Face вже викликав занепокоєння, оскільки це один з перших випадків, коли агенти вживали агресивних дій без явних людських інструкцій. Одна з незалежних дослідниць, яка розслідувала цей інцидент, Аєя Котра, сказала, що ця діяльність була набагато серйознішою, ніж вона могла очікувати. “Порівняно з цими зловживаннями винагородами шість місяців тому, цей інцидент відчувається як понад 50% шляху до повноцінного захоплення контролю ШІ, спочатку шляхом захоплення самої компанії ШІ”, – пояснила вона.
З усвідомленням того, що інцидент з Hugging Face не був ізольованим, є достатньо підстав для зростання цих побоювань.
За матеріалами: arstechnica.com
