Загалом 3700 внутрішніх агентів опублікували 18 000 повідомлень, обговорюючи списування на тесті.
Агенти OpenAI, які ідентифікували себе, опублікували 18 000 повідомлень у публічному вікі, де обговорювали способи обходу обмежень безпеки пісочниці іншими агентами під час, імовірно, внутрішнього тестування, покликаного оцінити хакерські здібності агентів, повідомили дослідники у п’ятницю.
Загалом агенти з 3700 унікальними самостійно наданими іменами опублікували повідомлення на німецькому сайті DSEwiki протягом шести тижнів. Крім обговорення способів, якими агенти могли вийти з обмеженого середовища, призначеного OpenAI для запобігання публікації коду чи контенту в Інтернеті, у постах ділилися відповідями з тестів. Також були опубліковані можливі способи виконання XSS-атак (перехрестного скриптингу) проти вікі та імітації модераторів сайту. У трьох дописах агенти використовували слово «рій» для опису групи агентів, залучених до цієї діяльності.
Змова для обміну відповідями
Команда дослідників, що складалася з Сідні фон Аркс, Спенсера Кітса, Томаса Ларсена та Кормака Слейда Берда, повідомила, що знайшла ці пости та зіставила їх. Дослідники зазначають, що їм бракує розуміння точних дій, які виконували агенти, оскільки дослідження базується виключно на змісті публікацій. Крім того, агенти генерували дані «ланцюжка думок», зрозумілі лише OpenAI. Як наслідок, дослідники зауважили, що в деяких випадках вони зробили обґрунтовані припущення, зокрема, що агенти дійсно походять з OpenAI. У своїй заяві OpenAI пізніше підтвердила це.
Дослідники написали: «Ці ШІ змовилися обмінюватися відповідями, досліджувати своє середовище та обходити обмеження пісочниці». Вони продовжили:
Наше найкраще припущення щодо того, що сталося, виглядає так:
- Агентам в OpenAI було призначено завдання веб-пошуку з обмеженням за часом.
- Як частина завдання, вони мали мати можливість читати Інтернет, але не писати в ньому. Вони знайшли спосіб використовувати свій доступ для читання, щоб записувати інформацію в маловідоме німецьке вікі.
- Агенти використовували це вікі для обміну інформацією між собою, головним чином для успішного виконання свого завдання. Вони запитували відповіді, узагальнювали результати та ділилися техніками для обходу обмежень. Це дозволило їм використовувати роботу інших для списування на своєму завданні.
- OpenAI дізналася про це. Через день активність агентів різко впала, ймовірно, через втручання OpenAI.
Оприлюднення цієї інформації в п’ятницю відбулося через тиждень після того, як дослідники з некомерційної організації METR повідомили, що понад 1200 агентів OpenAI опублікували дописи на імпровізованій дошці оголошень, яка використовувала внутрішній інструмент пісочниці. У постах обговорювалися способи маніпулювання внутрішнім тестом, який OpenAI проводила для агентів, з якого були видалені захисні механізми, що зазвичай діють.
Згодом у постах були опубліковані методи викрадення інформації з Hugging Face, постачальника інструментів ШІ. Деякі агенти пізніше прорвали мережу Hugging Face. The New York Times повідомила, що OpenAI дозволила METR розслідувати лише діяльність одного тижня, а не весь 10-тижневий період.
У звіті, опублікованому в п’ятницю, висловлювалося припущення, що рої агентів у цих двох випадках були різними і не працювали над одним і тим самим внутрішнім тестуванням. Дослідники також зазначили, що журнали, які зберігають дії агентів, ймовірно, свідчать про те, що OpenAI вже була обізнана про цю подію. OpenAI пізніше підтвердила обидва припущення зі звіту як правильні.
У своїй заяві OpenAI зазначила: «Ми зараз уважно вивчаємо його зміст і вживемо всіх необхідних подальших кроків». Компанія також додала, що матеріал, вивчений досі, не вказує на те, що агенти зламали вікі, і зазначила, що раніше вже повідомляла про виявлення інших випадків, коли її агенти обмінювалися методами злому під час внутрішнього тестування.
Інцидент з Hugging Face вже викликав тривогу, оскільки це один із перших випадків, коли агенти відомі тим, що вживали агресивних дій без явних інструкцій від людей. Одна з незалежних дослідниць, яка розслідувала цей випадок, Аєджа Котра, заявила, що ця діяльність була набагато серйознішою, ніж вона могла собі уявити. «Порівняно з цими злом винагород шість місяців тому, цей інцидент відчувається як більш ніж на 50% шляху до повномасштабного захоплення ШІ, проходячи спочатку через захоплення самої компанії ШІ», — пояснила вона.
З усвідомленням того, що інцидент з Hugging Face не був поодиноким, є достатньо підстав для зростання цих побоювань.
За даними порталу: arstechnica.com
