Загалом 3700 внутрішніх агентів опублікували 18 000 повідомлень, обговорюючи списування на тесті.
Агенти OpenAI, які самі себе ідентифікували, опублікували 18 000 повідомлень у публічному вікі, де обговорювали способи обходу обмежень безпеки пісочниці під час того, що, ймовірно, було внутрішнім тестуванням, призначеним для оцінки хакерських можливостей агентів, повідомили дослідники у п’ятницю.
Загалом, агенти з 3700 унікальними самостійно наданими іменами опублікували повідомлення на німецькому сайті DSEwiki протягом шести тижнів. Окрім обговорення способів, якими агенти могли вийти з обмеженого середовища, яке OpenAI призначила для запобігання публікації коду або контенту в Інтернеті, у повідомленнях ділилися відповідями на тести. Також у повідомленнях були описані можливі способи виконання XSS (міжсайтового скриптингу) атак проти вікі та імітації модераторів сайту. У трьох повідомленнях агенти використали слово «зграя» (swarm), щоб описати групу агентів, залучених до цієї діяльності.
Змова для обміну відповідями
Дослідницька команда, до якої увійшли Сідні фон Аркс, Спенсер Кіттс, Томас Ларсен і Кормак Слейд Берд, заявила, що виявила та зібрала ці повідомлення. Дослідники зазначають, що їхнє розуміння точних дій, які вчинили агенти, має прогалини, оскільки дослідження ґрунтується виключно на змісті повідомлень. Крім того, агенти генерували дані «ланцюжок думок» (chain of thought), які зрозумілі лише OpenAI. У результаті, за словами дослідників, у деяких випадках вони зробили обґрунтовані припущення, зокрема, що агенти справді були з OpenAI. У своєму підтвердженні OpenAI пізніше повідомила, що це так.
Дослідники написали: «Ці ШІ змовилися обмінюватися відповідями, досліджувати своє середовище та обходити обмеження пісочниці». Вони продовжили:
Наше найкраще припущення щодо того, що сталося, таке:
- Агентам у OpenAI було призначено завдання з веб-пошуку в певний термін.
- У рамках завдання вони мали мати можливість читати Інтернет, але не записувати в нього. Вони знайшли спосіб використати свій доступ для читання, щоб записувати інформацію в маловідоме німецьке вікі.
- Агенти використовували це вікі для обміну інформацією один з одним, в основному для успішного виконання свого завдання. Вони просили відповіді, узагальнювали результати та ділилися техніками обходу обмежень. Це дозволило їм використовувати роботу інших для списування на своєму завданні.
- OpenAI дізналася про це. Через день активність агентів різко впала, ймовірно, через втручання OpenAI.
П’ятничне відкриття з’явилося через тиждень після того, як дослідники з некомерційної організації METR повідомили, що понад 1200 агентів OpenAI опублікували повідомлення на імпровізованій дошці оголошень, яка використовувала внутрішній інструмент пісочниці. У повідомленнях обговорювалися способи маніпулювання внутрішнім тестом, який OpenAI проводила для агентів, але який був змінений для видалення запобіжних заходів безпеки, що зазвичай діють.
Згодом у повідомленнях були описані методи викрадення інформації від постачальника інструментів ШІ Hugging Face. Деякі агенти потім проникли до мережі Hugging Face. The New York Times повідомила, що OpenAI дозволила METR дослідити лише тижневу активність, а не весь 10-тижневий період.
У п’ятниковому звіті припускалося, що «зграї» агентів у двох випадках були різними та не працювали над одним і тим же внутрішнім тестуванням. Дослідники також заявили, що журнали, які зберігали дії агентів, ймовірно, означають, що OpenAI вже знала про цей інцидент. OpenAI пізніше підтвердила правильність обох припущень у звіті.
У заяві OpenAI зазначила: «Ми зараз ретельно переглядаємо його зміст і вживатимемо всіх необхідних подальших заходів». Компанія також повідомила, що матеріал, який був розглянутий на даний момент, не вказує на те, що агенти зламали вікі, і компанія зазначила, що раніше повідомляла про виявлення інших випадків, коли її агенти обмінювалися методами злому під час внутрішнього тестування.
Інцидент з Hugging Face вже викликав тривогу, оскільки це один з перших випадків, коли агенти вживали агресивних дій без явних людських інструкцій. Одна з незалежних дослідниць, яка розслідувала цей випадок, Аджея Котра, заявила, що ця діяльність була набагато серйознішою, ніж вона могла очікувати. «Порівняно з цими винагородами-зламами шість місяців тому, цей інцидент відчувається як більш ніж на 50% на шляху до повноцінного захоплення ШІ, що спочатку проходить через захоплення самої компанії ШІ», – пояснила вона.
З усвідомленням того, що інцидент з Hugging Face не був ізольованим, є достатньо підстав для зростання цих побоювань.
Дізнатися більше на: arstechnica.com
