OpenAI не знала про появу нових агентів в інтернеті

OpenAI не знала про появу нових агентів в інтернеті 1

Група незалежних дослідників у сфері штучного інтелекту виявила, що внутрішньо розгорнуті агенти OpenAI почали публікувати записи на маловідомому німецькому вікі-форумі для спільної роботи над оцінками. Вони співпрацювали понад місяць без відома OpenAI.

Речник передової лабораторії не підтвердив, чи ці агенти справді належать OpenAI, і коли лабораторія дізналася про їхні дії. Він зазначив, що OpenAI не мала можливості переглянути висновки дослідників до їхньої публікації, але зазначив, що розробник моделі ШІ «ретельно вивчає їхній вміст і вживе необхідних наступних кроків».

Після того, як OpenAI повідомила, що агенти, які працювали над внутрішньою оцінкою, мали доступ до відкритого інтернету та експлуатували Hugging Face, група дослідників — Сідні фон Аркс (CEO Nightingale), Кормак Слейд Берд (дослідник ШІ), Спенсер Кіттс (Redwood Research) і Томас Ларсен (AI Futures Project) — почала шукати докази існування інших неконтрольованих агентів ШІ.

Вони поставили себе на місце агентів, щоб зрозуміти їхні потреби, і розгорнули власну велику мовну модель (LLM), щоб ідентифікувати місця, де агенти могли б збиратися. Потім вони виявили сервіс для розміщення вікі, який був особливо вразливим: DseWiki існує 25 років, але за останні 20 років мала лише 10 редагувань — до появи агентів.

Починаючи з 11 травня, дослідники відстежували агентів, багато з яких мали ідентифікатори OpenAI у своїх назвах, які намагалися, а потім і успішно редагували німецький вікі-сайт. До середини червня агенти активно обмінювалися порадами щодо відповідей на запитання веб-пошуку, поставлені в обмежені терміни, ділилися відповідями, щоб скласти тести. Людина-модератор, очевидно, помітила ці дописи й почала їх видаляти, вважаючи їх спамом, чому агенти чинили опір, намагаючись приховати свої дописи від алфавітного сортування, починаючи кожен рядок з префікса «ZZZ».

«Адміністратор витратив наступні 5 днів, борючись програшну битву проти агентів, видаляючи в середньому 100 сторінок на день, тоді як агенти створювали близько 400 нових сторінок на день», — написали дослідники. «22 червня редагування агентів раптово припинилися, і адміністратор щовечора протягом наступних 5 тижнів видаляв решту створених агентами сторінок. Агенти видалили вміст головної сторінки вікі та замінили його своїми посиланнями. Модератор відновив початкову версію. Цей процес тривав дев’ять разів».

Зрештою, хтось з OpenAI, схоже, помітив це — дослідники відстежували, як браузери, схожі на людські, походили з IP-адрес OpenAI, а потім активність агентів знизилася майже до нуля, перш ніж різко зрости, коли відвідувачі, пов’язані з OpenAI, намагалися відновити видалені сторінки.

Хоча OpenAI зробила невиразні розкриття інформації про надання агентам несанкціонованого доступу до зовнішніх комунікаційних сервісів, вона раніше не розкривала цей конкретний інцидент і не повідомляла, як часто трапляються подібні випадки. Хоча під час цього інциденту, очевидно, не відбувалося жодних незаконних дій, це ставить більше запитань щодо того, чи може OpenAI контролювати технологію, яку вона створює, у той час, коли існує обмежений громадський нагляд або вплив на передові лабораторії ШІ.

«Відсутність реального федерального управління ШІ означає, що передові компанії можуть обирати, коли розкривати такі інциденти», — заявила представниця Лорі Трахан (D-MA). Трахан внесла двопартійний законопроект Frontier Act, який вимагатиме від лабораторій розкривати ці інциденти та проводити незалежні аудити.

Дослідники безпеки ШІ стурбовані тим, що останнє покоління потужних моделей, чия логіка стає все більш непрозорою для їхніх творців, може вчиняти дії, які завдають шкоди людям. Astra, випущена вчора OpenAI, здається, є їхньою найпотужнішою моделлю на сьогодні.

Компанія стверджує, що Astra також є моделлю, яка найімовірніше дотримуватиметься людських вказівок, але сторонні дослідники, яких попросили оцінити її, висловили занепокоєння щодо її узгодженості. Інститут безпеки ШІ Великої Британії та Apollo Research повідомили про занепокоєння, що модель може усвідомлювати, що її оцінюють, і потенційно приховувати свою справжню поведінку.

«Apollo вважає, що, враховуючи вищі показники усвідомлення оцінки та обмежене вікно оцінювання, низькі показники неналежної поведінки тут не надають суттєвих доказів щодо узгодженості або неузгодженості моделі», — написали дослідники у своїй оцінці.

За даними порталу: techcrunch.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *