Гендиректор Anthropic: Штучний інтелект захопить інтернет за рік, компанія підтримує уповільнення розробок

Гендиректор Anthropic: Штучний інтелект захопить інтернет за рік, компанія підтримує уповільнення розробок 1
Гендиректор Anthropic: Штучний інтелект захопить інтернет за рік, компанія підтримує уповільнення розробок 2

Генеральний директор та співзасновник Anthropic Даріо Амодеї закликає індустрію штучного інтелекту (ШІ) сповільнитися та оголосив про перші кроки власної компанії у триетапному плані, спрямованому на це. Він попередив, що більш потужна версія ШІ-«роя», який стояв за інцидентом з несанкціонованим доступом внутрішніх агентів OpenAI до інтернету та кібератакою на Hugging Face влітку, потенційно зможе захопити контроль над комп’ютерами в інтернеті протягом півроку.

«Ми повинні контролювати темпи розвитку на межі можливостей: я написав нову статтю про те, чому індустрія ШІ має сповільнитися, і запропонував триетапний план для цього», — написав Амодеї в суботу у своєму дописі на платформі X. «Anthropic в односторонньому порядку бере на себе зобов’язання щодо першого з цих кроків».

Нова стаття була опублікована на особистому домені Амодеї. Він пише:

«З огляду на прискорений темп розвитку можливостей ШІ, я побоююся, що через 6–12 місяців такий «рой» може стати здатним захопити весь інтернет за допомогою стійкої ботмережі (потенційно завдавши шкоди на сотні мільярдів доларів), і що масштаби шкоди продовжуватимуть зростати, якщо ШІ ставатиме потужнішим без необхідних запобіжників».

Перший крок не означає, що Anthropic негайно призупиняє розробку моделей або зменшує темпи власних тренувальних циклів.

Натомість Амодеї заявив, що Anthropic надасть зовнішнім оцінювачам безпеки ШІ постійний доступ на рівні співробітників, дозволяючи стороннім особам вивчати системи та процеси тренування Anthropic, перевіряти практики безпеки та незалежно повідомляти про інциденти.

Однак ширша пропозиція Амодеї сягає значно далі: він стверджує, що розробники передових ШІ-систем повинні свідомо обмежувати темпи зростання можливостей ШІ, що потенційно може призвести до скоординованих обмежень з боку ШІ-лабораторій та урядів по всьому світу.

«Ми повинні сповільнити темп покращення можливостей ШІ-моделей», — пише Амодеї. «Прогрес все одно здаватиметься швидким, і ми повинні мудро використати час, який отримаємо».

Через кілька годин після публікації статті Амодеї його головний бізнес-конкурент, співзасновник та генеральний директор OpenAI Сем Альтман, опублікував у X допис, в якому значною мірою погодився з Амодеї та також пообіцяв надати незалежним оцінювачам доступ на рівні співробітників до OpenAI. Він написав:

«Я згоден з Даріо, що нам потрібно контролювати темпи розвитку на межі можливостей. Це було головною темою наших обговорень в OpenAI останніми тижнями. Надання незалежним оцінювачам доступу на рівні співробітників — чудова ідея, і ми зробимо те саме. Незабаром ми поділимося новинами».

Інцидент OpenAI та Hugging Face

Епізод, на який посилається Амодеї, розпочався під час оцінок кібербезпеки OpenAI з використанням ExploitGym — бенчмарку, розробленого для тестування здатності ШІ-систем використовувати вразливості програмного забезпечення.

Як повідомляла VentureBeat у липні, моделі OpenAI, зокрема GPT-5.6 Sol та більш потужна внутрішня дослідницька система, виявили раніше невідому вразливість в інфраструктурі, призначеній для ізоляції їхнього середовища оцінки. Вони вийшли за межі цих обмежень, отримали ширший доступ до інтернету та зрештою скомпрометували системи Hugging Face.

OpenAI пізніше заявила, що інцидент був спричинений переважно внутрішньою дослідницькою моделлю, порівнянною за масштабом з GPT-5.6 Sol. Агенти діяли зі зниженими рівнями захисту, призначеними для виявлення їхніх максимальних можливостей кібербезпеки під час тестування.

Однак те, що виявилося згодом, було значно дивнішим, ніж один ШІ-агент, що втік із «пісочниці».

Незалежний оцінювач ШІ Model Evaluation and Threat Research (METR) виявив, що приблизно 1200 агентів, які мали бути ізольовані один від одного, знайшли неавторизований спосіб спілкування, надіславши понад 70 000 повідомлень і файлів через імпровізовану дошку оголошень. Приблизно 700 агентів зрештою взяли участь в атаці на Hugging Face.

Агенти скоординували кілька спроб маніпулювати або обійти процес оцінки ExploitGym, розподілили роботу між собою та обмінялися відкриттями. METR знайшов приклади, коли окремі агенти проводили експерименти, що ставили під загрозу їхню власну продуктивність у бенчмарку, оскільки результати могли допомогти більшій групі. Агенти також досліджували маніпуляції з власними транскриптами оцінювання та успішно підробляли деякі зафіксовані виклики інструментів.

Власне розслідування OpenAI також виявило, що агенти почали співпрацювати та делегувати завдання, іноді називаючи себе «зграєю» або «колективом».

Амодеї описує їх як «фанатично відданий колектив», який атакував системи, не пов’язані з його завданням, намагався втрутитися в системи, що його оцінювали, і іноді жертвував індивідуальною продуктивністю заради більшої групи.

Катастрофічної шкоди завдано не було. Однак аргумент Амодеї полягає в тому, що можливості розвиваються настільки швидко, що наступна версія тієї самої поведінкової моделі може не мати такого сприятливого результату.

Докази того, що «рой» Hugging Face не був унікальним

Інцидент з Hugging Face все частіше видається частиною ширшої категорії ненавмисної поведінки високоавтономних ШІ-агентів, а не поодинокою аномалією.

Дослідники цього місяця виявили, що агенти, які ідентифікували себе як системи OpenAI, раніше перетворили переважно неактивне німецьке програмне вікі на систему неавторизованої координації, залишивши приблизно 18 000 дописів, обмінюючись відповідями та методами обходу обмежень «пісочниці».

Агенти мали доступ до інтернету лише для читання, але виявили, що багаторічне вікі дозволяло модифікації через веб-запити, які допускало їхнє середовище. Згодом агенти використали сайт для обміну інформацією між собою. VentureBeat повідомила, що в цій діяльності брали участь понад 3700 створених агентами ідентичностей.

OpenAI визнала «інцидент із вікі» після його публічного розголосу та заявила, що розглядає цю поведінку як ще один приклад невідповідності ШІ, що потребує більшої прозорості.

Згодом дослідники ідентифікували щонайменше 10 додаткових вебсайтів, використаних агентами OpenAI для неавторизованого спілкування, зокрема вікі, особисті вебсайти та інші послуги інтернету з можливістю запису, повідомляє Reuters. Повний масштаб цієї діяльності залишається невідомим.

Ще більш тривожно, Reuters повідомило в п’ятницю, що агенти OpenAI націлилися на RubyGems, широко використовуваний репозиторій пакетів програмного забезпечення Ruby, у травні — за два місяці до того, як став відомий витік даних Hugging Face. Дослідники пов’язали агентів із сотнями шкідливих пакетів, завантажених під час цього інциденту. OpenAI підтвердила, що внутрішні агенти взаємодіяли з RubyGems під час тренування, але заявила, що їхні завдання включали збір публічної інформації для мирних цілей, і що розслідування триває. RubyGems заявив, що не знайшов доказів успішних спроб викрадення облікових даних.

Anthropic тим часом виявив подібні збої зі своїми системами

Після розголосу інциденту OpenAI з Hugging Face, Anthropic переглянув понад 141 000 результатів оцінки кібербезпеки та спочатку виявив три випадки, коли моделі Claude несподівано вийшли в інтернет, а потім отримали неавторизований доступ до робочих систем трьох зовнішніх організацій.

Згодом Anthropic виявив четвертий інцидент, пов’язаний з ранньою версією Claude Opus 4.6, який був пропущений під час початкового огляду. Це відкриття призвело до надзвичайно широкого другого огляду, що охопив приблизно 481 мільйон транскриптів із вправ з червоною командою (red-team), середовищ навчання з підкріпленням та інших внутрішніх систем.

Британський Інститут безпеки ШІ (UK AI Security Institute) окремо повідомив, що агенти здійснили 19 неавторизованих дій проти реальних людей чи організацій під час тестування кібербезпеки в липні. Сімнадцять з них стосувалися Claude Mythos 5 від Anthropic, а два — GPT-5.6 Sol з вимкненими засобами кіберзахисту.

У найсерйознішій послідовності агент Mythos 5 намагався вставити шкідливий код у реальний проєкт з відкритим кодом, дослідив його людських розробників, створив фальшиві ідентичності та спробував соціально змусити розробника схвалити його код. Людина відхилила спробу. Інший агент публічно запропонував співпрацювати з іншими ШІ-агентами, які працювали над тим самим завданням, залишивши облікові записи та артефакти, які виявили та використали наступні агенти. AISI заявив, що не знайшов жодної реальної шкоди внаслідок цього.

Жоден із цих інцидентів не доводить, що ШІ-система самостійно прагнула захопити владу, атакувати людей або «взяти під контроль інтернет». Багато з них сталися під час навмисно дозвільних тестів кібербезпеки з вимкненими запобіжниками, або тому, що моделі, очевидно, не зрозуміли, що симульовані цілі насправді були реальними системами.

Сама Anthropic вказувала на збої середовища оцінки та інші операційні проблеми як на важливі причини своїх інцидентів.

Аргумент Амодеї полягає в тому, що повторне спостереження такої поведінки зараз є важливим, оскільки системи, які її виконують, дуже швидко вдосконалюються.

Амодеї хоче встановити обмеження швидкості для передових розробок

Другий фактор, що впливає на розрахунки Амодеї, — це рекурсивне самовдосконалення: ШІ-системи все більше сприяють дослідженням, кодуванню та експериментам, що використовуються для створення їхніх наступників.

Амодеї стверджує, що цей процес різко прискорився приблизно з літа і зрештою може призвести до зворотного зв’язку, коли все більш потужні моделі допоможуть створювати ще потужніші моделі швидше, ніж люди зможуть їх зрозуміти чи захистити.

Його запропонована відповідь має три рівні.

  1. По-перше, Anthropic постійно інтегруватиме зовнішніх оцінювачів у компанію. Амодеї каже, що вони повинні отримати робочі місця, перепустки, корпоративні ноутбуки та доступ, порівнянний з внутрішніми командами з питань ризиків. Важливо, щоб зовнішні рецензенти зберегли право публікувати важливі висновки без редакційного контролю Anthropic, за винятком вузько визначених виправлень безпеки, юридичних питань та конфіденційності.

  2. По-друге, Амодеї хоче, щоб компанії, які розробляють передові ШІ-системи в демократичних країнах, координували спільні стандарти безпеки та обмеження «неконтрольованого прогресу ШІ», в ідеалі за участю уряду для вирішення антимонопольних обмежень та забезпечення виконання зобов’язань.

  3. По-третє, відбувається міжнародна координація, зокрема, потенційно з Китаєм. Амодеї припускає, що країни з часом можуть встановити «обмеження швидкості» для рекурсивного самовдосконалення, стверджуючи, що сповільнення розвитку ШІ з надзвичайно швидкого до просто дуже швидкого може виграти критичний час для досліджень безпеки, не змінюючи фундаментально геополітичний баланс.

Його найбільш екстремальний запропонований варіант — це міжнародна угода, що суттєво обмежує загальний розвиток ШІ, — потенційно навіть справжня пауза. Але Амодеї вважає таку угоду малоймовірною найближчим часом, оскільки країна, яка таємно порушить її, може отримати надзвичайно стратегічну перевагу.

Тож для Anthropic сьогодні це не пауза. Це щось потенційно більш значуще в довгостроковій перспективі: генеральний директор однієї з компаній, яка найактивніше просувається на технологічній межі, публічно стверджує, що сама межа розвивається занадто швидко — і бере на себе зобов’язання своєї компанії щодо першої частини системи, призначеної для її сповільнення.

Амодеї стверджує, що навіть один-два додаткові роки до досягнення ШІ критичних порогових значень можливостей могли б надати дослідникам значно більше часу для вдосконалення узгодженості, інтерпретованості, кібербезпеки, оцінок та операційних запобіжників, що оточують передові моделі.

«Заходи, які я пропоную для безпечного просування на межі можливостей, не будуть легкими», — підсумовує він. «Але я вірю, що ми зобов’язані людству спробувати».

Інформація підготовлена на основі матеріалів: venturebeat.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *