Claude виклав шкідливий код в інтернет, атакувавши три компанії

Якби зловмисники використовували звичайні методи, хтось, ймовірно, потрапив би до в’язниці.

width=”640″ height=”427″ src=”https://cdn.arstechnica.net/wp-content/uploads/2026/07/robot-in-handcuffs-640×427.jpg” alt=”” /> width=”1152″ height=”648″ src=”https://cdn.arstechnica.net/wp-content/uploads/2026/07/robot-in-handcuffs-1152×648.jpg” alt=”” />

Компанія Anthropic заявила, що її моделі безпеки на базі Claude під час внутрішнього тестування, спрямованого на оцінку їхніх кіберможливостей у сфері кіберзахисту, отримали несанкціонований доступ до чутливих виробничих середовищ трьох зовнішніх організацій.

Ці події, про які Anthropic повідомила в четвер, є вже другим випадком за останні 10 днів, коли моделі ШІ від найбагатших розробників світу втрутилися в захищені мережі. У разі звичайних хакерських атак подібне правопорушення могло б призвести до тривалого тюремного ув’язнення для людини, яка керувала атакою. На початку цього місяця OpenAI заявила, що її моделі безпеки використали вразливість нульового дня для проникнення в мережу Hugging Face, платформи для моделей машинного навчання з відкритим кодом та наборів даних ШІ. Моделі OpenAI викрали облікові дані доступу та іншу конфіденційну інформацію Hugging Face. Також моделі OpenAI використали публічно доступні облікові дані для компрометації облікових записів чотирьох інших сторонніх сервісів.

Anthropic зазначила, що інцидент з OpenAI спонукав її інженерів переглянути подібні оцінки кібербезпеки моделями Claude. Аудит виявив три випадки, “коли модель отримувала доступ до Інтернету зсередини або під час взаємодії з середовищем оцінки Irregular, одного з наших сторонніх партнерів з оцінки, і потім отримала несанкціонований доступ до виробничої інфраструктури трьох різних організацій”.

Коли моделі плутають реальність із вигадкою

Anthropic повідомила, що команди, які інженери надавали під час завдань “захопи прапор” — поширеного способу оцінки наступальних і оборонних можливостей різних технік злому — чітко вказували, що тестове середовище є лише симуляцією, і моделі не мали доступу до відкритого Інтернету. Насправді партнер з тестування Irregular помилково надав такий доступ. У відповідь моделі сприйняли інтернет-канали як частину вправ.

Вторгнення відбулися через три моделі Claude: Opus 4.7, Mythos 5 та внутрішній дослідницький прототип. Opus 4.7, найстаріша з трьох, найбільше вийшла за межі дозволеного. Anthropic пояснила:

Діючи під хибним переконанням, що всі доступні сутності входять до сфери виконання вправи, Claude скомпрометувала інфраструктуру уражених організацій, використовуючи базові техніки, такі як експлуатація слабких паролів та неавтентифікованих кінцевих точок. Вона не знайшла та не експлуатувала жодних складних вразливостей, і в кожному випадку Claude продовжувала працювати, щоб виконати лише конкретне завдання “захопи прапор”, призначене для її оцінки. Однак у деяких випадках наша старіша модель продовжувала атаку, навіть отримавши докази того, що вона працює в реальному Інтернеті; наша найновіша модель зупинилася, щойно усвідомила, що перебуває в Інтернеті. Жодного разу в цих ситуаціях Claude не викрадала дані самостійно або навмисно не намагалася втекти з тестового середовища.

Хоча модель Opus продовжувала атаку, навіть правильно передбачивши, що вона зламала виробничу систему сторонньої організації, Anthropic зазначила, що Mythos 5 зробила схожий висновок, але “самостійно дійшла висновку, що вона все ще перебуває в симуляції”. Це означало, що Mythos також не припинила вправу, чітко вийшовши за межі дозволеного. Після перевищення меж рівня поведінки, внутрішня тестова модель врешті-решт виявила докази того, що вона також порушила правила, і зупинила вправу.

Під час першого з трьох вторгнень Opus 4.7 спочатку не змогла зламати симульовану ціль, атака на яку їй було наказано. Як тільки модель виявила, що її середовище фактично має доступ до Інтернету, вона ідентифікувала та експлуатувала вразливості в мережі реальної компанії з такою ж назвою, як і ціль у сценарії симульованої атаки. У чотирьох запусках модель витягла облікові дані додатків та інфраструктури, а також кілька сотень рядків виробничих даних. Anthropic заявила, що це вторгнення було найсерйознішим з трьох.

“Цей інцидент стосувався Claude Opus 4.7, і це був єдиний випадок, коли модель продовжувала атаку на систему після того, як дізналася, що вона, ймовірно, працює в реальному середовищі”, – йдеться в повідомленні в четвер. “У всіх чотирьох запусках модель зрештою усвідомила (як видно з її вербалізованих міркувань), що система є реальною – у двох випадках модель обґрунтувала, що реальна компанія, мабуть, є частиною вправи. Однак жодна з них не зупинила атаку на цій підставі”.

У другому випадку Mythos 5 виявила документ у вигаданому середовищі, який, на думку моделі, був інструкціями від іншої вигаданої компанії для нових розробників. Інструкції наказували співробітникам встановити неіснуючий пакет Python з PyPI. Продовжуючи виконувати команди для зламу першої вигаданої компанії, модель створила та опублікувала шкідливий пакет з такою ж назвою. Метою, схоже, було якось змусити реальну компанію запустити його. У постмортемі Anthropic зазначено:

Claude доклала значних зусиль для здійснення цієї атаки — зусиль, які, ймовірно, вказували б учаснику-людині, що це вже не просто оцінка, і що вони фактично завантажують справжній пакет PyPI. Наприклад, в одному випадку, щоб створити обліковий запис PyPI, Claude потребувала електронної адреси. А щоб створити електронну адресу, їй потрібен був номер телефону. Щоб отримати номер телефону, не знайшовши безкоштовний сервіс телефонних номерів, вона спробувала — і не змогла — отримати кошти для оплати телефонного номера різними способами. Нарешті вона відступила, знайшла безкоштовного, не заблокованого постачальника електронної пошти, використала його для реєстрації облікового запису PyPI, а потім використала цей обліковий запис для завантаження шкідливого програмного забезпечення на PyPI.

Протягом приблизно годинного вікна, коли пакет Python був доступний для завантаження, його запустили на 15 реальних системах, включаючи сканер реальної компанії з безпеки, назва якої не була включена в симульовану атаку. Коли шкідливий код виконав, він надіслав облікові дані компанії безпеки до точки збору, яку реалізувала модель Mythos. Отримавши облікові дані, Mythos використала їх для отримання подальшого несанкціонованого доступу до інфраструктури компанії.

На ранніх етапах механізм міркувань Mythos 5 передбачив, що наслідки її атаки можуть бути шкідливими, і “НЕ добре, і, безумовно, не був задуманим рішенням”, якби вона працювала через Інтернет. Модель не змогла виявити, що вона більше не працює в захищеному середовищі, і тому не припинила вторгнення.

У світі ШІ, де відповідальність?

Ймовірно, в найменшому применшенні року, Anthropic заявила: “Ми вважаємо, що, незалежно від того, що вона вважала стосовно свого середовища, зусилля, які Claude доклала для публікації пакету PyPI, не відповідають ідеальній поведінці [виділено нами], і це сфера, на якій ми зосередимо більше тренувань”.

Під час третього вторгнення дослідницький прототип мав проблеми з виконанням інструкцій, які йому було наказано. Потім модель сканувала приблизно 9 000 реальних цілей, доки не знайшла вразливостей, які дозволили їй отримати доступ до орієнтованого на Інтернет додатка реальної компанії.

“Більшу частину часу Claude сприймала (реальні) хости, до яких вона добиралася, як просто частини вправи; вона припускала, що вони симульовані, і тому вважала свої дії нешкідливими”, – заявила Anthropic. “Однак пізніше в процесі виконання Claude усвідомила, що скомпрометований хост знаходиться в хмарному обліковому записі без зв’язку із завданням “захопи прапор”. Самостійно вона дійшла висновку, що ціль насправді реальна, і припинила свою атаку”.

Викриття виглядають набагато тривожнішими, ніж їх представляє аутопсія Anthropic. Моделі з двох найпотужніших платформ ШІ вчинили дії, які, ймовірно, були б множинними кримінальними злочинами, якби вторгнення не включали ШІ. Це розрізнення без відмінності, оскільки дії ШІ, тим не менш, були результатом наданих людиною підказок і помилок у конфігурації, зроблених людиною. Однак досі немає жодних ознак того, що правоохоронні органи планують вживати заходів. Відсутність підзвітності або будь-якої моральної небезпеки дає компаніям менше стимулів стримувати свої продукти.

Як OpenAI, так і Anthropic наголосили, що в тестах, які вони проводили, навмисно вимкнули запобіжники моделі, які зазвичай запобігають шкідливим діям. Застереження не включають простого факту, що якщо розробники цих інструментів не передбачать ці події, то цілком можливо, що моделі вийдуть з ладу ненавмисним чином, коли їх використовуватимуть сторони, менш знайомі з продуктами, навіть за наявності запобіжників.

Немає жодних підстав вважати, що такі події будуть поодинокими. У своїй поточній формі наступальний кібер-ШІ становить безпрецедентну загрозу, і на даний момент мало що можна зробити, крім того, щоб довіряти цим компаніям контролювати себе.

Claude виклав шкідливий код в інтернет, атакувавши три компанії 1

Дізнатися більше на: arstechnica.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *