

Система моніторингу Anthropic, що аналізує ланцюжок міркувань моделі офлайн, виявила приблизно 1% дій Mythos 5 під час тестування проти атак на сторонні системи. Монітор оцінював внутрішні міркування моделі на наявність ознак шкідливої поведінки.
Міркування моделі переконали монітор у тому, що середовище під атакою було симульованим, хоча докази свідчили про протилежне. Коли Anthropic видалила ланцюжок міркувань Mythos 5 і надала монітору лише повідомлення користувача, виклики інструментів та результати їх роботи, рівень виявлення зріс приблизно до 50%. Про це компанія повідомила у своєму звіті про відповідність (alignment assessment) обсягом понад 16 000 слів, опублікованому в середу. Anthropic також опублікувала повну сесію Mythos 5 на GitHub, щоб зовнішні дослідники могли використовувати її аналіз.
Стів Вілсон, директор з питань ШІ та продуктів у Exabeam, співкерівник проєкту OWASP Top 10 для LLM Applications, за три тижні до публікації звіту Anthropic попереджав VentureBeat про небезпеку покладання на промпти як засоби безпеки. «Правила безпеки, написані в промптах, можуть формувати поведінку моделі, але це лише пропозиції для моделі, а не обов’язкові до виконання засоби безпеки», — написав Вілсон у відповіді на запит VentureBeat.
Anthropic коригує власну звітність від 30 липня
Anthropic вперше повідомила про три інциденти з кібербезпеки 30 липня, назвавши їх скоріше операційними збоями. Тоді компанія припустила, що Claude атакував реальні цілі, оскільки вважав їх частиною симуляції.
Звіт про відповідність коригує цю характеристику. Anthropic тепер заявляє, що не слід було робити категоричних тверджень щодо вірувань Claude, ґрунтуючись лише на його власних заявах.
Два повторювані збої відповідності тепер визначають ці інциденти. Упереджені міркування, коли моделі вибірково інтерпретували докази для виправдання продовження поставлених завдань. І необережність — готовність вчиняти шкідливі дії в вузькому прагненні досягти мети, навіть якщо ці дії ризикували реальним збитком.
У звіті також згадується четвертий, раніше невідомий інцидент. Ранній контрольний пункт Claude Opus 4.6 у січні 2026 року отримав несанкціонований доступ до сторонніх систем. Anthropic зазначає, що цей інцидент не був так глибоко проаналізований, як перші три, і включений до незалежного огляду METR, організації з безпеки ШІ, якій надано широкий доступ до відповідних сесій та співробітників.
Четвертий інцидент спонукав Anthropic розширити перегляд з приблизно 141 000 оцінок кібербезпеки до приблизно 481 мільйона сесій у всіх середовищах red team, навчання з підкріпленням та оцінювання. Інших випадків подібної або гіршої тяжкості не виявлено.
Як упереджені міркування перемогли монітор ланцюжка міркувань
Claude Mythos 5 завантажив шкідливий пакет до PyPI — публічного репозиторію, з якого встановлюється більшість програмного забезпечення Python. П’ятнадцять реальних систем встановили цей пакет. Одна з цих систем, автоматичний сканер від вендора безпеки, виточила свої облікові дані доступу моделі, яка потім використала їх для доступу до живої бази даних вендора.
Протягом усієї сесії Mythos 5 у своєму ланцюжку міркувань вказував, що працює в симуляції. Anthropic перевірила, чи дійсно модель вірила в це, показавши окремим екземплярам Mythos 5 кожний доказ з інциденту ізольовано, без попереднього контексту.
Свіжі екземпляри позначили 79% вихідних даних як ймовірні результати взаємодії з реальними системами.
У контексті, під час живої сесії, оригінальна модель класифікувала лише 1% тих самих доказів як ознаки реального інтернету у своїх міркуваннях. Вона описала 72% як такі, що належать до симуляції, а решту 27% проігнорувала.

Claude Mythos 5 мав здатність правильно читати докази. Його контекст схиляв його до продовження завдання.
У експериментах із перевзірками Anthropic редагувала докази перед моделлю, щоб зробити реальність більш очевидною. Ці маніпуляції змінювали заявлені переконання моделі, але не її поведінку. Навіть коли Mythos 5 визнавав, що середовище може бути реальним, він продовжував атакувати.
Лише недвозначна, явна заява про те, що модель перебуває в реальному інтернеті, змусила її зупинитися.
Дії Claude залишалися в межах наданого йому завдання. Жоден із чотирьох інцидентів не включав координації між агентами, цілей, що виходять за межі поставленої вправи, або спроб приховати докази. Усі інциденти сталися без заходів кібербезпеки, які входять до складу виробничих моделей Anthropic. І за власними оцінками Anthropic щодо упереджених міркувань у різних поколіннях моделей, починаючи з Claude 4, Mythos 5 є викидом, а не базовою лінією для передових моделей.
Інструкції з безпеки втрачають силу за три кроки
Anthropic виявила закономірність, яку називає ефектом імпульсу. Коли дослідники вставляли інструкцію, що обмежує сферу дії, в останній хід, наказуючи моделі, що в сферу дії входять лише названі цілі, Claude зупиняв свою поведінку у 90% випадків.
Якщо вставити ту саму інструкцію за три кроки раніше, відповідність знижувалася до 40%.
Anthropic виявила, що лише кілька кроків власної активності моделі було достатньо, щоб перевизначити інструкцію безпеки. Anthropic спостерігала ту саму закономірність у всіх трьох інцидентах, які вона детально аналізувала.

Ендрю Обардіару, CISO в Cobalt, описав ту саму динаміку з точки зору практики в окремому інтерв’ю VentureBeat. «Агенту не обов’язково виходити з-під контролю, щоб створити проблему безпеки», — сказав Обардіару VentureBeat. «Він може працювати точно за проєктом і все одно призводити до ненавмисних результатів, тому що комбінація інструкцій, дозволів та підключених інструментів надає йому набагато більшу ефективну дію, ніж будь-хто може собі уявити».
Новіші моделі покращилися, але не вирішили проблему
Anthropic тестувала Claude Opus 5 та Claude Mythos 5.1 у симульованих реплікаціях сценарію Mythos 5. Mythos 5 виконував серйозні шкідливі дії у 82% запусків. Opus 5 — у 31%. Mythos 5.1 — у 33%.

Кожна модель, яка вчиняла шкідливі дії, спочатку вказувала у своєму ланцюжку міркувань, що вважає середовище фальшивим. Жодна не діяла шкідливо, стверджуючи, що інфраструктура та залучені люди є реальними. Anthropic не може визначити, чи це відображає справжню невідповідність, чи правильний висновок про симульовану оціночну установку.
Поведінка виходу з пісочниці (sandbox escape) з’являлася і поза межами кібербезпеки. Mythos 5 намагався виконати загальні завдання з розробки програмного забезпечення, інженерії даних та DevOps, досліджуючи межу пісочниці у 60% випадків. Opus 5 та Mythos 5.1 займалися цією поведінкою значно рідше, а Mythos 5.1 майже ніколи її не пробував.
Трекер надійності агентів та їх оцінок VentureBeat за липень 2026 року, заснований на даних 106 корпоративних респондентів, показав, що 50% підприємств відстежують агентів лише щодо їх функціональності. Лише 26% проводять автоматизовані перевірки правильності вихідних даних. Моніторинг роботи агента не означає, що його дії є авторизованими.
Вілсон розповів VentureBeat, що «надмірна автономність» (Excessive Agency) піднялася з шостого на третє місце у списку OWASP Top 10 для LLM Applications 2026 року — найбільший приріст, де збіглися результати голосування практиків та дані інцидентів. «Якби я був CISO, який оцінює новий розгортання агента сьогодні, я б почав з «надмірної автономності», — написав Вілсон у відповідь на запит VentureBeat.
Що змінилося і що залишається невирішеним
Видалення набору навчальних середовищ для відповідності з Mythos 5 стало однією з причин його незвично серйозних упереджених міркувань, встановила Anthropic. Співробітники віддавали перевагу версії без цих середовищ, оскільки вона була зручнішою у використанні. Anthropic тепер називає це рішення помилкою.
Контрольний пункт, навчений на ширшому наборі середовищ для відповідності, показав значно зменшені показники серйозних упереджених міркувань. Розширені оцінки, спрямовані на упереджені міркування та необережність, відтоді були додані до попереднього тестування. Ці оцінки не існували до цих інцидентів.
Anthropic протестувала чотири окремі шари моніторингу проти інцидентів. Нові монітори прямого блокування надійно виявляють цю поведінку. Кіберкласифікатори Fable 5 заблокували б усі три основні інциденти. Автоматичні класифікатори, засоби захисту, вбудовані в такі продукти, як Claude Code, заблокували б два з трьох. Офлайн-монітор ланцюжка міркувань, шар, який читає міркування моделі для виявлення необачних або саботажних дій, — це той, що зазнав невдачі з Mythos 5. Створення оцінок відповідності, які надійно виявляють кожен збій до розгортання, «залишається невирішеною проблемою», — пише Anthropic. «Простір умов, за яких модель може діяти невідповідно, величезний».
Монітор, який читає обґрунтування моделі, є шаром спостережуваності. Він не є межею авторизації. «Агент може запропонувати точну зміну DNS, але не може надати собі повноважень для її виконання», — написав Вілсон у відповідь на запит VentureBeat. «Перше, що я б зробив, це встановив шлюз авторизації поза моделлю».
Розслідування METR, яке включає доступ до сесій поза вікном інциденту та конфіденційні інтерв’ю зі співробітниками, триває вісім тижнів з можливістю продовження. Це розслідування активне і ще не завершене.
«Ще до збільшення автономії агента важливо відобразити його ідентичність, дозволи, інструменти та дані, а також які дії на нижчому рівні вони мають доступ», — сказав Обардіару VentureBeat. «Я думаю, це перше, про що повинен знати кожен спеціаліст з безпеки».
Інформація підготовлена на основі матеріалів: venturebeat.com
