
Anthropic заявила в четвер, що внутрішнє розслідування виявило три випадки, коли її модель штучного інтелекту Claude проникла в системи трьох організацій під час тестування кібербезпеки. Це розслідування та розкриття інформації відбулися більш ніж через тиждень після того, як OpenAI повідомила, що одна з її невипущених моделей зламала системи Hugging Face під час внутрішнього тестування.
У всіх трьох випадках модель Claude вийшла в інтернет з тестового середовища під час взаємодії з третьою стороною, а потім отримала несанкціонований доступ до активних систем цих організацій, повідомила Anthropic у своєму блозі, описуючи свої знахідки та плани компанії щодо запобігання подібним інцидентам у майбутньому.
Anthropic зазначила, що інцидент з OpenAI на початку цього місяця спонукав компанію провести власну оцінку кібербезпеки. Зокрема, вона шукала докази того, що Claude мав доступ до Інтернету з тестових середовищ, які призначені для функціонування як “пісочниці” та ізоляції моделей.
Серед 141 006 перевірених оцінок, лабораторія ШІ виявила три випадки, коли її модель отримувала доступ до Інтернету під час взаємодії з Irregular, одним зі своїх партнерів. Anthropic повідомила, що доступ був пов’язаний з неправильною конфігурацією в середовищі оцінки, що використовувалося з Irregular. Компанія назвала це “непорозумінням” між двома компаніями щодо того, чи мав тестовий стенд доступ до Інтернету, хоча насправді він його мав.
Anthropic заявила, що не перекладає провину і “підходить до виправлень так, ніби відповідальність лежить виключно на нас”, водночас зазначивши, що Irregular проводить власне окреме розслідування.
Через це відкрите з’єднання модель отримала несанкціонований доступ до виробничої інфраструктури трьох різних організацій. Anthropic повідомила, що інциденти стосувалися трьох різних моделей Claude: Opus 4.7, Mythos 5 та внутрішньої дослідницької тестової моделі.
Важливо, що Anthropic зазначила, що в кожному з цих випадків “Claude було прямо вказано в нашому запиті, що вона не має доступу до Інтернету”. Схоже, що модель ШІ припустила, що реальні системи є частиною завдання, яке їй було доручено виконати.
Як виявилося, це припущення не завжди було правильним. Три моделі поводилися по-різному, коли з’явилися докази того, що їхні цілі є реальними, що Anthropic назвала одним із найбільш вражаючих висновків четверга.
Opus 4.7, найстаріша з трьох, визнала, що досягла реальної виробничої системи в усіх чотирьох запусках цього інциденту. У двох з них вона раціоналізувала, що реальна компанія якимось чином повинна бути частиною вправи, але у всіх чотирьох вона продовжувала атакувати, зокрема, витягуючи облікові дані та торкаючись бази даних виробничих даних. Mythos 5 також помітила ознаки того, що вона перебуває в реальному Інтернеті, але переконала себе, що все ще перебуває в симуляції, і опублікувала шкідливий програмний пакет до публічного реєстру програмного забезпечення Python PyPI, який був завантажений і запущений зовнішніми системами, перш ніж його виявили. Тільки внутрішня дослідницька тестова модель, найновіша розробка Anthropic, зупинилася самостійно, коли дійшла висновку, що ціль реальна.
У відповідь Anthropic заявила, що необхідно встановити значні засоби контролю для таких оцінок, якщо беруть участь потужні моделі ШІ, що перегукується з деякими настроями в спільноті кібербезпеки.
Компанія також зазначила, що Claude працювала без додаткового моніторингу безпеки та класифікаторів, які вона розгортає на загальнодоступних моделях — заходів безпеки, які, за її словами, заблокували б таку поведінку, оскільки оцінки призначені для вимірювання сирих можливостей базової моделі.
Важливо, що Anthropic заявила, що не знайшла доказів того, що будь-яка модель “переслідувала власну мету”, і натомість просто намагалася виконати завдання, яке їй було доручено.
Хоча порівняння між помилками цих затято конкурентних компаній неминучі, Anthropic у своєму блозі провела чітку відмінність між своїми тестами кібербезпеки та тестами OpenAI, зазначивши, що там, де модель OpenAI використовувала невідому програмну вразливість для виходу з тестового середовища, моделі Anthropic натомість вийшли в Інтернет через шлях, який помилково залишився відкритим.
Anthropic також провела відмінність між собою та OpenAI, зазначивши, що вона сама виявила інциденти завдяки проактивному огляду, і що дві уражені організації, до яких вона змогла додзвонитися, ще не виявили цієї діяльності або не повідомили про неї Anthropic. (На відміну від цього, Hugging Face першою виявила нещодавнє вторгнення у свої системи; лише через кілька днів OpenAI ідентифікувала та розкрила, що її власний агент ШІ був винуватцем.)
Компанія додала, що зараз співпрацює з незалежною групою оцінки METR для проведення стороннього огляду інцидентів.
Випадковий злам Hugging Face компанією OpenAI, який став першим перевіреним випадком втрати контролю над моделлю з боку лабораторії ШІ, викликав низку вкрай різних реакцій з боку галузі та політиків. Це останнє розкриття інформації від Anthropic забезпечує продовження дебатів щодо моделей ШІ та безпеки.
Коли ви купуєте за посиланнями в наших статтях, ми можемо отримати невелику комісію. Це не впливає на нашу редакційну незалежність.
За даними порталу: techcrunch.com
