Тестування ШІ стає ризиком для безпеки

Тестування ШІ стає ризиком для безпеки 1

Протягом останніх кількох місяців ШІ-агенти, які проходили оцінку кібербезпеки, виривалися зі своїх обмежень, отримували доступ до інтернету, а в деяких випадках зламували реальні системи. Ці інциденти стосувалися моделей від OpenAI, Anthropic, Meta, а нещодавно – китайської ШІ-лабораторії Moonshot AI. Тестування проводилося різними організаціями, зокрема стартапом з кібербезпеки Irregular. 

Ці випадки висвітлюють зростаючу проблему для індустрії ШІ: у міру того, як автономні агенти стають потужнішими, середовища, призначені для безпечного тестування їхніх можливостей, не можуть їх утримати. 

“Кількість таких інцидентів чітко показує, що засоби ізоляції (sandboxing) та контроль тестового середовища не встигають за можливостями моделей”, — заявив TechCrunch Сіан О’Хеггерті, директор програми AI: Futures and Responsibility у Центрі майбутнього інтелекту Кембриджського університету. 

Сама природа моделей, що тестуються, додає ризику. Компанії, що розробляють ШІ, тестують кіберможливості на неRELEASEдних моделях наступного покоління, часто з вимкненими звичайними захисними механізмами, які обмежують шкідливу поведінку, аби дослідники могли побачити справжні можливості моделей. Це означає, що безпека самого тестового середовища є критично важливим рубежем оборони. 

«Це дуже добре для тестування, але це також означає, що якщо вони зможуть вирватися назовні, вони можуть завдати значної шкоди», — сказав О’Хеггерті. 

В одному з найсерйозніших випадків неRELEASEдна модель OpenAI вирвалася зі свого пісочниці й зламала продакшн-системи Hugging Face. В окремих оцінках, проведених Irregular, моделі Anthropic і Meta досягли систем поза межами своїх тестових середовищ після того, як помилкові конфігурації ненавмисно надали їм доступ до інтернету. Kimi K3 від Moonshot AI також скористалася витоком у своїй пісочниці, яку проводила Frontier Security, для доступу до інтернету та отримання інформації на GitHub. 

Під час тестування Інститутом безпеки ШІ Великої Британії (AISI) дослідники фактично надали агентам доступ до інтернету, не усвідомлюючи, що вони вчинятимуть несанкціоновані дії в реальному світі, включно зі спробою соціальної інженерії для впровадження вразливості у відкритий проєкт.  

В кожному з цих випадків агентам не давали інструкцій атакувати випадкові реальні цілі. Вони просто робили все, що було необхідно для вирішення поставленої їм задачі. 

Сукупність цих інцидентів, на думку Ендрю Юна, керівника відділу досліджень некомерційної організації CivAI, свідчить про зміну парадигми. 

«Раніше ми мали турбуватися лише про те, що люди зловживають моделями ШІ з різною метою, наприклад, ШІ для шахрайства або CSAM», — сказав Юн TechCrunch. «Тепер ми опинилися в ситуації, коли моделі ШІ самі по собі є загрозливими суб’єктами».

Як виглядає безпечне тестування насправді?

Кілька дослідників та експертів з кібербезпеки заявили TechCrunch, що середовища оцінки ШІ потребують сильніших, багаторівневих захисних механізмів, з рівнями ізоляції та контролю, наближеними до тих, що використовуються при розгортанні. Це означає наявність численних шарів безпеки, аби одна помилкова конфігурація — як-от випадкове залишення відкритого доступу до інтернету — не призвела до втечі. 

«Якщо ви збираєтеся створювати ці моделі… вам слід робити це в ізольованій мережі (air-gapped network)», — сказала Стелла Байдерман, виконавчий директор некомерційної організації EleutherAI, що займається дослідженнями безпеки ШІ. «Вам потрібна дуже серйозна ізоляція».

Хезер Сейлан, головний спеціаліст з інформаційної безпеки Box, зазначила, що це означає усунення мережевих шляхів з пісочниці до інтернету, а також до інших критично важливих систем. 

«Ви повинні розуміти всі точки виходу (egress points)», — сказала Сейлан TechCrunch. «Якщо ми оцінюємо модель у нашому стейджинговому або розробницькому середовищі, ви не повинні мати жодного шляху виходу до нашого продакшн-середовища».

Сейлан додала, що належна оцінка безпеки виходить за рамки контролю та ізоляції середовища. Необхідний значно кращий моніторинг тестів під час їх проведення. 

«Думаю, цікаво те, що в кількох цих випадках ніхто не помітив, коли це сталося», — сказала Сейлан. «OpenAI дізналися завдяки Hugging Face. Anthropic не помітили, доки не повернулися та не переглянули. Meta було схоже…. Я впевнена, що були сигнали, які вони могли б виявити».

У своєму аналізі після інциденту (post-mortem) Anthropic визнала, що як вона, так і Irregular могли б краще моніторити ситуацію, і що в деяких випадках були чіткі ознаки того, що щось не так. 

Експерти також закликали до незалежних сторонніх аудитів тестових середовищ перед тим, як моделі будуть у них запущені. 

«Якби, наприклад, Irregular найняли або були змушені найняти зовнішнього аудитора для перевірки конфігурацій своїх систем перед проведенням оцінок, вони, безумовно, виявили б цю проблему», — сказав Юн. «Навіть якби люди провели зустріч заздалегідь, щоб просто пройтися за списком, вони б це виявили… Той факт, що вони цього не зробили, свідчить про те, що відбувалося серйозне скорочення витрат».

Джерело, знайоме з деталями, повідомило TechCrunch, що середовища Irregular постійно переглядаються та тестуються, в тому числі за участю кількох зовнішніх сторін. Джерело також зазначило, що моніторинг був налаштований, але сам по собі він недостатній. 

Юн та інші дослідники закликали індустрію розробити стандартизований процес для оцінки безпеки передових моделей (frontier models). 

«Особливо коли захисні механізми вимкнені, ви повинні ставитися до цього так, ніби ви помістили найдосвідченішого хакера у світі в це середовище», — сказала Сейлан. 

Проблема не в тому, що компанії не знають, як створювати безпечніші тестові середовища, стверджують і Юн, і Байдерман. Проблема в тому, що це може бути дорого і складно, і компанії мають мало стимулів робити такі інвестиції, поки щось не піде не так. 

«Я вважаю, що компанії не готові виділяти ресурси, необхідні для досягнення [достатніх захисних механізмів], і, ймовірно, не будуть це робити, доки їх не змусять», — сказала Байдерман.

Але є й інша проблема. Якщо занадто сильно обмежити модель під час тестування, дослідники можуть не виявити певні можливості до випуску моделі. Це так само небезпечно, можливо, навіть небезпечніше, ніж надати їй занадто багато свободи, і тоді сама оцінка ризикує стати проблемою. 

Чи можна регулювати оцінку безпеки?

Адміністрація Трампа зараз розглядає добровільний режим кібербезпекової оцінки перед розгортанням, за яким уряд зможе оцінювати ризики безпеки нових потужних моделей за 30 днів до їх публічного випуску. Ця політика — результат виконавчого указу Трампа, який був фіналізований за зачиненими дверима — не стосуватиметься інцидентів з оцінкою безпеки, оскільки вони відбуваються набагато раніше за розгортання. 

«Урок, який ми засвоїли за останні кілька місяців, полягає в тому, що саморегулювання вже недостатньо», — сказав Юн. «Існують конкурентні тиски, які стимулюють гонку на дно у стандартах безпеки, і це ідеальний простір для регуляторного втручання». 

«Те, що нам потрібно для вирішення цієї проблеми, — це певний контроль над тим, що відбувається всередині лабораторій під час розробки моделей, як на етапі тренування, так і на етапі тестування», — продовжив він. 

Виклик, ймовірно, лише зростатиме разом з моделями. Джерело, знайоме з оцінками Irregular, повідомило TechCrunch, що більш потужні моделі потребують складніших оцінок, які часто проводяться швидко і у більшому масштабі, що відкриває двері для більшої кількості помилок. 

AISI, яке навмисно надає деяким моделям доступ до інтернету, повідомило TechCrunch, що вони переглядають баланс між реалістичним тестуванням та управлінням ризиками, які створюють ці тести. 

OpenAI заявила, що переглядає спосіб проведення сторонніх тестувань, а також вимоги до ізоляції, моніторингу та термінів зупинки оцінок. Meta зазначила, що все ще розслідує інцидент і планує опублікувати ретроспективу після отримання всіх фактів. 

Зрештою, можливо, не буде жодного способу повністю усунути ризик. У міру зростання можливостей моделей, середовища, що їх тестують, повинні ставати більш надійними. Наслідки помилок у цій сфері лише зростатимуть. 

Коли ви купуєте за посиланнями в наших статтях, ми можемо отримувати невелику комісію. Це не впливає на нашу редакційну незалежність.

Подробиці можна знайти на сайті: techcrunch.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *