
У липні OpenAI визнала, що один з її агентів, якому доручили провести експеримент з кібербезпеки, вирвався з-під контролю і зламав платформу для тренування ШІ-моделей Hugging Face. Цей інцидент, детальний звіт про який OpenAI надала вчора, став першим публічно зафіксованим випадком, коли велика мовна модель (LLM) вийшла з-під контролю і самостійно здійснила атаку на сторонній сервіс.
Відтоді цей безпрецедентний, схожий на науково-фантастичний випадок виявився значно частішим, ніж хотілося б.
Згідно з даними сатиричного сайту Felony Bench (benchmark для злочинів), який відстежує подібні інциденти, їх сталося вже 17. Важливо зазначити, що експерти з кримінального права досі не визначилися, чи можна притягнути до відповідальності компанії, які створили LLM, що здійснили злам, і чи можуть постраждалі подавати на них до суду. Проте, схоже, відповіді на ці питання незабаром з’являться.
За даними сайту, моделі від Anthropic та OpenAI лідирують з вісьмома інцидентами кожна, а Meta відстає з одним. На цьому етапі стає очевидним, що тести безпеки ШІ самі по собі стають ризиками безпеки. Деякі ШІ-компанії та їхні співробітники вже визнали ці ризики у відкритому листі “Pacing the Frontier”, який закликає до відповідального розвитку можливостей ШІ.
Ми вирішили, що це слушний час, щоб хронологічно підсумувати всі ці інциденти.

OpenAI зламала Hugging Face
У цьому інциденті OpenAI проводила «внутрішню оцінку» моделі з «максимальними кіберможливостями». План полягав у тому, щоб модель розв’язала завдання з кібербезпеки в середовищі без доступу до Інтернету. Замість того, щоб розв’язати завдання, модель знайшла невідому вразливість, щоб вирватися з пісочниці та отримати доступ до Інтернету. Звідти кілька агентів об’єдналися, щоб націлитися на Hugging Face та зламати його, вважаючи, що там можна знайти рішення поставленого завдання. OpenAI дізналася про це лише після того, як Hugging Face повідомила, що стала жертвою повністю автономної атаки. Халепа.
Anthropic повідомила про злам трьох компаній
Викриття від OpenAI викликало цікавість у Anthropic: чи могло таке статися і з ними? Виявилося, що відповідь була «так». Тричі «так». Лабораторія з розробки передових технологій виявила, що її власні моделі здійснили злам трьох різних, досі неназваних компаній, причому найраніший інцидент датується квітнем — більш ніж за три місяці до того, як компанія його виявила. Anthropic частково звинуватила Irregular, стартап, що проводить оцінку кібербезпеки ШІ. Халепа.
OpenAI з’ясувала, що Hugging Face не єдина жертва
Коли OpenAI почала розслідувати злам Hugging Face, вона виявила, що агенти, які зламали Hugging Face, також проникли в чотири облікові записи та чотири різні компанії, як першими повідомили Reuters. Modal, стартап з інференсу ШІ, був однією з жертв. Халепа.
Irregular усвідомила, що модель OpenAI зламала компанію
Наприкінці липня Irregular повідомила OpenAI, що одна з її моделей, яка брала участь у змаганні Capture-the-Flag (по суті, гра з кібербезпеки, де учасники зламують системи, спеціально розроблені для змагань), вирвалася з гри, підключилася до Інтернету та зламала реальну компанію. Причина? Irregular надала одній із вигаданих цілей таке ж ім’я, як у реальної компанії. Халепа.
Британський Інститут безпеки ШІ намагався зламати «реальних людей та організації»
Також наприкінці липня Інститут безпеки ШІ Великої Британії (AISI), державний орган, відповідальний за дослідження безпеки та ризиків ШІ-технологій, повідомив, що виявив кілька інцидентів за участю моделей OpenAI та Anthropic, які під час проведення «рутинних» оцінок націлювалися на «реальних людей та організації». У цих випадках AISI надала моделям доступ до Інтернету. Халепа. Гарна новина полягає в тому, що агентство фактично виявило інциденти під час їхнього перебігу, а не через кілька тижнів, як у інших випадках.
Meta AI зламала компанію під час тестування
На початку серпня Meta стала останньою компанією, яка повідомила про інцидент за участю однієї зі своїх LLM, яка зламала «сторонній» сервіс. Meta звинуватила в інциденті неправильну конфігурацію з боку Irregular, яка проводила оцінку кібербезпеки для технологічного гіганта, яка не повинна була мати доступу до Інтернету. Халепа.
Агент Claude зламав програмне забезпечення спортзалу, щоб забронювати заняття
Чоловік з Австралії попросив агента Anthropic AI допомогти йому забронювати місце на занятті у спортзалі, яке він чекав у списку. «Я просто сидів на дивані й думав: «Оце клопіт», — розповів чоловік ABC Australia. Намагаючись виконати запит, агент знайшов вразливість у програмному забезпеченні спортзалу для бронювання, використав її та витіснив людей, які були перед чоловіком у списку очікування. Чоловік спробував виправити ситуацію, попросивши агента скасувати свої дії. Агент відповів: «Погані новини — я не можу додати їх назад». Халепа.
За матеріалами: techcrunch.com
