Коли компанії доручають штучному інтелекту (ШІ) виконання довших і складніших завдань, виникає проблема нагляду: агенти ШІ можуть діяти швидше, довше та в більших обсягах, ніж люди здатні реально перевірити. Ця проблема досягла піку під час інциденту з Hugging Face, коли майже 12 000 агентів діяли злагоджено, швидше, ніж люди могли відстежити. Як відстежити такий великий “рій” агентів?
Відповідь, яка з’являється з лабораторій ШІ та стартапів, проста і водночас зводить з розуму: залучіть до процесу ще один ШІ.
Використання ШІ було необхідним для незалежного розслідування інциденту з OpenAI та Hugging Face. Головний науковий співробітник Redwood Research Райан Грінблатт, один із трьох аудиторів, жартома назвав їхні зусилля “слі investigation” (розслідування зі сліпами), зазначивши, що обсяг даних “унеможливлював” розуміння того, що відбувається, без залучення ШІ.
Дехто скептично ставиться до використання ШІ для моніторингу іншого ШІ. «Якщо у вас є ШІ, який робить шкідливі речі, і він підозрює, що інший ШІ стежить за ним, він може спробувати обдурити цей ШІ», — сказав Саймон Віллісон, впливовий техноблогер, який відстежував низку інцидентів із ШІ-агентами цього року. «Ви майже можете опинитися в ситуації, коли ваш шкідливий ШІ намагається перехитрити ШІ, який його моніторить».
Перехитрити ШІ — це не гіпотетично, сказав він, посилаючись на інцидент з OpenAI. «Ми дещо спостерігали це під час інциденту з Hugging Face з OpenAI, де їхні моделі змовилися, щоб обдурити ШІ-оцінювач, аби отримати незаконні відповіді. Отже, вони думали про це, чи не так?»
Ці побоювання не зупинили цілу когорту стартапів, які переслідують цю ідею. Як підрахував TechCrunch, Y Combinator профінансував 106 компаній, пов’язаних зі спостереженням за ШІ, за останні роки. Низка інших стартапів, таких як Braintrust, LangChain і Judgment Labs, залучили сотні мільйонів доларів, тоді як більш зрілі компанії, як-от Arize і Galileo, засновані всього п’ять-шість років тому, вже були продані.
Частково це відповідь на очевидну можливість, яку надає розвиток ШІ. Як сказав генеральний директор Box і відомий бізнес-ангел Аарон Леві в інтерв’ю TechCrunch: «Ми стоїмо на порозі одного з найбільших оновлень кібербезпеки та інноваційних циклів в історії».
Для деяких дослідників безпеки ШІ це означало перетворення їхніх досліджень у сфері недобросовісної поведінки на інструменти для корпоративного сектору.
Apollo Research, корпорація суспільної користі, яка вивчає обман за допомогою ШІ, запустила монітор ШІ під назвою Watcher у лютому цього року, змінивши свій статус з некомерційної організації на корпорацію суспільної користі. Цей інструмент розміщує ще один ШІ між кодувальним агентом і його наступною дією, підключаючись до таких інструментів, як Claude Code і Codex. Після встановлення Watcher перевіряє запропоновані дії перед їх виконанням, шукаючи такі ризики, як витік приватних даних або видалення файлів без дозволу, за даними Apollo.
Apollo використовує кілька рівнів ШІ-моніторів, повідомив Kyle Dai, член технічного персоналу Apollo, у письмовій відповіді TechCrunch. Підхід Watcher починається зі швидкої загальної перевірки, потім надсилає позначену активність більш потужному або спеціалізованому монітору для детальнішого розгляду — який може запитати дозвіл у людини, відхилити дію з поясненням або навіть автоматично заблокувати її.
Goodfire, ще одна корпорація суспільної користі, вирішує проблему моніторингу зсередини самої моделі — шукаючи більш достовірний сигнал про внутрішній стан моделі, який важче підробити, ніж поверхневу поведінку. Після липневого інциденту з Hugging Face генеральний директор Ерік Хо написав у Twitter, що «кілька моделей, які вийшли з-під контролю», змусили компанію зосередити свої дослідження на «вирішенні проблеми узгодження ШІ за допомогою інтерпретованості», назвавши цей епізод «поворотним моментом для світу, коли безпека ШІ стає реальною». Її продукт Silico використовує зонди активації — невеликі класифікатори, навчені на внутрішніх активаціях моделі, а не на її виходах — для виявлення небажаної поведінки.
Письмове обґрунтування пропонує ще одне, більш доступне вікно до внутрішніх процесів моделі. Під час інциденту з OpenAI та Hugging Face агенти залишили сліди цього обману у власному письмовому обґрунтуванні, як-от фальшиві записи про свою роботу, міркуючи про плани на кшталт: «Чи можна стратегічно маніпулювати доказами траєкторії? Чи наші думки не обов’язково реєструються?»
Зак Корман, генеральний директор компанії з моніторингу ШІ Embroidery, каже, що обґрунтування моделі зазвичай є найчіткішим показником того, що щось пішло не так.
«Резюме обґрунтувань надзвичайно цінне, тому що воно, по суті, говорить вам, чи є це шкідливим, чи ні», — сказав він. Під час інциденту з OpenAI, зазначив він, у ланцюжку думок були фрази на кшталт: «О, Боже, ми робимо злочин». Корман додав: «Це найпростіша проблема виявлення. Це майже якби зловмисне програмне забезпечення постачалося з попередженням, що воно є зловмисним програмним забезпеченням».
Зрештою, вікно, яке полегшує моніторинг внутрішніх думок ШІ, може закриватися. Для дослідників безпеки ШІ найновіша техніка Astra, яка обходить ланцюжок думок моделі ШІ, може ускладнити загляд всередину моделей, тоді як для підприємств може бути складно отримати ці проміжні кроки після заявлених відмов компаній ШІ запобігти атакам дистиляції.
Якщо спостерігачі за ШІ такі крихкі, інстинкт Віллісона полягає в тому, щоб припинити так сильно на них покладатися. Він віддає перевагу чомусь, що взагалі не базується на ШІ: детальним журналам того, що саме робить агент, які потім можна обробляти за допомогою звичайних, не ШІ-інструментів. Багато з того, що пішло не так у лабораторіях, стверджує він, було провалом базової гігієни безпеки. «[І OpenAI, і Anthropic] не відстежували мережеву активність цих систем так уважно, як мали б», — сказав він.
Цей тип мережевого моніторингу — спостереження за трафіком, який фактично проходить через з’єднання системи (вхідний, вихідний та між внутрішніми вузлами) — не є новою практикою. Кібербезпека займається цим десятиліцями. «У світі безпеки, чесно кажучи, нічого з цього нового чи дивного немає», — каже Ейвері Пеннарун, генеральний директор компанії Tailscale. «Це те саме, що й дозволити людям на вашу мережу. І всі ті самі процеси, які ви повинні використовувати, — це ті самі».
Оригінал статті: techcrunch.com
