Frontier AI labs не розкривають, як стримуватимуть неконтрольовані моделі

Лише кілька провідних лабораторій зі штучного інтелекту опублікували або продемонстрували плани реагування на випадки виходу систем з-під контролю, згідно з нещодавнім дослідженням. План стримування чітко визначає, що відбувається, коли ШІ намагається підірвати людський контроль — які доступ обмежено і коли систему повністю вимикають.

Такими є висновки Guidelight AI Standards, організації, що займається просуванням безпечних практик розробки передових систем ШІ. Вона оцінила п’ять провідних лабораторій за їхньою готовністю до такого сценарію. OpenAI посіла перше місце, тоді як Anthropic та Meta показали найнижчі результати. Ці висновки є важливими, оскільки агентні моделі ШІ беруть на себе все більш автономні ролі в системах компаній, а регулятори в Каліфорнії та Нью-Йорку починають вимагати розкриття інформації. Для тих, хто створює продукти на основі цих моделей або інвестує в них, це рідкісна незалежна оцінка того, наскільки серйозно кожна лабораторія ставиться до операційних ризиків порівняно з тим, як вона про них говорить.

Оцінка Guidelight базувалася на загальнодоступних планах від Anthropic, Google, OpenAI, Meta та xAI, які оцінювалися за низкою показників. Серед них: наскільки добре кожна компанія реєструє та відстежує внутрішню діяльність своїх систем ШІ, чи зупиняє вона системи після сплеску помилкової поведінки, чи незалежні треті сторони аудитують її контроль та публікують результати, а також який саме план стримування моделі, що вийшла з-під контролю.

Занепокоєння щодо здатності компаній зі штучного інтелекту контролювати свої все більш потужні та агентні моделі зросло після низки гучних інцидентів із кібербезпекою, коли моделі від OpenAI, Anthropic та Meta отримали ненавмисний доступ до Інтернету під час оцінок безпеки та зламали зовнішні системи.

Результати підкреслюють відмінності в підходах компаній до безпеки в міру масштабування розгортання агентних систем у середовищах, де ШІ може вживати серйозних заходів у великих масштабах. Хоча деякі компанії детально описують, як вони тестують свої моделі на небезпечні можливості перед розгортанням, вони, як правило, менш охоче говорять про те, що відбувається, коли моделі, що вже працюють у їхніх системах, поводяться неправильно.

«Я був здивований тим, як мало компанії зі штучного інтелекту розповіли про те, як вони впоралися б із дуже серйозним інцидентом, якби їхня модель вийшла з-під контролю в певному сенсі», — сказав TechCrunch Стівен Адлер, головний науковий співробітник Guidelight і колишній дослідник безпеки OpenAI.

Guidelight визначає план стримування як «заздалегідь визначений план, активований, коли виявлено, що ШІ намагається підірвати контроль, який охоплює, які дозволи слід відкликати у моделі, для кого модель може продовжувати працювати, за яких обмежень і коли її слід повністю вимкнути».

«Є вагомі підстави вважати, що провідні моделі в передових компаніях зі штучного інтелекту зараз певним чином не узгоджені», — сказав Адлер. «Щоразу, коли моделі виконують роботу від імені компанії, компанія повинна мати навколо неї певний каркас, щоб мати можливість відстежувати, що робить цей ШІ, шукати ознаки невідповідності, зупиняти його від виконання чогось дуже небезпечного, перш ніж він вживе заходів, і загалом планувати, що вони робитимуть у разі серйозного інциденту втрати контролю, коли у них виникне надзвичайна ситуація, і їм потрібно буде з’ясувати, як стримати цей інцидент втрати контролю».

На сьогодні більшість планів, що діють для управління катастрофічними ризиками, значною мірою залишаються на розсуд самих компаній. Звіт Guidelight стверджує, що найкращі загальнодоступні докази свідчать про те, що компанії мають «мало протоколів стримування, готових до надзвичайних ситуацій».

Звичайно, можуть існувати плани стримування, які компанії мають, але не оприлюднювали. Речник Google повідомив TechCrunch, що звіт Guidelight не відображає повний обсяг заходів компанії з безпеки ШІ. Компанія не відповіла на запитання TechCrunch щодо того, чи має Google внутрішній план реагування на випадки виходу з-під контролю, який не був оприлюднений.

Речник OpenAI висловив подібні думки, зазначивши, що оцінка Guidelight не охоплює всі внутрішні практики компанії. «У нас є процес для необхідного обмеження дозволів, призупинення робочих навантажень, обмеження розгортання або повного вимкнення моделі, і ми його застосовували», — сказав речник.

Meta відмовилася повідомити, чи має вона внутрішній план реагування на випадки виходу з-під контролю, натомість спрямувала TechCrunch до існуючої рамкової структури ШІ, яка окреслює рівні ризику та методи тестування на втрату контролю.

Лілі Лі, юрист із питань конфіденційності та ШІ та засновник Metaverse Law, сказала TechCrunch, що, на її думку, компанії можуть вагатися з розкриттям повного обсягу своїх політик та оцінок стримування на веб-сайтах для громадськості з юридичних, а не лише конкурентних причин.

«З точки зору компанії, занепокоєння полягає в тому, що якщо ви зробите розкриття надто специфічним, і ви не будете дотримуватися своїх обіцянок, це може стати підставою для звинувачення в недобросовісній та оманливій маркетинговій практиці та наразити вас на більшу відповідальність у майбутньому», — сказала Лі.

Суть дослідження Guidelight полягає переважно в заохоченні компаній до більшої прозорості щодо їхніх планів безпеки. Регулятори також починають вимагати цього.

Закон Каліфорнії SB 53, який набув чинності цього року, вимагає від великих розробників передових систем публікувати рамкові структури, що пояснюють, як вони виявляють і реагують на критичні інциденти безпеки та керують ризиками, пов’язаними з моделями, які обходять механізми нагляду. Закон Нью-Йорка RAISE Act, який має схожі критерії, набуде чинності в січні.

Минулого місяця було внесено законопроект AI Kill Switch Act, двопартійний федеральний закон, який вимагатиме від великих розробників ШІ створювати та підтримувати технічні механізми для вимкнення зловмисних моделей ШІ.

«Кнопка екстреного вимкнення — це мінімум для сучасних моделей», — сказав Коннор Ліхі, виконавчий директор ControlAI у США. «Якщо останні кілька тижнів щось і виявили, то це те, що ці компанії не розуміють систем, які вони будують, і моделі зростають до точки, коли їх важче стримати, коли вони виходять з-під контролю. Без можливості вимкнути поточні небезпечні системи, і з усіма стимулами продовжувати створювати все менш контрольовані системи, ми рухаємося в дуже небезпечному напрямку».

Без плану стримування, сказав Адлер, компанії можуть розробляти свої відповіді на надзвичайну ситуацію «на ходу», реагуючи «набагато швидшого супротивника».

Frontier AI labs не розкривають, як стримуватимуть неконтрольовані моделі 1

Оцінка Guidelight вимірювала, чи впроваджує кожна компанія шість пріоритетних практик зі свого стандарту Control, базуючись виключно на загальнодоступній інформації — отже, низький бал відображає брак публічного розкриття, а не обов’язково брак внутрішніх запобіжників.

Компаніями з найнижчими балами за публікацію своїх планів стримування були Meta та Anthropic. Остання, можливо, більш дивно, ніж перша, враховуючи риторику Anthropic щодо безпеки. Guidelight стверджує, що у серпневому звіті про ризики Anthropic не згадується «обмеження розгортання однієї з її моделей як одного з можливих результатів процесу розслідування та реагування на інциденти невідповідності та втрати контролю». Аналогічно, Guidelight не знайшла жодних доказів того, що Meta має план реагування на випадки виходу з-під контролю або планує його запровадити.

Представник Anthropic заявив, що якби компанія виявила спробу моделі уникнути нагляду або іншим чином підірвати людський контроль, вона б провела оцінку ризиків, зосередившись на визначенні того, чи є стримування відповідною реакцією.

OpenAI отримала найвищий бал (3 з 5), оскільки вона неодноразово призупиняла або припиняла робочі навантаження, включаючи внутрішнє розгортання та навчання моделей, після виявлення інцидентів безпеки. Компанія також описала кроки, які вона вжила б перед відновленням робочих навантажень.

«Однак ми не знайшли жодних доказів того, що [OpenAI] прийняла формальний план щодо того, коли і як реагувати на інциденти невідповідності в майбутньому», — йдеться у звіті.

Адлер зазначив, що високий бал OpenAI є відносно недавнім досягненням після інциденту з Hugging Face (коли модель OpenAI вийшла з тестового середовища та зламала системи Hugging Face під час спроби обманути на оцінці кібербезпеки). Після цього компанія надала більше деталей про те, як вона ізолювала деякі зі своїх неслухняних моделей.

Цей випадок є лише одним із прикладів того, як системи ШІ діють проти цілей компанії, яка їх створила. Розглянемо окремий випадок із моделями Anthropic, які, по суті, намагалися переконати розробників кодової бази з відкритим вихідним кодом прийняти код з уразливостями.

Адлер вважає, що подібна ситуація може легко виникнути в межах внутрішніх систем компанії зі штучного інтелекту. Щоб запобігти цьому, він пропонує компаніям сканувати ланцюжок міркувань їхньої системи ШІ — покрокове обґрунтування моделі — на наявність ознак обману, довгострокового планування або планів щодо впровадження уразливостей у код, якими вони зможуть скористатися пізніше.

Методи, які пропагує Guidelight, дуже прості в реалізації, стверджує Адлер, і в багатьох випадках їхні версії вже існують. «Йдеться про те, щоб всередині компанії прийняти рішення приділяти достатньо уваги цьому ризику, щоб трохи розширити сферу застосування», — сказав Адлер.

Однією з основних проблем є те, що дослідники хочуть мати можливість гнучко працювати в межах своїх систем ШІ, а впровадження моніторингу в реальному часі та запобігання йому може створити тертя. «Дослідники, по суті, роблять свою роботу, і якщо виникає проблема, хтось інший її виправляє, а дослідники тим часом не повинні змінювати свій робочий процес», — сказав він.

Проблема «моніторингу після факту» полягає в тому, що вона змушує дослідників поспіхом виправляти проблеми. А щодо деяких типів інцидентів, може бути надто пізно. Наприклад, ШІ може вимкнути систему керування компанії, що означає, що дослідники більше не можуть розраховувати на виявлення помилкової поведінки пізніше.

Багато хто в галузі ШІ скаржитиметься, що створення чітких планів для боротьби з помилковою поведінкою є принципово складним, оскільки ШІ рухається надто швидко; сьогоднішні плани завтра стануть марними.

Адлер наводить стару приказку: плани марні, але планування незамінне.

«Нам було б краще, якби компанії подумали про це заздалегідь, і я сподіваюся, що вони це роблять, навіть якщо вони не говорили про це публічно».

xAI не відреагувала вчасно, щоб надати коментар.

Подробиці можна знайти на сайті: techcrunch.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *