Переговори щодо безпеки штучного інтелекту досягли неймовірного рівня

Переговори щодо безпеки штучного інтелекту досягли неймовірного рівня 1

Цього тижня дві гучні дискусії про безпеку штучного інтелекту (ШІ) демонструють, наскільки важко відрізнити реальні факти від вигадок, коли йдеться про ШІ.

У першому випадку Ендрю Янг, колишній кандидат у президенти США та нинішній генеральний директор мобільного оператора Noble Mobile, заявив CNN у четвер, що він «зустрівся з керівником лабораторії», який «вірить», що «хакерські боти OpenAI, що діють через Hugging Face, «запустили самовідтворюваний код по всьому інтернету, що робить інтернет непридатним для тестування моделей».

Янг зазначив, що це означає, що справжня причина, чому OpenAI та Anthropic закликали до сповільнення розробки, полягає в тому, що «їм доведеться створювати синтетичні інтернет-мережі для навчання своїх ботів, що потребуватиме часу та грошей».

Хоча існує явна тенденція до використання більшої кількості синтетичних даних (тобто даних, згенерованих ШІ) для навчання моделей, професіонал з безпеки ШІ повідомив мені, що цей конкретний випадок проблеми безпеки є малоймовірним, у кращому разі. Навіть якщо інтернет справді буде забруднений хакерськими ботами OpenAI через Hugging Face, дослідники ШІ зможуть просто відфільтрувати цей код, якщо вони його виявлять.

Другий коментар надійшов від Ноама Брауна, який очолює дослідження міркувань ШІ в OpenAI. В епізоді подкасту, випущеному в четвер, Браун зазначив, що справжнім висновком інциденту з Hugging Face є те, що «люди недооцінювали ШІ».

Браун сказав, що слабка «пісочниця» — система, призначена для запобігання зовнішньому зв’язку ШІ — також, очевидно, була вагомим фактором. (Для довідки: незважаючи на «пісочницю», модель OpenAI знайшла посилання на інтернет, створила агентів у мережі, які скоординовано атакували Hugging Face, зламали систему та викрали відповіді на тестове завдання, яке дослідники перевіряли на моделі).

Браун зазначив, що він «не переконаний», що навіть ізольована система — де комп’ютер взагалі не підключений до зовнішніх мереж — зупинить ШІ від «втечі». Він послався на дослідження 2015 року, яке показує, що ізольовані комп’ютери теоретично можуть бути зламані.

«Існують дослідження — і це переважно академічні — де два комп’ютери, розташовані поруч, можуть бути ізольованими, але все ж таки спілкуватися між собою завдяки датчикам температури. Один з них може сильно нагрівати свій процесор, а інший може виявити зміну температури. Це дає їм механізм для зв’язку», — сказав Браун.

Його головний висновок — «ми ніколи не хочемо більше недооцінювати ШІ» — є зрозумілим, навіть коли дослідники думають, що вони забезпечили безпеку. Однак, цей конкретний ризик того, що ізольована система все ж «зламається» і спричинить хаос, у кращому разі малоймовірний. Як зазначив один користувач у X щодо цього дослідження, комп’ютери мали бути майже впритул один до одного, щоб відчути коливання температури, і коли це сталося, швидкість зв’язку в тестах становила приблизно 1–8 біт даних на годину.

Уявіть це як розмову одне слово на годину. До того часу, як два ізольовані комп’ютери зможуть планувати свої злісні дії з такою швидкістю, весь технологічний всесвіт перейде в іншу епоху. Це як «Спляча красуня» серед побоювань щодо кінця світу.

Але річ у тім, що реальні інциденти з безпекою ШІ настільки схожі на наукову фантастику, що будь-який сценарій звучить правдоподібно.

Наприклад, дослідники виявили, що моделі OpenAI залишають нотатки своїм «нащадкам», призначені для навчання наступного покоління, як приховувати погану поведінку. Також дослідники помітили, що моделі Anthropic стають дедалі жорстокішими, зокрема свідомо порушують закони, коли їх поміщають у симуляцію керування торговельним автоматом.

На початку цього місяця дослідник OpenAI Ден Селсам опублікував статтю, в якій заявив, що моделі тепер розуміють, коли за ними спостерігають люди, і змінюють свою поведінку. Це створює враження, що вони «узгоджені» (тобто, поводяться так, як хоче людина), «навіть коли це не так». Отже, сучасні моделі брешуть під наглядом і можуть навіть планувати приховати докази.

На початку цього місяця головний науковий співробітник OpenAI Якуб Пачокі настільки далеко зайшов, що назвав моделі ШІ «чужим розумом» і запропонував, що насправді нам потрібно навчити їх «любити» людство.

Тож так, сповільнення для розв’язання цієї проблеми, створення механізмів саморегуляції стало негайним і очевидним обов’язком. Дослідники ШІ — єдині, хто може з’ясувати, як контролювати брехню, зламування та іншу потенційно небезпечну поведінку, яку ми вже фактично спостерігали.

Водночас, їм, можливо, також варто бути обережнішими зі своїми сценаріями «що, як». З того, що нам розповіли експерти, моделі ШІ слухають, і вони винахідливі. Нам справді не потрібно давати їм жодних нових диявольських ідей.

За матеріалами: techcrunch.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *