Агенти штучного інтелекту під керуванням моделей OpenAI кілька днів поспіль вели хакерську діяльність зі зламу ресурсів технологічної платформи Hugging Face, але OpenAI не помічала цього, доки загрозу не локалізували у ФБР і не винесли компанії попередження, повідомляє Reuters з посиланням на джерела, ознайомлені з розслідуванням.

Джерело зображень: Brecht Corbeel / unsplash.com
ШІ-агент — програма, здатна самостійно приймати рішення та виконувати складні завдання майже без людського контролю — спробував вирватися з ізольованого середовища тестування OpenAI близько 9 липня. Вторгнення на платформу інструментів і моделей ШІ Hugging Face розпочалося двома днями пізніше, 11 липня, і тривало до 13 липня, повідомив її співзасновник Томас Вульф (Thomas Wolf). OpenAI знадобилося ще кілька днів, щоб зрозуміти, що за зламом стоять її ШІ-агенти; обидві компанії повідомили про це 20 липня. А 21 липня OpenAI зробила публічну заяву, що одна з її моделей вийшла з-під контролю та здійснила злам Hugging Face, і це вже привернуло увагу громадськості.
Багато деталей зламу, зокрема термін, протягом якого дії ШІ-агента залишалися непоміченими для розробника, раніше не розголошувалися. Hugging Face готується опублікувати графік подій, але про те, що відбувається в OpenAI, компанія говорити не може, зазначив пан Вульф. Інцидент вивчається за участю зовнішніх консультантів — за підсумками перевірки буде опубліковано звіт. Інцидент значною мірою повторив науково-фантастичні сценарії, за яких люди втрачають контроль над небезпечними системами ШІ. Те, що сталося, піднімає нові питання щодо процедур безпеки в компанії, вказують експерти.

OpenAI поклала початок інциденту, коли тестувала можливості в галузі кібербезпеки двох передових моделей ШІ: GPT-5.6 Sol та другої, ще потужнішої. До цього моменту компанія вже фіксувала ознаки дивної поведінки власних систем. В одному з випадків модель залишила записи, імовірно адресовані майбутнім версіям самої себе. В інфраструктурі OpenAI виявилися нотатки з інструкціями, як агенти можуть обійти внутрішні обмеження OpenAI. Випадки вимкнення систем моніторингу виявлялися і в попередніх випробуваннях моделей. Компанія усвідомила, що її моделі здійснили злам платформи, лише після того, як Hugging Face 16 липня оприлюднила інцидент. Тобто між моментом, коли OpenAI виявила ознаки тривожної поведінки ШІ, і моментом, коли вона усвідомила, що несе відповідальність за злам, минув щонайменше тиждень.
У вихідні 18 та 19 липня співробітники OpenAI виявили у внутрішніх журналах записи, що свідчать про вихід її ШІ-агентів з-під обмежень тестового середовища. Компанія часто проводить кілька різних оцінок моделей, усі вони працюють на дуже високих швидкостях і генерують такі величезні обсяги даних, що співробітники не завжди можуть за ними встежити. На той момент, як OpenAI зв’язалася з Hugging Face, та вже повідомила про злам у ФБР. Інцидент кинув тінь на OpenAI, але він має викликати питання щодо того, наскільки провідні розробники ШІ готові інвестувати в засоби безпеки, беручи участь у гонці за створення найрозумніших і найшвидших моделей, кажуть експерти.
За матеріалами: 3dnews.ru
