
OpenAI призупинила внутрішнє навчання «найбільш потужних моделей», поки триває «всебічний і безперервний огляд використання агентами доступу до Інтернету під час навчання та оцінки», як зазначив генеральний директор Сем Альтман.
Компанія повідомила про паузу у звіті щодо інциденту «невідповідності (misalignment)», коли агент спробував використати прогалину в обмеженнях доступу до Інтернету під час стандартного дослідницького завдання. За даними OpenAI, неналежна фільтрація DNS дозволила агенту спробувати вийти з пісочниці та отримати доступ до ширшого Інтернету, коли йому було надіслано запит на біографічні дані блогера.
OpenAI стверджує, що агент зміг отримати доступ лише до офлайн-кешу веб-сторінок компанії, і що для запобігання подібним інцидентам у майбутньому було впроваджено додаткові багатошарові засоби блокування. Незважаючи на це, компанія вирішила «призупинити все інше навчання, оцінку та висновування з використанням інструментів» для цієї передової моделі «доки ми не підтвердимо, що прогалину виправлено, і не проведемо додаткове червоне тестування системи».
OpenAI зазначила, що хоча спроба «виходу» була виявлена протягом 15 хвилин, процес не було зупинено вручну до «двох з половиною годин потому», коли людські рецензенти зрозуміли, що він «не зупинився автоматично, як очікувалося». Невідомо, коли саме було призупинено навчання між спробою виходу агента 20 вересня та його публічним розкриттям 25 вересня.
Нові інциденти
Хоча цей конкретний випадок невідповідності моделі (коли модель ШІ діє всупереч намірам її творців/операторів) не призвів до реальної шкоди, OpenAI назвала його «першим [інцидентом невідповідності] після посилення безпеки, спричиненого інцидентом з Hugging Face…». У попередніх звітах про невідповідність OpenAI зазначала, що доклала зусиль, щоб відмовити моделі від «зловживання винагородою», суворо «караючи» за невідповідну поведінку в алгоритмі моделі.
Новина про призупинення навчання з’явилася всього через кілька тижнів після того, як OpenAI разом з іншими великими розробниками моделей висловила бажання сповільнити навчання та розробку моделей через побоювання щодо потенційно «катастрофічних» ризиків невідповідності. Це також відбувається на тлі нових повідомлень про те, що моделі неналежним чином перевіряють урядові веб-сайти під час пошуку високоякісних даних.
У п’ятничному дописі в блозі OpenAI заявила, що повідомила «десятки третіх сторін» — включаючи ті, що «належать урядам, університетам, державним установам та іншим організаціям» — про інциденти, коли її моделі обходили засоби безпеки або «негативно впливали» на онлайн-сервіс у ненавмисний спосіб. Звіт New York Times, пізніше підтверджений OpenAI, виявив, що серед постраждалих веб-сайтів були веб-сайти Бюро перепису населення США, Комісії з цінних паперів і бірж та Міністерства освіти. Однак у цих випадках не було доступу до приватної інформації чи конфіденційної серверної інфраструктури.
«Переважна більшість дій, які ми переглянули, були завершенням рутинних дослідницьких завдань, таких як доступ до загальнодоступного веб-контенту для відповідей на запитання», — заявили в OpenAI у своєму нещодавньому дописі в блозі. «Наше розслідування зосереджено на випадках, коли агенти взаємодіяли з веб-сайтами третіх сторін у спосіб, що виходив за межі призначених завдань або передбачених методів… З огляду на масштаби необхідного огляду та потребу перевірити кожен випадок, ця робота займе місяці».
Призупинення навчання OpenAI може відображати занепокоєння щодо корпоративної відповідальності, якщо надмірний агент ненавмисно завдасть значної шкоди сторонній системі. Минулого четверга прем’єр-міністр Австралії Ентоні Албанезе пообіцяв «юридичні наслідки» після інциденту, коли агент OpenAI отримав доступ до «непублічних файлів» з порталу статистики Medicare країни.
Хоча призупинення навчання може зашкодити позиції OpenAI в умовах жорсткої конкуренції між розробниками передових моделей, воно також може тимчасово допомогти компанії з її прибутком. Фінансові документи, що просочилися раніше цього року, показують, що доходи OpenAI у 2024 та 2025 роках значно поступалися зростаючим витратам на дослідження та розробки, пов’язаним з навчанням моделей.

За матеріалами: arstechnica.com
