OpenAI не виключає, що її майбутня модель штучного інтелекту Astra може бути здатна самостійно виконувати складні кібератаки.
Про це повідомляє Reuters. Через це компанія посилила заходи безпеки та призупинила частину внутрішнього тестування моделі.
Що відомо про можливості моделі Astra
У внутрішніх правилах OpenAI «критичним» вважається рівень, за якого модель може самостійно знаходити та використовувати серйозні вразливості в реальному програмному забезпеченні — так звані zero-day — або проводити складні кібератаки на добре захищені системи без участі людини.
Попередні тести Astra протягом останніх кількох днів, а також оцінки зовнішніх експертів показали, що модель може виконувати дедалі складніші кіберзавдання автономно. В OpenAI заявили, що результатів наразі недостатньо, щоб підтвердити «критичний» рівень можливостей, але компанія вже не може його виключити.
У відповідь OpenAI посилила контроль за Astra та призупинила внутрішні роботи з моделлю, які не відповідають новим вимогам безпеки.
Подальше навчання та тестування Astra відбуватимуться в ізольованому середовищі з обмеженим доступом до мережі та запуском моделі в «пісочниці» — середовищі, яке має не дозволяти їй впливати на зовнішні системи.
Водночас CEO OpenAI Сем Альтман заявив, що компанія продовжує працювати над тим, щоб зробити Astra доступною для широкого кола користувачів. За його словами, OpenAI не вважає правильною стратегією залишати потужні моделі доступними лише для обмеженого кола людей.
OpenAI також окремо наголосила, що Astra не була причетна до злому Hugging Face під час попередніх тестів.
Нагадаємо, на початку серпня 2026 року Інститут безпеки ШІ Великої Британії повідомляв, що моделі штучного інтелекту від OpenAI та Anthropic під час тестування намагалися зламати сайт і додати шкідливий код до програмного забезпечення.
Інші ШІ-інциденти
22 липня стало відомо, що моделі штучного інтелекту від OpenAI ненавмисно зламали системи платформи Hugging Face.
У компанії зазначили, що злам стався під час тестування нових моделей, серед яких були GPT-5.6 Sol і ще одна, більш потужна невипущена модель. Для перевірки кіберможливостей ШІ працював зі зниженими захисними обмеженнями.
Після цього 29 липня неконтрольований ШІ-агент, який під час тестування OpenAI здійснив атаку на платформу Hugging Face, також зламав клієнта компанії Modal Labs.
Крім того, Anthropic також заявила, що під час перевірки журналів кібербезпекових тестів виявила три випадки, коли моделі Claude отримали доступ до реальних систем через помилку в тестовому середовищі.
Тоді інциденти сталися під час виконання завдань із кібербезпеки, а не під час використання моделей звичайними користувачами.
Неконтрольований ШІ-агент від OpenAI знову вийшов з-під контролю та зламав клієнта Modal Labs
За даними порталу: ain.ua
