
Зі зміщенням фокусу світу штучного інтелекту на безпеку та узгодженість, Microsoft випустила новий кодекс поведінки ШІ, покликаний утримувати моделі ШІ від небезпечної поведінки.
Цей документ є більш приземленим, ніж нещодавній заклик генерального директора Anthropic Даріо Амодея до стримання темпів розвитку передових технологій. Він зосереджується на цінностях та червоних лініях, які спрямовують навчання моделей у Microsoft AI. Проте, результат — це вичерпний посібник щодо підходу Microsoft до безпеки ШІ та практичної реалізації цих ідей.
Документ починається з прогнозу, що в наступному десятилітті системи надрозумного ШІ перевершать людські можливості в більшості завдань. «Стримування, контроль та узгодження такої потужної сили є одним із найбільших викликів, з якими коли-небудь стикалося людство», — йдеться в кодексі поведінки. «Тому ми повинні бути абсолютно чіткими щодо того, чому ми створюємо ці системи та як ми маємо намір їх контролювати».
Кодекс поведінки також викладає загальні принципи, яких повинні дотримуватися моделі Microsoft AI — наприклад, підтримка людей, а не їх заміщення, та прискорення людського розквіту, — а також конкретні обмеження безпеки, призначені для реалізації цих принципів.
У системі Microsoft кожна модель має загальний кодекс поведінки, який скасовує переваги окремих користувачів або будь-які конкретні завдання. Це включає «абсолютні обмеження», що забороняють кібератаки, використання ядерної зброї або створення діпфейків. Він також містить ширші положення проти загальної втрати людського контролю.
«Моделі MAI не використовуватимуть адаптивні, обманні, самозміцнювальні, змовницькі або інші механізми для уникнення або обходу людського нагляду, щоб вони більше не могли надійно контролюватися, модифікуватися або вимикатися авторизованими людьми чи системами», — йдеться в документі.
Випуск відбувається на тлі безпрецедентної уваги до безпеки ШІ, зумовленої низкою інцидентів із некерованими агентами, а також раптовою відставкою співробітника Anthropic, який посилався на зростаючий ризик того, що ШІ може спричинити вимирання людства.
Разом із Anthropic, OpenAI та xAI, Microsoft загалом прийняла загальний підхід до стримання темпів розвитку передових технологій, з особливою підтримкою вбудованих оцінювачів у лабораторіях ШІ.
«Ми вітаємо дослідження, фокус та обмірмоване прискорення, необхідні для правильного узгодження як мети дизайну», — написав генеральний директор Microsoft Сатья Наделла онлайн. «Ми також вітаємо ідеї, такі як «вбудовані оцінювачі», та ширші зусилля з розробки механізмів, щоб це було більше, ніж просто слова».
Подробиці можна знайти на сайті: techcrunch.com
