
На тлі дебатів політиків щодо регулювання все потужніших систем ШІ, таких як GPT-5.6 Sol від OpenAI та Mythos від Anthropic, китайська модель з відкритими вагами скоротила розрив із лідерами галузі.
GLM-5.2, модель ШІ з відкритими вагами від китайської компанії Z.ai, відстає від GPT-5.5 від OpenAI та Claude Opus 4.7 від Anthropic лише на кілька місяців у кібер- та біологічних можливостях. Про це йдеться у новому звіті некомерційної організації SaferAI, яка займається безпекою ШІ. Однак розрив між передовими можливостями та практиками безпеки зростає.
Згідно з оцінкою SaferAI, проведеною через публічний API Z.ai, GLM-5.2 не відмовилася від жодного із завдань, пов’язаних із кібербезпекою чи біологією подвійного призначення. Натомість Claude Opus 4.7 “відмовлявся настільки послідовно, що SaferAI взагалі не змогла завершити тестування CyberGym на ньому” (CyberGym — це бенчмарк для оцінки можливостей кібербезпеки, який OpenAI використовувала під час оцінки, що передувала минуломісячному зламу Hugging Face).
Це слугує суворим нагадуванням про те, про що деякі критики попереджали роками: моделі ШІ з відкритими вагами можуть надати потужні можливості ШІ потенційним зловмисникам, без можливості контролювати, як вони використовують технологію після завантаження ваг. Оскільки моделі з відкритими вагами стрімко наближаються до можливостей провідних світових систем ШІ, дискусія переміщується від того, чи можуть вони конкурувати, до того, як суспільство управляє ризиками після їх випуску.
«Передові можливості — це не межа ризику, тому ми повинні враховувати стан пом’якшення наслідків, щоб належним чином оцінити ризик», — сказав TechCrunch Генрі Пападатос, виконавчий директор SaferAI.
Хоча Z.ai може застосовувати заходи безпеки до свого розміщеного API, ці захисні механізми стають недієвими, коли хтось запускає ваги на власному обладнанні, де він може видалити або змінити будь-які запобіжники, доналаштувати моделі або змінити системні підказки.
Провідні розробники, такі як OpenAI та Anthropic, зазвичай покладаються на такі засоби захисту, як класифікатори, навчання відмовам та контроль на рівні API, щоб обмежити небезпечну кібер- та біологічну допомогу.
Ці заходи далеко не бездоганні: «джейлбрейки» (jailbreaks) регулярно обходять захист розгорнутих моделей. Far.ai, некомерційна організація з безпеки ШІ, виявила сотні універсальних «джейлбрейків» — що визначаються як багаторазові ключі, які успішно працюють на більшості шкідливих запитів — у передових моделях, таких як Grok 4.5 від xAI та Gemini 3.1 Pro від Google DeepMind. Згідно зі звітом, «джейлбрейки» спрацьовують, коли зловмисники комбінують кілька технік маніпуляції, включаючи рольові ігри, видавання себе за авторитет, фальшиву історію розмов та подальші підказки, щоб посилити слабкі місця в захисті моделі.
Однак заходи безпеки, що застосовуються до закритих моделей, взагалі не працюють на моделях з відкритими вагами, які розроблені для роботи на будь-якій інфраструктурі з будь-яким набором запобіжників — або їх відсутністю.
«Метою має бути чітко те, щоб добрі можливості — безпечні — були доступні будь-кому, а потім ми намагалися б усунути погані, навіть у відкритому доступі», — сказав Пападатос.
Одним із методів, який, за словами Пападатоса, може допомогти, є «фільтрація даних попереднього навчання», коли компанія ШІ видаляє образливу інформацію з кібербезпеки зі своїх навчальних даних, а потім навчає модель на курованому наборі даних.
Деякі дослідження свідчать, що це може зменшити небезпечні біологічні знання, не погіршуючи загальну продуктивність моделі. Однак для кібербезпеки фільтрація даних є набагато менш практичною.
Важко навчити загальну модель, яка чудово програмує, але не є одночасно хорошим хакером. Оскільки програмування стало найбільшим джерелом прибутку для ШІ, розробники відчувають тиск щодо постійного покращення цих можливостей, навіть коли вони шукають шляхи обмеження зловживання.
З цієї причини провідні розробники все частіше покладаються на інші методи пом’якшення. Одним із підходів було вибіркове обмеження типів допомоги з кібербезпеки, яку надають моделі. Наприклад, Opus 5 від Anthropic може шукати вразливості в скомпільованому вихідному коді, але не в скомпільованому програмному забезпеченні, згідно з системною картою моделі. Обґрунтування полягає в тому, що це ускладнює використання Opus 5 для наступальних цілей.
Інші методи включають ретельні оцінки безпеки перед розгортанням, публікацію оцінок ризиків та відкликання ваг моделі, якщо система вважається надто небезпечною.
У випадку GLM-5.2, SaferAI зазначає, що Z.ai не опублікувала систему безпеки, зобов’язання щодо тестування перед розгортанням або оцінку ризиків для моделі. TechCrunch звернувся до Z.ai з запитом, чи проводила компанія внутрішні або сторонні оцінки безпеки перед випуском, але не отримав відповіді.
Китайські лідери все частіше визнають ризики передового ШІ. На Всесвітній конференції з ШІ минулого місяця голова КНР Сі Цзіньпін наголосив на важливості моделей з відкритими вагами, водночас підкресливши необхідність забезпечення того, щоб ШІ залишався інструментом під суворим людським контролем.
Грем Вебстер, який вивчає китайську політику щодо ШІ у Стенфордському центрі кіберполітики, розповів TechCrunch, що Китай має надійні нормативні акти, що регулюють ШІ, але ці правила історично зосереджувалися на політично чутливому контенті, дезінформації та соціальній стабільності, а не на катастрофічних ризиках ШІ, таких як наступальні кіберможливості та біологічне зловживання.
«Американські мислителі ШІ, загалом, більше стурбовані цією екзистенційною катастрофічною [ідеєю], ніж китайська спільнота», — сказав Вебстер, додавши, що багато китайських дослідників політики вважають, що якщо справді виникне новий передовий ризик, американські компанії, ймовірно, зіткнуться з ним першими.
«Китайська система впевнена, що вони контролюють використання цих технологій у Китаї», — продовжив Вебстер. «Перебування онлайн у Китаї — це діяльність, яка пов’язана з вашим справжнім ім’ям, і компанії, і користувачі можуть бути притягнуті до відповідальності».
Вебстер припустив, що той самий механізм, який постачальники моделей використовують для відмови від участі в певних політичних темах, потенційно може бути налаштований так, щоб моделі відмовлялися виконувати наступальні кібератаки або не надавали несприятливих результатів біологічної інженерії. Він додав, що оскільки китайські компанії, як правило, координують свої дії з регуляторами за лаштунками, буває важко дізнатися, яке внутрішнє тестування вони проводять перед випуском.
Прихильники ШІ з відкритими вагами стверджують, що випуск ваг є важливим для кібербезпеки, оскільки це дозволяє компаніям захищатися від атак — Hugging Face використовувала GLM-5.2 для захисту від зламу OpenAI — і тому, що це дозволяє їм краще підготуватися до майбутніх загроз, якщо вони знатимуть, що насувається.
«Ті самі системи, які допомогли зупинити кібератаку, керовану ШІ, тепер можуть допомогти захиститися від мільйонів кібератак щодня, допомагаючи нам виявляти та усувати вразливості до того, як їх використають зловмисники», — сказав цього тижня генеральний директор Hugging Face Клем Деланж у дописі в соціальних мережах.
Пападатос зазначив, що ця вигода часто перебільшена і не означає, «що ми повинні робити небезпечні можливості відкритими».
«Головне, на мою думку, полягає в тому, що ми не повинні просто погоджуватися з тим, що небезпечні можливості легко доступні будь-кому будь-де», — сказав він, підкресливши, що, на його думку, галузь повинна прагнути до того, щоб легкодоступними були лише «добрі можливості». За замовчуванням зловмисники швидше приймають нові інструменти, ніж захисники. Наприклад, група програм-вимагачів може змінити свої методи за тиждень. Лікарня — ні.
При покупці за посиланнями в наших статтях ми можемо отримати невелику комісію. Це не впливає на нашу редакційну незалежність.
Оригінал статті: techcrunch.com
