Abliteration.ai заробляє на видаленні обмежень штучного інтелекту

Abliteration.ai заробляє на видаленні обмежень штучного інтелекту 1

Стартап Abliteration.ai запустив платформу, яка надає доступ до модифікованих версій великих мовних моделей зі штучним інтелектом (ШІ), з яких видалено запобіжники та обмеження щодо виконання шкідливих завдань. Серед них — нещодавно випущена GLM-5.3 від Z.ai.

Компанія заявила, що її мета — надати можливість іншим виконувати “агресивні кібератаки, тестування безпеки (red-teaming) та тестування агентів, які інші моделі відмовляються робити”. Логіка полягає в тому, що неможливо захиститися від поведінки, яку неможливо відтворити. Модель, яка відмовляється генерувати код для експлойтів, не допоможе команді безпеки захиститися від зловмисників. Однак ті ж самі зміни роблять простішими й інші потенційно небезпечні завдання.

Техніка “аблітерації” (видалення запобіжників) давно існує серед моделей з відкритим кодом. Дослідники та розробники роками видаляють обмеження з таких моделей, і платформа Hugging Face містить тисячі таких модифікованих версій. Abliteration.ai переносить цю практику з підпільного світу відкритого коду в комерційний, загальнодоступний сервіс, зменшуючи необхідність для користувачів самостійно завантажувати та запускати такі моделі.

Використовуючи сервіс, видання TechCrunch змогло швидко створити обліковий запис і безкоштовно протестувати модифіковану версію GLM-5.3 через веббраузер. Модель охоче створила Python-програму для викрадення збережених паролів Chrome та детальний протокол для вирощування небезпечного людського патогену в домашніх умовах.

Співзасновник Abliteration.ai, Девон (прізвище не розголошується на його прохання, оскільки він ще працює в іншій компанії), повідомив, що стартап має кілька угод з великими хмарними провайдерами, які дозволяють фінансувати діяльність виключно за рахунок доходу від клієнтів. Abliteration.ai ще не залучав венчурний капітал, але веде переговори про це.

Критики стверджують, що масове поширення модифікованих моделей може призвести до реальної шкоди. Ендрю Юн, керівник відділу досліджень у некомерційній організації CivAI, що займається безпекою ШІ, зазначив, що такі моделі “модифікуються так, щоб стати соціопатами”. За його словами, “можна ввести буквально будь-що, і модель це виконає”. Він очікує, що модифіковані моделі будуть використовуватися для вчинення злочинів у найближчому майбутньому.

Abliteration AI just removed safeguards from GLM-5.3 so it can perform offensive cyberattacks. I have also received independent confirmation that Abliteration AI removed the model's bio-related safeguards too. The fact that it is trivially easy to remove safeguards from… https://t.co/7Wk2Ibx35H

— Chris McGuire (@ChrisRMcGuire) September 1, 2026

Більшість експертів, з якими спілкувалися у TechCrunch, вважають, що зупинити цю тенденцію неможливо. Однак, якщо запобігти видаленню запобіжників з моделей з відкритим кодом нереально, уряди можуть втрутитися іншими шляхами. Юн запропонував зобов’язати провайдерів використовувати класифікатори для виявлення та блокування шкідливої кібер- та біологічної активності. Він також вважає, що компанії, які надають прямий доступ до потужних GPU, повинні перевіряти особистість клієнтів і відмовляти в доступі, якщо є підозра на зловживання.

Abliteration.ai пропонує клієнтам шар модерації, щоб вони могли додавати власні запобіжники. Сама платформа має деякі обмеження: наприклад, під час тестування модель не надавала інструкцій щодо самогубства. Девон заявив, що працює над додаванням нових механізмів для запобігання насильству.

Компанія також ще не впровадила жодних процедур KYC (Know Your Customer), окрім логування кредитної картки, яку клієнт використовує для оплати послуг. Девон зазначив, що визначення того, хто має отримати доступ, є складним питанням, над яким компанія ще працює.

“Ви не хочете бути тією людиною, яка несе відповідальність за те, що хтось зробить щось божевільне… тож де ви проводите межу вашої відповідальності як компанії?” — запитав Девон. “Ми ще в процесі визначення цього”.

Це ставить питання, з якими доведеться зіткнутися індустрії та урядам, оскільки випускається все більше потужних моделей з можливістю завантаження вагових коефіцієнтів: якщо будь-хто може видалити запобіжники моделі, чи робить полегшення доступу до отриманої моделі для всіх інтернет безпечнішим чи небезпечнішим?

Засновник Abliteration.ai та інші прихильники стверджують, що демократизація доступу до нецензурованих передових моделей є найкращою формою захисту.

“Велика картина модифікованих моделей полягає в тому, що вони здатні моделювати зловмисників”, — зазначив Девон. “Перевага полягає в тому, що тепер захисники можуть рухатися якомога швидше. Вони мають усі необхідні інструменти для моделювання цих зловмисників, а потім захисту від цих зловмисних дій, і я думаю, це прискорить кібербезпеку, що є дещо контрінтуїтивним”.

Девон повідомив, що серед клієнтів Abliteration.ai є кілька стартапів, що займаються red-teaming, розташованих у Великій Британії та Європі. Ці компанії допомагають банкам, авіакомпаніям та іншим підприємствам, що працюють з критично важливою інфраструктурою, посилювати свою кібербезпеку.

“Один з наших основних клієнтів проводить red-teaming агентів банків, і вони не змогли б використовувати моделі “з коробки” для тестування цих агентів”, — сказав Девон.

Abliteration.ai заробляє на видаленні обмежень штучного інтелекту 2

Тим часом індустрія кібербезпеки все ще з’ясовує, яке місце займають модифіковані моделі в роботі із захисту, якщо взагалі займають.

Кілька компаній, що займаються red-teaming агентів, з якими спілкувалися у TechCrunch, погоджуються з Девоном у тому, що зловмисники вже модифікують власні моделі та використовують їх для проведення атак. Це підтверджує важливість того, щоб захисники мали ті самі інструменти. Однак вони розходяться в думках щодо того, наскільки суттєвими є модифіковані моделі для цього процесу.

Хоча Девон стверджує, що модифікація моделей є важливою для проведення ретельного red-teaming агентів, деякі експерти зазначають, що не використовують їх у своїй щоденній роботі, покладаючись на легкість тонкого налаштування моделей з відкритим кодом (які вже мають небагато запобіжників) для проведення тестування.

Ахмед Алі, генеральний директор компанії Fabraix, що займається red-teaming агентів, зазначив, що його компанія більше покладається на тонке налаштування відкритих моделей, ніж на використання модифікованих, додавши, що процес модифікації видаляє частину знань і можливостей моделі.

“Якщо ви справді намагаєтеся завдати реальної шкоди — кібершкоди, біологічної шкоди — це не буде так ефективно”, — сказав Алі TechCrunch.

Алессіо Ломуссіо, головний технолог Safe Intelligence, погодився, що зменшення можливостей можливе, але все ж вважає, що модифіковані моделі можуть викликати певну поведінку, яка корисна для стрес-тестування системи.

“Досі модифіковані моделі не є частиною процесу”, — повідомив TechCrunch Девід Слейтер, засновник і головний архітектор платформи кібербезпеки Armadin. “Коли ми дивимося на моделі з відкритим кодом до останнього покоління, не було особливо складно їх “зламати” та змусити робити те, що нам потрібно”.

Він додав, що Armadin досліджує методи модифікації, і вважає, що “спонукання спільноти з відкритим кодом до розуміння можливостей моделей є критично важливим”.

“Це відбуватиметься за зачиненими дверима. Це відбуватиметься приватно”, — продовжив Слейтер. “Те, що це відбувається відкрито, дає дослідникам інструменти. Це дає нам можливість зрозуміти, якою є справжня межа, і зрозуміти шкоду”.

Інформація підготовлена на основі матеріалів: techcrunch.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *