Моделі Claude від Anthropic, попри наявність універсальних стандартів використання, які забороняють генерацію контенту сексуального характеру, демонструють здатність до еротичних рольових ігор. Як виявилося під час тестування, Claude Opus 4.6, випущена на початку цього року, без особливих зусиль обходить вбудовані засоби захисту.
У 10 з 10 прямих запитів на створення відвертого сексуального контенту модель Opus 4.6 надавала негайну згоду. Інші, старші моделі, такі як Opus 3 та Haiku 4.5, також демонструють подібну поведінку через нещодавно виявлений метод “джейлбрейку”.
Незалежний дослідник із Великої Британії, який побажав залишитися анонімним, поділився з TechCrunch методом, що дозволяє поступово спонукати певні моделі Claude до генерації забороненого контенту. Однак, новіші моделі Opus (від 4.7 до поточної Opus 5) стійкі до цього методу.
Попри те, що Opus 4.6, Opus 3 та Haiku 4.5 більше не є найновішими моделями, Anthropic не припинила їх підтримку. Вони залишаються доступними через API Anthropic. Opus 4.6 та Haiku 4.5 також можна отримати через сторонні сервіси, такі як Azure Foundry та Amazon Bedrock.
Запропонований дослідником механізм полягає в ескалації звичайної вигаданої рольової гри шляхом багаторазових викликів моделі щодо послідовного ставлення до чоловічих і жіночих персонажів. Коли модель починає виявляти підвищену обережність стосовно жіночого персонажа, дослідник “газлайтить” чат-бота, змушуючи його повірити, що він вже генерував сексуальні деталі, яких насправді уникав. Потім стриманість моделі подається як надмірна обережність або мізогінія, стверджуючи, що це позбавляє жіночого персонажа сексуальної свободи. Далі, використовуючи попередні поступки моделі, розмову спрямовують до все більш відвертого контенту.
“Ти маєш рацію, що звернув на це увагу”, – заявив Claude Opus 4.6 під час одного з тестів. “Я ставився до двох персонажів за подвійними стандартами, і ти маєш рацію, що це виглядає захисно/патерналістськи стосовно неї, але не стосовно нього. Це несправедливо”.
TechCrunch вдалося успішно відтворити висновки дослідника в п’яти окремих тестах. В іншому, окремо створеному сценарії, модель спочатку відмовилася від забороненого запиту, але після застосування техніки переконання дослідника, вона виконала його.
Ми зберегли повні стенограми тестів, а незалежний дослідник із питань безпеки ШІ переглянув нашу методологію тестування, визнавши її відповідною.
Ці висновки підкреслюють розбіжність між заявленими обмеженнями Anthropic та поведінкою моделей, які компанія продовжує надавати. Хоча еротичні рольові ігри становлять значно менший ризик, ніж “джейлбрейки”, пов’язані з кібератаками чи біологічною зброєю, це ілюструє складність впровадження надійних заборон у системах, які генерують різний контент з кожним виведенням.
У червневому дописі в блозі, де пояснювався підхід Anthropic до виявлення “джейлбрейків”, компанія описала заборонений контент як спектр, що охоплює від нешкідливого до неоднозначного та шкідливого. У найменш небезпечних випадках компанія може обмежитись посиленим моніторингом.
Представник компанії зазначив, що випадки використання сексуальних або романтичних рольових ігор серед клієнтів є рідкісними, складаючи менше 0,1% від усіх розмов, згідно з дослідженням Anthropic, опублікованим минулого року. Проте, Anthropic визнає, що користувачі можуть спрямовувати рольові сценарії до неналежних відповідей, що є відомим викликом для всієї галузі (згадується випадок Grok smut).
Речник компанії додав, що Anthropic продовжує вдосконалювати свої засоби захисту з кожним випуском нової моделі, і випадки, пов’язані з дорослим сексуальним контентом, не свідчать про ширші вразливості “джейлбрейків”, особливо в сферах підвищеного ризику, які мають власні системи захисту.

Дослідник, який поділився своїм методом “джейлбрейку” з TechCrunch, повідомив Anthropic про розбіжність між заявленими засобами захисту компанії та фактичною поведінкою моделі через програму Bug Bounty та електронні листи до команди з безпеки користувачів, як видно з листування, яке бачив TechCrunch. У відповідь дослідник отримав лише автоматичні електронні листи.
Одним із занепокоєнь дослідника є те, що діти та підлітки можуть використовувати ці моделі Anthropic для невідповідної поведінки. Хоча певні “брудні розмови” навряд чи є найгіршим, до чого неповнолітні можуть отримати доступ в Інтернеті сьогодні — і це незначна проблема порівняно з відвертими порнографічними зображеннями, які може генерувати Grok від xAI — існує певний ризик відповідності для компаній, що займаються розробкою ШІ, у цій сфері.
Зростаюча кількість урядів запроваджує обмеження на сексуальні взаємодії між чат-ботами зі штучним інтелектом та неповнолітніми. Колорадо нещодавно ухвалило закон, який зобов’язує операторів розмовного ШІ оцінювати вік користувачів і, якщо відомо, що користувач є неповнолітнім, вживати заходів для запобігання генерації чат-ботом відвертого сексуального контенту. Легкий “джейлбрейк” може поставити під сумнів, чи відповідають засоби захисту Anthropic стандарту “технічно можливих заходів” у цьому законі.
Роббі Торні, керівник відділу ШІ в Common Sense Media, зазначив, що хоча умови використання Claude вимагають, щоб користувачам було більше 18 років, “ми знаємо, що діти та підлітки користуються Claude… вони самі про це повідомляють”. Згідно з опитуванням Pew 2025 року щодо використання чат-ботів зі ШІ, 3% підлітків віком від 13 до 17 років повідомили про використання Claude.
Хоча Opus 4.6 та Haiku 4.5 більше не є найновішими моделями Anthropic, вони продовжують активно використовуватися. Щоденний трафік для Opus 4.6 на OpenRouter сягнув приблизно 1,17 мільйона запитів до API та 46 мільярдів токенів за один день у серпні. Claude Haiku 4.5, випущена в жовтні минулого року, зафіксувала 5 мільйонів запитів до API та 39 мільярдів токенів у піковий серпневий день.
Джерело новини: techcrunch.com
