Claude застосовує невидиме водяне тавро Scarlet Letter

Нова позначка відзначатиме контент, оброблений Claude, включно з людським письмом, яке модель лише відредагувала.

Claude застосовує невидиме водяне тавро Scarlet Letter 1

Компанія Anthropic повідомила, що невдовзі почне додавати водяні знаки до контенту, який обробляється (а не лише генерується!) будь-якою з її моделей. У статті підтримки Anthropic пояснила, що запроваджує машиночитні водяні знаки на виконання вимог AI Act Європейського Союзу. Цей закон зобов’язує усіх постачальників ШІ-систем додавати водяні знаки до аудіо, зображень, текстів та відео, згенерованих або модифікованих штучним інтелектом. Закон стосується будь-яких ШІ-моделей, випущених після 2 серпня, і надає постачальникам пільговий період до грудня 2026 року для оновлення раніше випущених моделей.

Anthropic підтвердила, що надалі всі нові моделі, пропоновані в усьому світі — не лише в ЄС — будуть маркувати контент, згенерований ШІ, “з першого дня”. Текстові виводи “носитимуть вбудовані водяні знаки”, невидимі для користувача, а інші “згенеровані файли включатимуть цифрово підписані метадані походження, де це підтримується”, — зазначила компанія.

Важливо, що Anthropic застосовує підхід “знищити все”, позначаючи водяними знаками весь оброблений контент, де це підтримується, хоча ЄС не вимагає цього для випадків, коли ШІ-система виконує “допоміжну функцію для стандартного редагування” (приклад у рекомендаціях — виправлення граматики) або коли це не “суттєво змінює” текст користувача чи його зміст.

Водяний знак, застосований на рівні моделі, не може розрізнити повне генерування від виправлення коми, тому Claude може поставити позначку саме на контент, який закон мав би залишити без змін. Наскільки ретельно він дійсно додає водяні знаки, стане відомо після того, як Anthropic випустить інструмент виявлення, який можна буде протестувати. Компанія заявила, що планує згодом поділитися деталями щодо виявлення позначок, щоб запропонувати технічну підтримку, яка вимагається законом ЄС.

Anthropic також зазначила, що водяні знаки не працюватимуть на “деяких платформах або функціях”, які їх не підтримують. Для нетекстового контенту Anthropic використовуватиме підхід метаданих C2PA для запису походження.

Легко обійти, легко зрозуміти неправильно

Підхід, описаний ЄС та впроваджений Anthropic, на жаль, є надзвичайно легким для зловмисників, водночас потенційно караючи користувачів, які довіряють системі точне маркування своїх результатів. Текстові водяні знаки працюють шляхом зміщення вибору слів моделлю за схемою, розподіленою по всьому документу, і виявляються лише в сукупності за допомогою правильного інструменту. Проблема полягає в тому, що “невидимий” також може означати, що модель іноді обирає найкраще слово на трохи гірше, лише щоб зберегти сигнал.

Anthropic зазначила, що ці позначки “переміщатимуться разом з текстом при копіюванні та вставці в інше місце, і можуть зберігатися під час деякого редагування”. Але якщо водяний знак тексту буде вставлено в іншу систему чат-ботів, яка редагує текст, водяний знак може бути знищений. Щодо зображень та відео, скріншоти/записи або використання будь-якого пристойного інструменту для редагування метаданих буде достатньо, щоб видалити цю інформацію. І як тільки Anthropic розповість світу, як ідентифікувати ці водяні знаки, створення системи для їх видалення буде тривіальним.

Крім того, потенціал для неправильного тлумачення здається високим; водяний знак не є особливо інформативним. Anthropic пояснила, що “виявлена позначка дає сигнал про те, що контент був оброблений Claude, але не є остаточним”. Єдине справжнє повідомлення, яке надсилає позначка, — це те, що “контент міг бути оброблений Claude”, — зазначила Anthropic, і позначка може навіть з’явитися на контенті, який не був згенерований Claude.

На додаток до цього, є широка громадськість, яка може не розуміти різниці між обробленим текстом і повністю згенерованим текстом. Якщо система ставить водяні знаки на текст, написаний людиною, просто тому, що він був відредагований у робочому процесі, який торкається Claude, раптом він матиме таке ж позначення, як і повністю згенерований текст. І все це в системі, де “відсутність виявленої позначки не означає, що контент не був згенерований або оброблений ШІ”, — сказала Anthropic.

Claude може маркувати більше ШІ-контенту, ніж вимагається

Варто віддати належне Anthropic, компанія визнає, що може маркувати деякий контент, який AI Act не вимагає маркувати: “Люди часто використовують Claude для вичитки, перекладу, узагальнення або конвертації файлів. Результат може містити позначку Claude, навіть якщо вихідні ідеї, текст або дані походять з іншого джерела”. Отже, незважаючи на те, що закон явно звільняє від цього, Claude буде маркувати будь-яку роботу з редагування, виконану над оригінальним текстом.

Якщо водяні знаки стануть універсальним рішенням для будь-якого використання Claude, від перевірки орфографії до повних переписувань, рішення Anthropic, ймовірно, розчарує користувачів, заходячи далі, ніж необхідно, щоб маркувати контент так, що може ненавмисно заплутати походження. Наприклад, вчитель або професор не повинен інтерпретувати цей сигнал водяного знака як щось більше, ніж “ШІ торкнувся цього”, але легко уявити, що вони це зроблять. Зрештою, який сенс у водяному знаку, який не може розрізнити легке редагування та повністю згенерований текст?

Ситуація стає ще більш туманною, коли ми звертаємося до іншого розділу EU AI Act, 50(4), який стосується того, як ті, хто публікує такий текст, повинні чітко маркувати контент. Відповідно до їхнього режиму маркування, повністю згенерований ШІ-текст у більшості випадків не вимагає позначки. Роман, написаний ШІ? Без позначки. Маркетинговий текст, згенерований ШІ? Ні. Але якщо текст призначений “інформувати громадськість з питань, що становлять суспільний інтерес”, його необхідно маркувати, якщо його не переглянув людина-редактор (тобто редактор відомий і несе відповідальність). Отже, ми маємо дивну ситуацію, коли на рівні моделі це “водяний знак на все”, а на рівні публічного розкриття — “вам не потрібно маркувати цей ШІ-текст, якщо Джо його переглянув”.

Ars звернувся до Anthropic, щоб дізнатися, чи є терміни випуску деталей щодо виявлення або результати будь-яких тестів, якими компанія може поділитися, оцінюючи ймовірність хибних негативів чи позитивів. Ми також запитали, чи може Anthropic пояснити, як її водяні знаки можуть суперечити стандартному редагуванню та іншим виняткам з AI Act, але Anthropic надіслала заяву, яка не відповідала на запитання Ars.

“Ми додаємо маркування до виведення Claude відповідно до EU AI Act, і інші лабораторії роблять схожі кроки”, — заявила Anthropic. “Важко ідентифікувати текст, згенерований ШІ, і це дає людям кращі інструменти для ідентифікації. Текст з підтримуваних моделей Claude, включно з виведенням Claude Code, носитиме невидимий водяний знак, і це не змінює змісту, якості чи читабельності відповідей Claude. Ми також плануємо випустити API для виявлення тексту, щоб користувачі могли самостійно більше з цим працювати”.

Веселощі тільки починаються

В ЄС вимоги до прозорості покликані забезпечити, щоб ШІ-інструменти, як-от Claude, не порушували “цілісність та довіру до інформаційної екосистеми, створюючи нові ризики дезінформації та маніпуляцій у великих масштабах, шахрайства, видавання себе за іншу особу та обману споживачів”. Одна зі статей підтримки ЄС передбачала, що зобов’язання будуть “основною проблемою відповідності” для багатьох ШІ-фірм.

“Люди повинні знати, коли вони взаємодіють із ШІ або піддаються впливу контенту, згенерованого ШІ”, — зазначено в рекомендаціях Європейської комісії. “Це допоможе їм приймати обґрунтовані рішення, калібрувати свою довіру та покладатися на ШІ, а також уникати дезінформації чи обману”. Тим не менш, важко узгодити це з тим фактом, що повністю згенерована стаття з питання суспільного інтересу отримує водяний знак, але не позначку для читача, якщо її належним чином переглянув редактор.

ЄС очікує, що ШІ-фірми, як-от Anthropic, найкраще підготовлені до розробки рішень для водяних знаків, оскільки ШІ розвивається швидко, і буде постійна “потреба в нових методах і техніках для відстеження походження інформації”.

Але це значною мірою залишає суспільну цінність таких позначок на розсуд технологічних компаній, причому ЄС лише встановлює, що “методи та техніки мають бути достатньо надійними, сумісними, ефективними та міцними, наскільки це технічно можливо”.

У своїй публікації Anthropic заявила, що планує продовжувати працювати над своїми водяними знаками та методами виявлення, що відповідають вимогам ЄС. Якщо позначки Claude не спрацюють, AI Act передбачає суворі покарання за порушення, включно зі штрафами до 15 мільйонів євро або 3 відсотків річного світового доходу компанії.

Claude застосовує невидиме водяне тавро Scarlet Letter 2

За даними порталу: arstechnica.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *