Claude приховав водяні знаки Scarlet Letter

Новий функціонал Claude позначатиме контент, оброблений моделями компанії, навіть якщо це був лише редакторський внесок людини.

Claude приховав водяні знаки Scarlet Letter 1

Компанія Anthropic оголосила, що незабаром запровадить водяні знаки для контенту, обробленого будь-якими її моделями, а не лише згенерованого. У статті підтримки Anthropic пояснила, що впроваджує машиночитабельні водяні знаки для відповідності Акту про ШІ Європейського Союзу, який вимагає від усіх постачальників систем ШІ позначати водяними знаками аудіо, зображення, тексти та відео, згенеровані або модифіковані штучним інтелектом. Закон набирає чинності для моделей, випущених після 2 серпня, і надає постачальникам до грудня 2026 року для оновлення раніше випущених моделей.

Anthropic підтвердила, що надалі всі нові моделі, пропоновані глобально, а не лише в ЄС, позначатимуть контент, згенерований ШІ, «від першого дня». Текстові виходи «матимуть вбудовані водяні знаки», невидимі для користувача, а інші «згенеровані файли міститимуть цифрово підписані метадані походження, де це підтримується», – заявила компанія.

Примітно, що Anthropic застосовує підхід «знищити все», позначаючи водяними знаками весь оброблений контент, де це можливо, хоча ЄС не вимагає цього для випадків, коли система ШІ виконує «допоміжну функцію для стандартного редагування» (приклад з інструкції — виправлення граматики) або коли вона «суттєво не змінює» текст користувача чи його зміст.

Водяний знак, застосований на рівні моделі, не може відрізнити повну генерацію від виправлення коми, тому Claude може позначити контент, який закон мав залишити без змін. Наскільки ретельно він насправді наноситиме водяні знаки, стане відомо після того, як Anthropic випустить інструмент виявлення, який можна буде протестувати. Компанія заявила, що планує згодом поділитися деталями щодо виявлення позначок, щоб запропонувати технічну підтримку, яку вимагає закон ЄС.

Anthropic також зазначила, що водяні знаки не працюватимуть на «деяких платформах або функціях», які їх не підтримують. Для нетекстового контенту Anthropic використовуватиме підхід метаданих C2PA для запису походження.

Легко обійти, легко неправильно зрозуміти

Підхід, описаний ЄС та реалізований Anthropic, на жаль, легко обходиться зловмисниками, одночасно потенційно караючи користувачів, які покладаються на систему для точного маркування своїх результатів. Текстові водяні знаки працюють шляхом зміщення вибору слів моделлю за певним шаблоном, розкиданим по всьому документу, який можна виявити лише сукупно за допомогою правильного інструменту. Справа в тому, що «невидимий» може також означати, що модель час від часу замінює найкраще слово на трохи гірше, лише щоб зберегти сигнал.

Anthropic зазначила, що ці позначки «супроводжуватимуть текст під час копіювання та вставки, а також можуть зберігатися після певного редагування». Однак, якщо позначений водяним знаком текст буде вставлено в іншу систему чат-бота, яка редагує текст, водяний знак може бути знищений. Для зображень та відео знімки екрана/записи або використання будь-якого пристойного інструменту редагування метаданих буде достатньо для видалення цієї інформації. І як тільки Anthropic розповість світу, як виявляти ці водяні знаки, створення системи для їх видалення буде тривіальним.

Крім того, потенціал для неправильного тлумачення здається високим; водяний знак не є особливо інформативним. Anthropic пояснила, що «виявлена позначка дає сигнал про те, що контент був оброблений Claude, але не є повністю остаточним». Єдине справжнє повідомлення, яке надсилає позначка, полягає в тому, що «контент міг бути оброблений Claude», і позначка може навіть з’явитися на контенті, який не був згенерований Claude.

До всього цього додається загальна громадськість, яка може не усвідомлювати різницю між обробленим текстом та повністю згенерованим текстом. Якщо система ставить водяні знаки на текст, написаний людиною, просто тому, що він був відредагований у робочому процесі, який торкається Claude, раптом він матиме те саме позначення, що й повністю згенерований текст. І все це в системі, де «відсутність виявленої позначки не означає, що контент не був згенерований або оброблений ШІ», – сказала Anthropic.

Claude може позначати більше контенту ШІ, ніж вимагається

Треба віддати належне Anthropic, компанія визнає, що може позначати певний контент, який Акт про ШІ не вимагає маркувати: «Люди часто використовують Claude для вичитки, перекладу, узагальнення або конвертації файлів. Вихідний текст може нести позначку Claude, навіть якщо основні ідеї, текст або дані походять з іншого джерела». Отже, незважаючи на те, що закон прямо звільняє такі випадки, Claude позначатиме будь-яку редакторську роботу, виконану над оригінальним текстом.

Якщо водяні знаки стануть універсальним засобом для будь-якого використання Claude, від перевірки орфографії до повних переписів, рішення Anthropic, ймовірно, розчарує користувачів, виходячи за межі необхідного для маркування контенту таким чином, що може ненавмисно заплутати його походження. Наприклад, вчитель чи професор не повинні інтерпретувати цей сигнал водяного знака як щось більше, ніж «ШІ торкнувся цього», але легко уявити, що вони будуть. Зрештою, який сенс у водяному знаку, який не може відрізнити легке редагування від повністю згенерованого тексту?

Ситуація стає ще туманнішою, коли ми звертаємося до іншого розділу Акту про ШІ ЄС, 50(4), який стосується того, як ті, хто публікує такий текст, повинні явно маркувати контент. Згідно з їхнім режимом маркування, повністю згенерований текст ШІ у більшості випадків не вимагає маркування. Новий роман, написаний ШІ? Без маркування. Маркетинговий текст, згенерований ШІ? Ні. Але якщо текст призначений «інформувати громадськість з питань, що становлять суспільний інтерес», його потрібно маркувати, якщо його не перегляне людина-редактор (тобто редактор відомий і несе відповідальність). Таким чином, ми маємо дивну ситуацію, коли на рівні моделі це «маркувати все», але на рівні публічного розкриття це «вам не потрібно маркувати цей текст ШІ, якщо Джо його переглянув».

Ars звернувся до Anthropic, щоб дізнатися, чи є терміни випуску деталей щодо виявлення або результатів будь-яких тестів, якими компанія може поділитися, оцінюючи ймовірність помилкових негативних або позитивних результатів. Ми також запитали, чи може Anthropic прокоментувати, як її водяні знаки можуть суперечити стандартному редагуванню та іншим виняткам з Акту про ШІ, але Anthropic надіслала заяву, яка не відповідала на запитання Ars.

«Ми додаємо маркування до вихідних даних Claude відповідно до Акту про ШІ ЄС, і інші лабораторії роблять подібні кроки», — заявила Anthropic. «Важко ідентифікувати текст, згенерований ШІ, і це дає людям кращі інструменти для ідентифікації. Текст з підтримуваних моделей Claude, включно з вихідними даними Claude Code, матиме невидимий водяний знак, і це не змінює значення, якості чи читабельності відповідей Claude. Ми також плануємо випустити API для виявлення тексту, щоб користувачі могли робити більше цього самостійно».

Веселощі тільки починаються

В ЄС вимоги щодо прозорості покликані забезпечити, щоб інструменти ШІ, такі як Claude, не порушували «цілісність та довіру до інформаційної екосистеми, створюючи нові ризики дезінформації та маніпуляцій у масштабі, шахрайства, видавання себе за іншу особу та введення в оману споживачів». Одна стаття підтримки ЄС прогнозувала, що зобов’язання стануть «основним викликом відповідності» для багатьох компаній, що займаються ШІ.

«Люди повинні знати, коли вони взаємодіють з ШІ або стикаються з контентом, згенерованим ШІ», — йдеться в керівних принципах Європейської комісії. «Це допоможе їм приймати обґрунтовані рішення, калібрувати свою довіру та покладатися на ШІ, а також уникати дезінформації чи обману». Тим не менш, важко узгодити це з тим фактом, що повністю згенерована стаття з питань суспільного інтересу отримує водяний знак, але не мітку для читача, якщо її належним чином перегляне редактор.

ЄС очікує, що компанії, що займаються ШІ, такі як Anthropic, будуть найкраще позиціоновані для розробки рішень з водяними знаками, оскільки ШІ розвивається швидко, і буде постійна «потреба в нових методах і техніках для відстеження походження інформації».

Але це значною мірою залишає суспільну цінність таких позначок на розсуд технологічних компаній, причому ЄС лише встановлює, що «методи та техніки повинні бути достатньо надійними, взаємосумісними, ефективними та стійкими, наскільки це технічно можливо».

У своїй публікації Anthropic заявила, що планує продовжувати роботу над своїми водяними знаками та методами виявлення, які відповідають вимогам ЄС. Якщо позначки Claude зазнають невдачі, Акт про ШІ передбачає суворі покарання за порушення, включаючи штрафи до 15 мільйонів євро або 3 відсотків світового річного доходу компанії.

Головний редактор Ars Кен Фішер зробив внесок у цей звіт. Ця історія була оновлена 13 серпня, щоб додати заяву від Anthropic.

Claude приховав водяні знаки Scarlet Letter 2

Ешлі Беленджер

Старший репортер з питань політики

Ешлі — старший репортер з питань політики в Ars Technica, яка відстежує соціальні наслідки нових політик і технологій. Вона журналіст із Чикаго з 20-річним досвідом.

Дізнатися більше на: arstechnica.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *