Маркування позначатиме будь-який контент, оброблений Claude, навіть людський текст, який модель лише редагувала.

Компанія Anthropic повідомила, що невдовзі запровадить систему водяних знаків для контенту, обробленого будь-якою з її моделей, а не лише згенерованого. У статті підтримки Anthropic пояснила, що впроваджує машиночитні водяні знаки відповідно до Акту ЄС про ШІ. Цей закон вимагає від усіх постачальників систем ШІ ставити водяні знаки на аудіо, зображення, текст та відео, згенеровані або змінені штучним інтелектом. Закон застосовується до будь-яких моделей ШІ, випущених після 2 серпня, і надає пільговий період до грудня 2026 року для оновлення раніше випущених моделей.
Anthropic підтвердила, що відтепер усі нові моделі, пропоновані в усьому світі (не лише в ЄС), маркуватимуть контент, згенерований ШІ, “з першого дня”. Текстові вихідні дані “носитимуть вбудовані водяні знаки”, невидимі для користувача, а інші “згенеровані файли міститимуть цифрово підписані метадані походження, де це підтримується”, — заявила компанія.
Примітно, що Anthropic застосовує підхід “знищити все”, наносячи водяні знаки на весь оброблений контент, де це можливо, навіть якщо ЄС не вимагає цього у випадках, коли система ШІ виконує “допоміжну функцію для стандартного редагування” (наприклад, виправлення граматики) або коли вона “суттєво не змінює” текст користувача чи його зміст.
Водяний знак, застосований на рівні моделі, не може відрізнити повну генерацію від виправлення коми, тому Claude може позначити саме той контент, який закон мав би залишити без змін. Наскільки ретельно він справді наноситиме водяні знаки, стане відомо лише після того, як Anthropic випустить інструмент виявлення, який можна буде протестувати. Компанія заявила, що планує згодом поділитися деталями щодо виявлення позначок, щоб запропонувати технічну підтримку, яка вимагається законом ЄС.
Anthropic також зазначила, що водяні знаки не працюватимуть на “деяких платформах або функціях”, які їх не підтримують. Для нетекстового контенту Anthropic використовуватиме підхід метаданих C2PA для запису походження.
Легко обійти, легко неправильно зрозуміти
Підхід, описаний ЄС та впроваджений Anthropic, на жаль, легко обходиться зловмисниками, водночас потенційно караючи користувачів, які довіряють системі точне маркування своїх результатів. Текстові водяні знаки працюють шляхом упередження вибору слів моделлю за певним шаблоном, розподіленим по всьому документу, і виявляються лише в сукупності за допомогою правильного інструменту. Проблема полягає в тому, що “невидимий” може означати, що модель іноді вибирає краще слово замість трохи гіршого, лише щоб зберегти сигнал.
Anthropic зазначила, що ці позначки “будуть переноситися разом з текстом при копіюванні та вставці, і можуть зберігатися при деяких редагуваннях”. Але якщо розмічений текст буде вставлено в іншу систему чат-бота, яка редагує текст, водяний знак може бути знищений. Щодо зображень і відео, скріншоти/записи або будь-який пристойний інструмент для редагування метаданих також достатньо, щоб видалити цю інформацію. І як тільки Anthropic розповість світу, як ідентифікувати ці водяні знаки, створення системи для їх видалення буде тривіальним.
Крім того, існує високий потенціал для неправильного тлумачення; водяний знак не є особливо інформативним. Anthropic пояснила, що “виявлена позначка свідчить про те, що контент був оброблений Claude, але не є повністю остаточним”. Єдине справжнє повідомлення, яке надсилає позначка, це те, що “контент міг бути оброблений Claude”, — сказала Anthropic, і позначка може навіть з’явитися на контенті, який не був згенерований Claude.
На додачу до цього, є широка громадськість, яка може не розуміти різниці між обробленим текстом та повністю згенерованим текстом. Якщо система ставить водяні знаки на текст, написаний людиною, просто тому, що він був відредагований у робочому процесі, який торкається Claude, це раптом несе те саме позначення, що й повністю згенерований текст. І все це в системі, де “відсутність виявленої позначки не означає, що контент не був згенерований або оброблений ШІ”, — зазначила Anthropic.
Claude може маркувати більше ШІ-контенту, ніж вимагається
Варто віддати належне Anthropic, компанія визнає, що може маркувати деякий контент, який Акт про ШІ не вимагає маркувати: “Люди часто використовують Claude для вичитування, перекладу, узагальнення або конвертації файлів. Вихідні дані можуть нести позначку Claude, навіть якщо основні ідеї, текст або дані походять з іншого джерела”. Отже, незважаючи на те, що закон явно звільняє від цього, Claude маркуватиме будь-яку редакторську роботу, виконану над оригінальним письмом.
Якщо водяні знаки стануть універсальним засобом для будь-якого використання Claude, від перевірки орфографії до повних переписувань, рішення Anthropic, ймовірно, розчарує користувачів, виходячи за рамки необхідного для маркування контенту таким чином, що може ненавмисно заплутати походження. Наприклад, вчитель або професор не повинен інтерпретувати цей сигнал водяного знака як щось більше, ніж “ШІ торкнувся цього”, але легко уявити, що вони будуть. Зрештою, який сенс у водяному знаку, який не може відрізнити легке редагування від повністю згенерованого тексту?
Ситуація стає ще більш туманною, коли ми звертаємося до іншого розділу Акту ЄС про ШІ, 50(4), який стосується того, як ті, хто публікує такий текст, повинні явно позначати контент. Відповідно до їхнього режиму маркування, повністю згенерований ШІ-текст у більшості випадків не вимагає позначки. Роман, написаний ШІ? Без позначки. Маркетинговий текст, згенерований ШІ? Ні. Але якщо текст призначений “інформувати громадськість з питань, що становлять суспільний інтерес”, ви повинні позначити його, якщо його не перегляне людина-редактор (тобто редактор відомий і несе відповідальність). Таким чином, ми маємо дивну ситуацію, коли на рівні моделі це “маркувати все”, а на рівні громадського розкриття — “вам не потрібно позначати цей ШІ-текст, якщо Джо його переглянув”.
Ars звернувся до Anthropic, щоб дізнатися, чи є терміни випуску деталей щодо виявлення або результатів будь-яких тестів, якими компанія може поділитися, оцінюючи ймовірність помилкових негативних або позитивних результатів. Ми також запитали, чи може Anthropic прокоментувати, як її водяні знаки можуть конфліктувати зі стандартним редагуванням та іншими винятками з Акту про ШІ, але Anthropic надіслала заяву, яка не відповіла на запитання Ars.
“Ми додаємо маркування до вихідних даних Claude відповідно до Акту ЄС про ШІ, і інші лабораторії вживають подібних кроків”, — сказала Anthropic. “Важко ідентифікувати текст, згенерований ШІ, і це дає людям кращі інструменти для ідентифікації. Текст із підтримуваних моделей Claude, включаючи вихідні дані Claude Code, носитиме невидимий водяний знак, і це не змінює значення, якості чи читабельності відповідей Claude. Ми також плануємо випустити API для виявлення тексту, щоб користувачі могли робити більше цього самостійно”.
Розваги тільки починаються
В ЄС вимоги до прозорості призначені для того, щоб гарантувати, що інструменти ШІ, такі як Claude, не порушують “цілісність та довіру до інформаційної екосистеми, створюючи нові ризики дезінформації та маніпуляцій у великих масштабах, шахрайства, видавання себе за іншу особу та введення споживачів в оману”. У статті підтримки ЄС прогнозувалося, що зобов’язання стануть “першочерговим викликом для відповідності” для багатьох компаній ШІ.
“Люди повинні знати, коли вони взаємодіють із ШІ або піддаються впливу контенту, згенерованого ШІ”, — йдеться в рекомендаціях Європейської комісії. “Це допоможе їм приймати обґрунтовані рішення, калібрувати свою довіру та покладання на ШІ, а також уникати дезінформації чи обману”. Тим не менш, важко узгодити це з фактом, що повністю згенерована стаття з питань суспільного інтересу отримує водяний знак, але не позначку, що відображається читачеві, якщо її належним чином переглянув редактор.
ЄС очікує, що компанії ШІ, такі як Anthropic, будуть найкраще позиціоновані для розробки рішень для водяних знаків, оскільки ШІ розвивається швидко, і буде постійна “потреба в нових методах і техніках для відстеження походження інформації”.
Але це значною мірою залишає суспільну цінність таких позначок на розсуд технологічних компаній, причому ЄС лише зазначає, що “техніки та методи повинні бути достатньо надійними, взаємосумісними, ефективними та міцними, наскільки це технічно можливо”.
У своєму повідомленні Anthropic заявила, що планує продовжувати роботу над своїми водяними знаками та методами виявлення, що відповідають вимогам ЄС. Якщо позначки Claude не спрацюють, Акт про ШІ передбачає суворі штрафи за порушення, включаючи штрафи до 15 мільйонів євро або 3 відсотки світового річного доходу компанії.
Головний редактор Ars Кен Фішер додався до цього звіту. Цю історію було оновлено 13 серпня, щоб додати заяву від Anthropic.

Ешлі Беланжер
Старший репортер з питань політики
Ешлі — старший репортер з питань політики в Ars Technica, яка займається відстеженням соціальних наслідків нових політик та технологій. Вона журналістка з Чикаго з 20-річним досвідом.
За матеріалами: arstechnica.com
