Нова функція Claude позначатиме все, що оброблено моделлю, навіть людський текст, який лише редагувався.
Anthropic повідомила, що незабаром запровадить водяні знаки для контенту, обробленого будь-якими її моделями. У статті підтримки компанія пояснила, що впроваджує машинно-читні водяні знаки для дотримання вимог Акту ЄС про ШІ, який зобов’язує всіх постачальників систем ШІ позначати водяними знаками аудіо, зображення, текст та відео, згенеровані або змінені штучним інтелектом. Закон застосовується до будь-яких моделей ШІ, випущених після 2 серпня, і надає пільговий період до грудня 2026 року для оновлення раніше випущених моделей.
Anthropic підтвердила, що надалі всі нові моделі, пропоновані глобально, а не лише в ЄС, позначатимуть контент, згенерований ШІ, “з першого дня”. Текстові вихідні дані “міститимуть вбудовані водяні знаки”, невидимі для користувача, а інші “згенеровані файли включатимуть цифровий підпис метаданих походження, де це підтримується”, – заявили в Anthropic.
Варто зазначити, що Anthropic застосовує підхід “знищити все”, позначаючи водяними знаками весь оброблений контент, де це можливо, хоча ЄС не вимагає цього для випадків, коли система ШІ виконує “допоміжну функцію для стандартного редагування” (приклад у керівництві – виправлення граматики) або коли це не “суттєво змінює” текст чи його значення.
Водяний знак, застосований на рівні моделі, не може відрізнити повне генерування від виправлення коми, тому Claude може позначити саме той контент, який закон мав залишити поза увагою. Наскільки ретельно він справді ставить водяні знаки, стане відомо лише після того, як Anthropic випустить інструмент виявлення, який можна буде протестувати. Компанія заявила, що планує згодом надати деталі про способи виявлення позначок, щоб запропонувати технічну підтримку, яку вимагає закон ЄС.
Anthropic також зазначила, що водяні знаки не працюватимуть на “деяких платформах або функціях”, які їх не підтримують. Для нетекстового контенту Anthropic використовуватиме підхід метаданих C2PA для запису походження.
Легко обійти, легко неправильно зрозуміти
Підхід, описаний ЄС та впроваджений Anthropic, на жаль, є тривіально простим для зловмисників, одночасно караючи користувачів, які довіряють системі точне маркування своїх вихідних даних. Текстові водяні знаки працюють шляхом зміщення вибору слів моделлю за шаблоном, розподіленим по всьому документу, який виявляється лише в сукупності за допомогою правильного інструменту. Проблема в тому, що “невидимий” також може означати, що модель іноді замінює найкраще слово на трохи гірше, лише щоб зберегти сигнал.
Anthropic зазначила, що ці позначки “супроводжуватимуть текст під час копіювання та вставки, а також можуть зберігатися після певного редагування”. Але якщо водяний текст буде вставлено до іншої системи чат-бота, яка редагує текст, водяний знак може бути знищений. У випадку з зображеннями та відео, скріншоти/записи або будь-який пристойний інструмент для редагування метаданих буде достатньо, щоб видалити цю інформацію. І як тільки Anthropic розповість світу, як ідентифікувати ці водяні знаки, створення системи для їх видалення буде тривіальним.
Крім того, високим є потенціал для неправильного тлумачення; водяний знак не є особливо інформативним. Anthropic пояснила, що “виявлена позначка сигналізує про те, що контент був оброблений Claude, але не є повністю остаточним”. Єдине реальне повідомлення, яке надсилає позначка, це те, що “контент міг бути оброблений Claude”, і позначка може навіть з’явитися на контенті, який не був згенерований Claude.
На додаток до цього, існує загальна громадськість, яка, можливо, не розуміє різниці між обробленим текстом та повністю згенерованим текстом. Якщо система ставить водяні знаки на текст, написаний людиною, лише тому, що він був відредагований у робочому процесі, який торкався Claude, раптом він матиме те саме позначення, що й повністю згенерований текст. І все це в системі, де “відсутність виявленої позначки не означає, що контент не був згенерований або оброблений ШІ”, – заявила Anthropic.
Claude може маркувати більше контенту ШІ, ніж вимагається
Варто віддати належне Anthropic, компанія визнає, що вона може маркувати деякий контент, який Акт про ШІ не вимагає маркувати: “Люди часто використовують Claude для вичитки, перекладу, узагальнення або конвертації файлів. Вихідні дані можуть мати позначку Claude, навіть якщо основні ідеї, текст або дані походять з іншого джерела”. Отже, незважаючи на те, що закон явно звільняє такі дії, Claude позначатиме будь-яку редакторську роботу над оригінальним текстом.
Якщо водяні знаки стануть універсальним рішенням для будь-якого використання Claude, від перевірки орфографії до повних переписувань, рішення Anthropic, ймовірно, розчарує користувачів, виходячи за межі необхідного для позначення контенту так, що це може ненавмисно заплутати походження. Наприклад, викладач чи професор не повинен інтерпретувати цей сигнал водяного знака як щось більше, ніж “ШІ доторкнувся до цього”, але легко уявити, що вони це зроблять. Зрештою, який сенс у водяному знаку, який не може розрізнити легке редагування та повністю згенерований текст?
Ситуація стає ще більш туманною, коли ми звертаємося до іншої частини Акту ЄС про ШІ, 50(4), яка стосується того, як ті, хто публікує такий текст, повинні чітко позначати контент. Згідно з їхнім режимом маркування, повністю згенерований текст ШІ в більшості випадків не потребує маркування. Роман, написаний ШІ? Без маркування. Маркетинговий текст, згенерований ШІ? Ні. Але якщо текст призначений “інформувати громадськість з питань суспільного інтересу”, ви повинні його маркувати, якщо його не переглянув людина-редактор (тобто редактор відомий і несе відповідальність). Отже, ми маємо дивну ситуацію, коли на рівні моделі це “позначити все”, але на рівні громадського розкриття це “вам не потрібно маркувати цей текст ШІ, якщо Джо його переглянув”.
Ars звернувся до Anthropic, щоб дізнатися, чи є терміни для оприлюднення деталей щодо виявлення, або чи може компанія поділитися результатами будь-яких тестів, що оцінюють ймовірність помилкових негативів чи позитивів. Ми також запитали, чи може Anthropic пояснити, як її водяні знаки можуть конфліктувати зі стандартним редагуванням та іншими винятками з Акту про ШІ, але Anthropic надіслала заяву, яка не відповідала на запитання Ars.
“Ми додаємо маркування до вихідних даних Claude для дотримання Акту ЄС про ШІ, і інші компанії вживають подібних заходів”, – заявили в Anthropic. “Важко ідентифікувати текст, згенерований ШІ, і це дає людям кращі інструменти для ідентифікації. Текст із підтримуваних моделей Claude, включаючи вихідні дані Claude Code, матиме невидимий водяний знак, і це не змінює значення, якість чи читабельність відповідей Claude. Ми також плануємо випустити API для виявлення тексту, щоб користувачі могли робити це самостійно”.
Веселощі тільки починаються
В ЄС вимоги до прозорості покликані гарантувати, що інструменти ШІ, такі як Claude, не порушать “цілісність та довіру до інформаційної екосистеми, створюючи нові ризики дезінформації та маніпуляцій у великих масштабах, шахрайства, видавання себе за іншу особу та обману споживачів”. Одна зі статей підтримки ЄС прогнозувала, що зобов’язання стануть “основним викликом для дотримання” для багатьох компаній ШІ.
“Люди повинні знати, коли вони взаємодіють зі ШІ або піддаються впливу контенту, згенерованого ШІ”, – йдеться в керівництві Європейської Комісії. “Це допоможе їм приймати обґрунтовані рішення, калібрувати свою довіру та покладання на ШІ, а також уникати дезінформації чи обману”. Тим не менш, важко узгодити це з тим фактом, що повністю згенерована стаття з питань суспільного інтересу отримує водяний знак, але не мітку для читача, якщо редактор її належним чином переглянув.
ЄС очікує, що компанії ШІ, такі як Anthropic, будуть найкраще підготовлені для розробки рішень для водяних знаків, оскільки ШІ рухається швидко, і існуватиме постійна “потреба в нових методах та техніках для відстеження походження інформації”.
Але це значною мірою залишає суспільну цінність таких позначок на розсуд технологічних компаній, при цьому ЄС лише встановлює, що “методи та техніки повинні бути достатньо надійними, сумісними, ефективними та міцними, наскільки це технічно можливо”.
У своїй публікації Anthropic заявила, що планує продовжувати роботу над водяними знаками та методами виявлення, які відповідають вимогам ЄС. Якщо позначки Claude не спрацюють, Акт про ШІ передбачає суворі штрафи за порушення, включаючи штрафи до 15 мільйонів євро або 3 відсотки світового річного доходу компанії.
Ashley Belanger Senior Policy Reporter
За даними порталу: arstechnica.com
