Нова функція Claude позначатиме все, що було оброблено, навіть людське письмо, якщо його відредагував ШІ.
Компанія Anthropic незабаром почне додавати водяні знаки до контенту, обробленого будь-якою з її моделей. У статті підтримки Anthropic пояснила, що впроваджує машинно-читні водяні знаки відповідно до Акту ЄС про ШІ, який вимагає від усіх постачальників систем ШІ позначати водяними знаками аудіо, зображення, текст та відео, створені або модифіковані штучним інтелектом. Закон стосується будь-якої моделі ШІ, випущеної після 2 серпня, і надає пільговий період до грудня 2026 року для оновлення раніше випущених моделей.
Anthropic підтвердила, що надалі всі нові моделі, пропоновані в усьому світі (не тільки в ЄС), позначатимуть контент, створений ШІ, “з першого дня”. Текстові виводи “матимуть вбудовані водяні знаки”, невидимі для користувача, а інші “створені файли включатимуть цифровий підпис метаданих походження, де це підтримується”, — зазначила компанія.
Примітно, що Anthropic застосовує підхід “знищити все” (“nuke it from orbit”), додаючи водяні знаки до всього обробленого контенту, де це можливо, хоча ЄС не вимагає цього для випадків, коли система ШІ виконує “допоміжну функцію для стандартного редагування” (наприклад, виправлення граматики) або коли це не “суттєво змінює” текст користувача чи його значення.
Водяний знак, застосований на рівні моделі, не може відрізнити повне створення контенту від виправлення коми, тому Claude може позначити саме той контент, який закон мав би залишити без змін. Наскільки ретельно він справді додаватиме водяні знаки, стане відомо після того, як Anthropic випустить інструмент для їх виявлення, який можна буде протестувати. Компанія заявила, що планує згодом поділитися деталями щодо виявлення позначок, щоб надати технічну підтримку, яку вимагає закон ЄС.
Anthropic також зазначила, що водяні знаки не працюватимуть на “деяких платформах або функціях”, які їх не підтримують. Для нетекстового контенту Anthropic використовуватиме підхід метаданих C2PA для запису походження.
Легко обійти, легко неправильно зрозуміти
Підхід, описаний ЄС та реалізований Anthropic, на жаль, надзвичайно легко обійти зловмисникам, водночас караючи користувачів, які довіряють системі точне маркування своїх результатів. Текстові водяні знаки працюють шляхом надання переваги вибору слів моделлю за шаблоном, розподіленим по всьому документу, виявленому лише в сукупності за допомогою правильного інструменту. Однак, “невидимий” також може означати, що модель іноді обирає краще слово для трохи гіршого, щоб зберегти сигнал.
Anthropic зазначила, що ці позначки “переміщатимуться разом з текстом при копіюванні та вставці, і можуть зберігатися після деякого редагування”. Але якщо позначений водяним знаком текст буде вставлено в іншу систему чат-ботів, яка редагує текст, водяний знак може бути знищений. Зображення та відеоконтент можна буде видалити за допомогою скріншоту, запису або будь-якого пристойного інструменту редагування метаданих. І як тільки Anthropic розповість світу, як ідентифікувати ці водяні знаки, створення системи для їх видалення буде тривіальним.
Крім того, існує високий потенціал неправильного тлумачення; водяний знак не є особливо інформативним. Anthropic пояснила, що “виявлена позначка свідчить про те, що контент був оброблений Claude, але не є повністю остаточним”. Єдине справжнє повідомлення, яке несе позначка, це те, що “контент міг бути оброблений Claude”, — зазначила Anthropic, і позначка може навіть з’являтися на контенті, який не був створений Claude.
До того ж, є широка громадськість, яка може не усвідомлювати різницю між обробленим текстом та текстом, повністю згенерованим ШІ. Якщо система додає водяні знаки до тексту, написаного людиною, просто тому, що він був відредагований у робочому процесі, який стосується Claude, він раптом матиме те саме позначення, що й текст, повністю згенерований ШІ. І все це в системі, де “відсутність виявленої позначки не означає, що контент не був згенерований або оброблений ШІ”, — заявила Anthropic.
Claude може маркувати більше контенту ШІ, ніж вимагається
Слід віддати належне Anthropic, компанія визнає, що може маркувати деякий контент, який Акт про ШІ не вимагає маркувати: “Люди часто використовують Claude для вичитки, перекладу, узагальнення або конвертації файлів. Результат може нести позначку Claude, навіть якщо основні ідеї, текст або дані походять з іншого джерела”. Отже, незважаючи на те, що закон явно звільняє від цього, Claude позначить будь-яку роботу з редагування, виконану над оригінальним текстом.
Якщо водяні знаки стануть універсальним засобом для будь-якого використання Claude, від перевірки орфографії до повних переписувань, рішення Anthropic, ймовірно, розчарує користувачів, оскільки воно перевищує необхідне для позначення контенту способами, які можуть ненавмисно заплутати походження. Вчитель або професор, наприклад, не повинен інтерпретувати цей сигнал водяного знака як щось більше, ніж “ШІ торкнувся цього”, але легко уявити, що вони так і зроблять. Зрештою, який сенс у водяному знаку, який не може розрізнити легке редагування та повністю згенерований текст?
Ситуація стає ще більш туманною, коли ми звертаємося до іншого розділу Акту ЄС про ШІ, 50(4), який стосується того, як ті, хто публікує такий текст, повинні явно позначати контент. За їхньою системою маркування, текст, повністю згенерований ШІ, в більшості випадків не вимагає позначки. Роман, написаний ШІ? Без позначки. Маркетинговий текст, створений ШІ? Ні. Але якщо текст призначений “інформувати громадськість з питань, що становлять суспільний інтерес”, ви повинні позначити його, якщо його не переглянув людина (тобто редактор відомий і несе відповідальність). Отже, ми маємо дивну ситуацію, коли на рівні моделі це “водяний знак на все”, але на рівні публічного розкриття це “вам не потрібно позначати цей текст ШІ, якщо Джо його переглянув”.
Ars звернувся до Anthropic, щоб дізнатися, чи є терміни випуску деталей щодо виявлення або результати будь-яких тестів, якими компанія може поділитися, оцінюючи ймовірність хибних негативів або позитивів. Ми також запитали, чи може Anthropic прокоментувати, як її водяні знаки можуть суперечити стандартному редагуванню та іншим виняткам з Акту про ШІ, але Anthropic надіслала заяву, яка не відповіла на запитання Ars.
“Ми додаємо маркування до виводів Claude відповідно до Акту ЄС про ШІ, і інші лабораторії роблять подібні кроки”, — заявила Anthropic. “Важко ідентифікувати текст, згенерований ШІ, і це дає людям кращі інструменти для ідентифікації. Текст із підтримуваних моделей Claude, включаючи виводи Claude Code, матиме невидимий водяний знак, і це не змінює значення, якість чи читабельність відповідей Claude. Ми також плануємо випустити API для виявлення тексту, щоб користувачі могли самостійно робити більше цього”.
Розваги тільки починаються
В ЄС вимоги до прозорості покликані гарантувати, що інструменти ШІ, такі як Claude, не порушують “цілісність та довіру до інформаційної екосистеми, створюючи нові ризики дезінформації та маніпуляцій у масштабі, шахрайства, видавання себе за іншу особу та обману споживачів”. Одна зі статей підтримки ЄС передбачала, що зобов’язання будуть “основним викликом для відповідності” для багатьох фірм ШІ.
“Люди повинні знати, коли вони взаємодіють з ШІ або піддаються впливу контенту, створеного ШІ”, — йдеться в рекомендаціях Європейської комісії. “Це допоможе їм приймати обґрунтовані рішення, калібрувати свою довіру та покладання на ШІ, а також уникати дезінформації чи обману”. Однак, важко узгодити це з тим фактом, що повністю згенерована стаття з питань суспільного інтересу отримує водяний знак, але не позначку для читача, якщо редактор належним чином її переглянув.
ЄС очікує, що компанії ШІ, такі як Anthropic, будуть найкраще позиціоновані для розробки рішень для водяних знаків, оскільки ШІ рухається швидко, і буде постійна “потреба в нових методах та техніках для відстеження походження інформації”.
Але це значною мірою залишає суспільну цінність таких позначок на розсуд технологічних компаній, причому ЄС лише встановлює, що “методи та техніки мають бути достатньо надійними, сумісними, ефективними та стійкими, наскільки це технічно можливо”.
У своєму дописі Anthropic заявила, що планує продовжувати роботу над своїми водяними знаками та методами виявлення, які відповідають вимогам ЄС. Якщо позначки Claude зазнають невдачі, Акт про ШІ передбачає суворі покарання за порушення, включаючи штрафи до 15 мільйонів євро або 3 відсотки річного світового доходу компанії.
Оригінал статті: arstechnica.com
