Claude впровадив невидиме водяне клеймо Scarlet Letter

Нова функція Claude позначатиме будь-який контент, оброблений моделлю, навіть якщо це написаний людиною текст, який лише редагувався.

Claude впровадив невидиме водяне клеймо Scarlet Letter 1

Anthropic незабаром запровадить систему водяних знаків для контенту, обробленого будь-якою з її моделей. У статті підтримки компанія пояснила, що впровадження машиночитних водяних знаків є кроком до виконання вимог Закону про штучний інтелект Європейського Союзу, який зобов’язує всіх постачальників систем ШІ маркувати згенерований або модифікований ШІ аудіо, зображення, текст і відео.

Закон стосується будь-якої моделі ШІ, випущеної після 2 серпня, і надає постачальникам відстрочку до грудня 2026 року для оновлення раніше випущених моделей. Anthropic підтвердила, що всі нові моделі, які пропонуватимуться в усьому світі (не лише в ЄС), маркуватимуть контент, згенерований ШІ, «від першого дня». Вихідні тексти «матимуть вбудовані водяні знаки», невидимі для користувача, а інші «згенеровані файли міститимуть цифрово підписані метадані походження, де це підтримується», — зазначили в Anthropic.

Водяні знаки будуть застосовуватися до всього обробленого контенту, де це можливо, навіть якщо ЄС не вимагає цього для випадків, коли система ШІ виконує «допоміжну функцію для стандартного редагування» (наприклад, виправлення граматики) або коли вона «суттєво не змінює» текст користувача чи його зміст.

Водяний знак, застосований на рівні моделі, не може відрізнити повну генерацію від виправлення коми, тому Claude може позначати контент, який закон призначав залишити без змін. Наскільки ретельно він справді накладатиме водяні знаки, стане відомо після того, як Anthropic випустить інструмент виявлення. Компанія планує згодом поділитися деталями щодо виявлення знаків, щоб надати технічну підтримку, яка вимагається законом ЄС.

Anthropic також зазначила, що водяні знаки не працюватимуть на «деяких платформах або функціях», які їх не підтримують. Для нетекстового контенту Anthropic використовуватиме підхід метаданих C2PA для запису походження.

Легко обійти, легко неправильно зрозуміти

Підхід, описаний ЄС і впроваджений Anthropic, на жаль, надзвичайно легкий для обходу зловмисниками, одночасно караючи користувачів, які довіряють системі точне маркування своїх результатів. Текстові водяні знаки працюють, зміщуючи вибір слів моделі за шаблоном, розподіленим по всьому документу, і виявлення якого можливе лише сукупно за допомогою правильного інструменту. Проблема в тому, що «невидимий» також може означати, що модель іноді обирає краще слово для трохи гіршого, щоб зберегти сигнал.

Anthropic зазначила, що ці знаки «супроводжуватимуть текст при копіюванні та вставці, і можуть зберігатися під час певного редагування». Однак, якщо водяні знаки тексту будуть вставлені в іншу систему чат-ботів, яка редагує текст, водяний знак може бути знищений. Для зображень і відео зняття скріншотів/запису або використання будь-якого пристойного інструменту для редагування метаданих буде достатньо для видалення цієї інформації. А як тільки Anthropic розкриє, як ідентифікувати ці водяні знаки, розробка системи для їх видалення буде тривіальною.

Крім того, існує високий потенціал для неправильного тлумачення; водяний знак не є особливо інформативним. Anthropic пояснила, що «виявлений знак сигналізує про те, що контент був оброблений Claude, але не є остаточним». Єдине реальне повідомлення, яке надсилає знак, — це те, що «контент міг бути оброблений Claude», і знак може навіть з’явитися на контенті, який не був згенерований Claude.

Додатково, існує загальна громадськість, яка може не усвідомлювати різниці між обробленим текстом і повністю згенерованим текстом. Якщо система накладає водяні знаки на текст, написаний людиною, просто тому, що він був відредагований у робочому процесі, який зачіпає Claude, він раптом набуває такого ж значення, як і повністю згенерований текст. І все це в системі, де «відсутність виявленого знака не означає, що контент не був згенерований або оброблений ШІ», — зазначила Anthropic.

Claude може маркувати більше контенту ШІ, ніж вимагається

Слід віддати належне Anthropic, компанія визнає, що може маркувати деякий контент, який Закон про ШІ не вимагає маркувати: «Люди часто використовують Claude для вичитки, перекладу, узагальнення або конвертації файлів. Результат може мати позначку Claude, навіть якщо основні ідеї, текст або дані походять з іншого джерела». Отже, незважаючи на те, що закон явно звільняє від цього, Claude маркуватиме будь-яку редакторську роботу, виконану над оригінальним текстом.

Якщо водяні знаки стануть універсальним рішенням для будь-якого використання Claude, від перевірки орфографії до повних переписувань, рішення Anthropic, ймовірно, розчарує користувачів, виходячи за межі необхідного для маркування контенту способами, які можуть ненавмисно заплутати походження. Вчитель або професор, наприклад, не повинен інтерпретувати цей сигнал водяного знака як щось більше, ніж «ШІ торкнувся цього», але легко уявити, що вони так і зроблять. Зрештою, який сенс у водяному знаку, який не може розрізнити легке редагування від повністю згенерованого тексту?

Ситуація стає ще більш туманною, коли ми звертаємося до іншого розділу Закону про ШІ ЄС, 50(4), який стосується того, як ті, хто публікує такий текст, повинні явно маркувати контент. Згідно з їхньою системою маркування, повністю згенерований текст ШІ в більшості випадків не вимагає маркування. Роман, написаний ШІ? Без маркування. Маркетинговий текст, згенерований ШІ? Ні. Але якщо текст призначений «інформувати громадськість з питань, що становлять суспільний інтерес», його потрібно маркувати, якщо його не переглянув людина-редактор (тобто редактор відомий і несе відповідальність). Отже, ми маємо дивну ситуацію, коли на рівні моделі діє принцип «маркувати все», але на рівні громадського розкриття — «вам не потрібно маркувати цей текст ШІ, якщо Джо його переглянув».

Ars звернувся до Anthropic, щоб дізнатися, чи є терміни випуску деталей щодо виявлення або результатів будь-яких тестів, які компанія може надати, оцінюючи ймовірність хибних спрацьовувань або пропусків. Ми також запитали, чи може Anthropic прояснити, як її водяні знаки можуть суперечити стандартному редагуванню та іншим виняткам із Закону про ШІ, але Anthropic надіслала заяву, яка не відповіла на запитання Ars.

«Ми додаємо маркування до вихідних даних Claude відповідно до Закону про ШІ ЄС, і інші компанії вживають подібних заходів», — заявили в Anthropic. «Важко ідентифікувати текст, згенерований ШІ, і це дає людям кращі інструменти для ідентифікації. Текст із підтримуваних моделей Claude, включаючи вихідні дані Claude Code, матиме невидимий водяний знак, і це не змінює змісту, якості або читабельності відповідей Claude. Ми також плануємо випустити API для виявлення тексту, щоб користувачі могли робити це самостійно».

Розваги тільки починаються

В ЄС вимоги до прозорості покликані гарантувати, що інструменти ШІ, такі як Claude, не порушуватимуть «цілісність та довіру до інформаційного екосистеми, створюючи нові ризики дезінформації та маніпуляцій у великих масштабах, шахрайства, видавання себе за іншу особу та введення споживачів в оману». Одна зі статей підтримки ЄС передбачала, що зобов’язання будуть «основним викликом для відповідності» для багатьох компаній, що займаються ШІ.

«Люди повинні знати, коли вони взаємодіють зі ШІ або піддаються впливу контенту, згенерованого ШІ», — йдеться в посібнику Європейської Комісії. «Це допоможе їм приймати обґрунтовані рішення, калібрувати свою довіру та покладання на ШІ, а також уникати дезінформації чи обману». Проте, важко узгодити це з тим фактом, що повністю згенерована стаття з питань, що становлять суспільний інтерес, отримує водяний знак, але не мітку для читача, якщо її належним чином переглянув редактор.

ЄС очікує, що компанії, що займаються ШІ, такі як Anthropic, найкраще підготовлені до розробки рішень для водяних знаків, оскільки ШІ розвивається швидко, і існуватиме постійна «потреба в нових методах і техніках для відстеження походження інформації».

Однак це значною мірою залишає суспільну цінність таких знаків на розсуд технологічних компаній, причому ЄС лише зазначає, що «методи та техніки повинні бути достатньо надійними, сумісними, ефективними та стійкими, наскільки це технічно можливо».

У своєму повідомленні Anthropic заявила, що планує продовжувати роботу над своїми водяними знаками та методами виявлення, які відповідають вимогам ЄС. Якщо позначки Claude не спрацюють, Закон про ШІ передбачає суворі штрафи за порушення, включаючи штрафи до 15 мільйонів євро або 3 відсотків світового річного доходу компанії.

Головний редактор Ars Кен Фішер сприяв написанню цього звіту. Ця історія була оновлена 13 серпня, щоб додати заяву від Anthropic.

Claude впровадив невидиме водяне клеймо Scarlet Letter 2

Інформація підготовлена на основі матеріалів: arstechnica.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *