Anthropic розробляє водяні знаки для тексту, згенерованого Claude

Незабаром може стати легше ідентифікувати контент, згенерований штучним інтелектом. Європейський Союз вже вимагає від компаній, що надають послуги ШІ на його ринку, позначати такий контент для полегшення ідентифікації.

Компанія Anthropic та низка інших великих постачальників ШІ погодилися дотримуватися Кодексу належної практики ЄС. Anthropic стала однією з перших компаній, яка поділилася деталями впровадження водяних знаків у своєму продукті Claude.

Anthropic розробляє водяні знаки для тексту, згенерованого Claude 1

Anthropic також підтвердила, що звичайний користувач не зможе побачити водяний знак. За словами компанії, це не впливає на якість або зміст вихідних даних Claude, зокрема на креативність та читабельність.

Системи невидимих водяних знаків та відстеження походження вже використовуються для деяких зображень, згенерованих ШІ, і текстовий контент тепер слідуватиме подібній концепції, хоча реалізація відрізняється.

Хоча зміни впроваджуються для відповідності Акту про ШІ ЄС, Anthropic зазначає, що водяний знак спочатку буде застосовуватися до тексту, згенерованого Claude, по всьому світу. “Ми застосовуємо водяні знаки глобально при запуску, оскільки ще не маємо надійного способу обмежувати їх за регіонами”, — пояснила Anthropic у блозі.

Майбутні моделі Claude генеруватимуть текст із водяними знаками. Моделі, випущені до 2 серпня 2026 року, підпадають під перехідний період ЄС, і Anthropic працює над додаванням водяних знаків до них протягом найближчих місяців.

Водяний знак Claude не додає прихованих символів

Anthropic заявляє, що їхня реалізація базується на підході Google DeepMind SynthID-Text і працює під час генерації, з певними винятками. Моделі ШІ генерують текст, послідовно вибираючи наступний токен. Замість додавання символів або модифікації завершеної відповіді, водяний знак Claude змінює джерело випадковості, яке використовується під час деяких із цих виборів.

“Водяні знаки використовують низьковагові вибори, подібні до цих — які відбуваються багато разів протягом згенерованого тексту — щоб залишити шаблон у відповідях Claude. Цей шаблон непомітний для читача, але виявляється для будь-кого, хто має ключ, що його кодує”, — пояснила Anthropic.

“Коли використовується водяний знак, вибори все ще робляться випадково, але джерело випадковості інше. Замість використання довільного генератора випадкових чисел для вибору наступного слова, водяний знак використовує ключ і кілька попередніх слів, щоб визначити, яке слово має вибрати модель.”

“Тобто, слова, які вибирає Claude, все ще випадкові, але тепер можна перевірити послідовність слів і побачити, чи відповідає вона виборам, які Claude зробив би, якби використовував ключ. Якщо так, можна призначити ймовірність того, що текст був згенерований Claude.”

Дослідницька робота з цієї теми пояснює, як працює генеративний водяний знак:

Генеративний водяний знак працює шляхом ретельного модифікування процедури вибору наступного токена для введення тонких, контекстно-залежних модифікацій у розподіл згенерованого тексту. Такі модифікації вводять статистичний підпис у згенерований текст; під час фази виявлення водяного знака, підпис можна виміряти, щоб визначити, чи був текст дійсно згенерований водяним знаком LLM. Ключовою перевагою підходу є те, що процес виявлення не вимагає виконання обчислювально дорогих операцій або навіть доступу до базового LLM (який часто є пропрієтарним).

Anthropic не додає видимий маркер чи приховані символи до відповіді Claude. Натомість, коли Claude має кілька можливих варіантів для генерації наступного елемента, система водяних знаків використовує секретний ключ та кілька попередніх слів як частину випадковості для вибору. Ці окремі вибори мають виглядати цілком нормально для читача, але в достатньо довгому тексті вони залишають статистичний шаблон.

Anthropic розробляє водяні знаки для тексту, згенерованого Claude 2
Дослідницька робота Google пояснює, як працює водяний знак

Детектор, який має ключ Anthropic, може аналізувати послідовність слів і визначати, наскільки вона відповідає виборам, які Claude зробив би під час використання водяного знака, що дозволяє оцінити ймовірність того, що Claude брав участь у написанні тексту.

За словами Anthropic, внутрішнє тестування не виявило жодного впливу на креативність, читабельність або зміст відповідей Claude. Компанія також зазначає, що водяні знаки не вимагають додаткових токенів і мають незначний вплив на швидкість генерації. “До тексту нічого не додається, і прихованих символів немає”, — зазначила Anthropic. “Водяні знаки не вимагають додаткових токенів і не будуть дорожчими”.

Код та фактичні відповіді можуть мати менше водяних знаків

Існують певні винятки з застосування водяних знаків, і це обґрунтовано. Для фактичних тверджень, де існує лише одна правильна відповідь, Anthropic стверджує, що водяний знак не впливає на вибір. Аналогічно, той самий принцип застосовується до коду, де заміна одного терміну іншим може зламати вихідні дані.

“Там, де потрібен точний вивід — де немає вибору, і щось буде фактично неправильним або шматок коду зламається, якщо буде вибрано інший термін — водяний знак не застосовується.”

“Наприклад, після того, як модель написала ‘2 + 2 =’, існує дуже чіткий найкращий вибір для наступного токена (якщо модель завершує додавання, немає відповіді, яка була б настільки ж хорошою, як ‘4’; якщо вона говорить про ‘1984’ Джорджа Орвелла, немає відповіді, яка була б настільки ж хорошою, як ‘5’), — зазначила компанія. — ‘Підштовхування’ водяного знака тут не застосовується. З тієї ж причини, код — який у багатьох випадках має бути точним — загалом має менше водяних знаків, ніж деякі інші форми тексту.”

Anthropic зазначає, що водяні знаки все ще можуть використовуватися в частинах коду, де існують довільні вибори, наприклад, у коментарях, але це має незначний вплив на фактично вироблений код.

Це узгоджується з дослідженням Google SynthID-Text, яке зазначає:

Існує два основні фактори, що впливають на продуктивність виявлення функції оцінювання. Перший — це довжина тексту x: довші тексти містять більше доказів водяного знака, тому ми маємо більше статистичної впевненості при прийнятті рішення. Другий — це ступінь ентропії в розподілі LLM під час генерації водяного тексту x. Наприклад, якщо розподіл LLM має дуже низьку ентропію, тобто він майже завжди повертає однакову відповідь на заданий запит, то Tournament sampling не може вибрати токени, які отримують вищі оцінки за функціями g. Коротко кажучи, як і інші генеративні водяні знаки, Tournament sampling працює краще, коли в розподілі LLM більше ентропії, і менш ефективний, коли ентропії менше.

Також варто зазначити, що легке редагування тексту, написаного людиною, може залишити недостатньо матеріалу, згенерованого Claude, для надійного виявлення. Anthropic стверджує, що водяний знак застосовується лише до слів, які Claude фактично вибирає, тому кілька змін граматики або пунктуації можуть не надати достатньо доказів. Переклад, створений Claude, несе водяний знак, оскільки Claude вибирає кожне слово в перекладеному виводі.

Anthropic створює API для виявлення водяних знаків Claude

Незабаром з’явиться простіший спосіб виявлення водяних знаків, оскільки Anthropic планує запропонувати API для їх виявлення. API зможе оцінювати ймовірність того, що Claude брав участь у написанні тексту, але Anthropic наголошує, що це не те саме, що довести, хто його написав. Водяний знак Claude також не може ідентифікувати, чи був текст написаний іншою моделлю ШІ, оскільки інші постачальники можуть використовувати різні методи водяних знаків та різні ключі.

“Водяний знак може лише визначити, що Claude, ймовірно, брав участь у створенні контенту в певний момент. Він не може відрізнити ‘Claude написав це’ від ‘Claude це сильно редагував’.”

“Легке редагування, ймовірно, не повністю видалить водяний знак; повне переписування, де кожне слово замінено, — видалить.”

Виявлення також стає менш надійним при малих вибірках, оскільки детектору потрібно аналізувати менше варіантів слів.

Для згенерованих файлів PNG, JPG та SVG Anthropic використовує інший підхід. Claude додаватиме криптографічно підписані метадані C2PA щодо походження, що вказують на те, що файл був створений або оброблений за допомогою Claude, замість модифікації самого файлу вбудованим водяним знаком.

Anthropic розробляє водяні знаки для тексту, згенерованого Claude 3

Після отримання дійсних облікових даних блокується лише 37% дій зловмисників

Загальні показники запобігання можуть приховувати те, що відбувається після початкового доступу. Коли зловмисники використовують дійсні облікові дані, запобігання різко знижується.

The Blue Report 2026 вимірює техніки захисту на основі 338 мільйонів симуляцій, проведених у виробничих середовищах клієнтів.

Подробиці можна знайти на сайті: www.bleepingcomputer.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *