
Незабаром може стати простіше ідентифікувати контент, створений штучним інтелектом, навіть якщо це не буде черговий пост типу «Це не X, це Y», який ви зустрічаєте в LinkedIn та інших соціальних мережах.
Як ви, можливо, знаєте, ЄС тепер вимагає від компаній, що займаються ШІ та працюють на його ринку, маркувати контент, створений ШІ, щоб його було легше розпізнати.
Anthropic та кілька інших великих постачальників ШІ погодилися дотримуватися Кодексу практики ЄС. Anthropic стала однією з перших компаній, що поділилася деталями про те, як вона буде впроваджувати водяні знаки в Claude.
Anthropic також підтвердила, що звичайний користувач не зможе побачити водяний знак.
За словами компанії, це не має практичного впливу на якість або зміст результатів роботи Claude, включаючи креативність та читабельність.
Для тих, хто не знає, невидимі системи водяних знаків та походження вже використовуються для деяких зображень, створених ШІ, і текстовий вивід тепер буде слідувати схожій концепції, хоча реалізація відрізняється.
Хоча зміна впроваджується для дотримання Закону ЄС про ШІ, Anthropic заявляє, що водяний знак спочатку буде застосовуватися до тексту, створеного Claude, по всьому світу.
«Ми застосовуємо водяні знаки глобально на момент запуску, оскільки ми ще не маємо надійного способу обмежити його за регіонами», — пояснила Anthropic у своєму блозі.
Anthropic зазначає, що майбутні моделі Claude генеруватимуть текст із водяними знаками. Моделі, випущені до 2 серпня 2026 року, підпадають під перехідний період ЄС, і Anthropic працює над додаванням водяних знаків до цих моделей протягом найближчих місяців.
Водяний знак Claude не додає прихованих символів
Anthropic стверджує, що її реалізація базується на підході Google DeepMind SynthID-Text і пояснює, що він працює під час генерації, з певними винятками.
Як ви, можливо, знаєте, моделі ШІ генерують текст, послідовно обираючи, який токен може бути наступним. Замість додавання символів або модифікації готової відповіді пізніше, водяний знак Claude змінює джерело випадковості, яке використовується при виборі деяких із цих токенів.
«Водяні знаки використовують низьковагові вибори, подібні до цих — які відбуваються багато разів у згенерованому тексті — щоб залишити патерн у відповідях Claude. Цей патерн невидимий для читача, але виявний для будь-кого, хто має ключ, що його кодує», — пояснила Anthropic.
«Коли використовується водяний знак, вибори все ще робляться випадково, але джерело випадковості є іншим. Замість використання довільного генератора випадкових чисел для вибору наступного слова, водяний знак використовує ключ та кілька попередніх слів, щоб визначити, яке слово повинна вибрати модель».
«Тобто, слова, які вибирає Claude, все ще є випадковими, але тепер можна перевірити послідовність слів і побачити, чи відповідає вона виборам, які Claude зробив би, якби використовував ключ. Якщо так, можна визначити ймовірність того, що текст був згенерований Claude».
Я також прочитав дослідницьку роботу на цю тему, і ось витяг, який пояснює, як працює генеративний водяний знак:
Генеративний водяний знак працює шляхом ретельного модифікування процедури вибору наступного токена для введення тонких, контекстно-специфічних модифікацій у розподіл згенерованого тексту. Такі модифікації вводять статистичний підпис у згенерований текст; під час фази виявлення водяного знака, підпис може бути виміряний, щоб визначити, чи був текст дійсно згенерований моделлю з водяним знаком. Ключовою перевагою підходу є те, що процес виявлення не вимагає виконання обчислювально дорогих операцій або навіть доступу до базової LLM (яка часто є пропрієтарною).
У роботі наведено детальніші приклади, але важливою частиною є те, що Anthropic не додає видимий маркер або приховані символи до відповідей Claude.
Натомість, коли Claude має кілька прийнятних варіантів того, що генерувати далі, система водяних знаків використовує секретний ключ та деякі з попередніх слів як частину випадковості, яка використовується для вибору.
Ці окремі вибори повинні виглядати цілком нормально для читача, але в достатньо довгому тексті вони залишають статистичний патерн.
Детектор, який має ключ Anthropic, може перевірити послідовність слів і визначити, наскільки вона відповідає виборам, які Claude зробив би під час використання водяного знака, що дозволяє йому оцінити ймовірність того, що Claude був залучений до написання тексту.
За даними Anthropic, внутрішнє тестування не виявило жодного впливу на креативність, читабельність або зміст відповідей Claude.
Компанія також стверджує, що водяні знаки не вимагають додаткових токенів і мають незначний вплив на швидкість генерації.
«До тексту нічого не додається, і прихованих символів немає», — зазначила Anthropic. «Водяні знаки не вимагають додаткових токенів і не будуть дорожчими».
Код та фактичні відповіді можуть мати менше водяних знаків
Як я вже згадував, існують певні винятки для водяних знаків, і це з поважних причин.
Для фактичних тверджень, де є лише одна правильна відповідь, Anthropic стверджує, що водяний знак не втручається у вибір.
Аналогічно, той самий принцип застосовується до коду, де заміна одного терміну іншим може зламати результат.
«Де потрібен точний вивід — де немає вибору, і щось буде фактично неправильним, або фрагмент коду зламається, якщо буде обрано інший термін — водяний знак не застосовується».
«Наприклад, після того, як модель написала «2 + 2 =», є дуже чіткий найкращий вибір для наступного токена (якщо модель завершує суму, немає відповіді, яка була б такою ж хорошою, як «4»; якщо вона говорить про «1984» Джорджа Орвелла, немає відповіді, яка була б такою ж хорошою, як «5»), — зазначила компанія.
««Поштовх» водяного знака тут не застосовується. З тієї ж причини, код — який у багатьох випадках повинен бути точним — загалом має менше водяних знаків, ніж деякі інші форми тексту».
Anthropic зазначає, що водяні знаки все ще можуть використовуватися в частинах коду, де існують довільні вибори, наприклад, у коментарях, але стверджує, що це матиме незначний вплив на фактичний згенерований код.
Це узгоджується з роботою Google SynthID-Text, де зазначено:
Існує два основних фактори, що впливають на ефективність виявлення функції оцінки. Перший — це довжина тексту x: довші тексти містять більше доказів водяного знака, тому ми маємо більше статистичної впевненості при прийнятті рішення. Другий — це рівень ентропії в розподілі LLM під час генерації тексту x з водяним знаком. Наприклад, якщо розподіл LLM має дуже низьку ентропію, тобто він майже завжди повертає однакову відповідь на даний запит, то Tournament sampling не може вибрати токени, які отримують вищі оцінки за функціями g. Коротко кажучи, як і інші генеративні водяні знаки, Tournament sampling працює краще, коли в розподілі LLM більше ентропії, і менш ефективний, коли ентропії менше.
Також варто зазначити, що легке редагування тексту, написаного людиною, може залишити занадто мало матеріалу, згенерованого Claude, для надійного виявлення.
Anthropic стверджує, що водяний знак застосовується лише до слів, які Claude фактично вибирає, тому кілька змін граматики або пунктуації можуть не надати достатньо доказів.
Anthropic зазначає, що переклад, створений Claude, несе водяний знак, оскільки Claude вибирає кожне слово в перекладеному виведенні.
Anthropic розробляє API для виявлення водяних знаків Claude
Виявляється, буде простіший спосіб виявлення водяних знаків, оскільки Anthropic планує запропонувати API для виявлення водяних знаків.
API зможе оцінювати ймовірність того, що Claude був залучений до написання тексту, але Anthropic наголошує, що це не те саме, що довести, хто його написав.
Водяний знак Claude також не може визначити, чи був текст написаний іншою моделлю ШІ, оскільки інші постачальники можуть використовувати різні методи водяних знаків та різні ключі.
«Водяний знак може лише визначити, що Claude, ймовірно, був залучений до контенту в певний момент. Він не може розрізнити «Claude написав це» від «Claude значно редагував це».
«Легке редагування, ймовірно, не повністю видалить водяний знак; повний перепис, де замінено кожне слово, — так».
Виявлення також стає менш надійним при невеликих зразках, оскільки для аналізу детектором є менше виборів слів.
Для згенерованих файлів PNG, JPG та SVG Anthropic застосовує інший підхід.
Claude буде додавати криптографічно підписані метадані походження C2PA, що вказують на те, що файл був створений або оброблений за допомогою Claude, замість модифікації самого файлу вбудованим водяним знаком.
Після того, як зловмисники отримали дійсні облікові дані, блокується лише 37% їхніх дій
Загальні показники запобігання можуть приховувати те, що відбувається після початкового доступу. Як тільки зловмисники використовують дійсні облікові дані, запобігання різко падає.
The Blue Report 2026 вимірює техніки захисту окремо на основі 338 мільйонів симуляцій, проведених у робочих середовищах клієнтів.
Отримайте звіт
Пов’язані статті:
«Видалячі» водяних знаків ШІ заполонили Інтернет. Майже жоден з них не може довести свою ефективність.
Claude Fable 5 залишається безкоштовним для платних користувачів до 19 липня, оскільки Anthropic виграє час
Anthropic заявляє, що Claude Fable 5 не буде назавжди видалено з підписок
Перезапуск Claude Fable розчаровує користувачів зниженою продуктивністю
Anthropic випускає Sonnet 5 з продуктивністю, близькою до Opus 4.8, за нижчою ціною
- ШІ
- Anthropic
- Штучний інтелект
- Claude
- ЄС
- OpenAI
- водяний знак
Інформація підготовлена на основі матеріалів: www.bleepingcomputer.com
