Anthropic планує додавати водяні знаки до тексту, створеного Claude

Anthropic планує додавати водяні знаки до тексту, створеного Claude 1

Незабаром може стати простіше ідентифікувати контент, створений штучним інтелектом, навіть якщо це не типова публікація типу «Це не X, це Y», яку можна зустріти в LinkedIn та інших соціальних мережах.

Як ви, можливо, знаєте, ЄС тепер вимагає від компаній, що надають послуги ШІ на його ринку, маркувати контент, згенерований їхніми системами, щоб його було легше ідентифікувати.

Anthropic та кілька інших великих постачальників послуг ШІ погодилися дотримуватися Кодексу практики ЄС. Anthropic стала однією з перших компаній, яка поділилася деталями щодо впровадження водяних знаків у своїй моделі Claude.

Anthropic планує додавати водяні знаки до тексту, створеного Claude 2

Anthropic також підтвердила, що звичайний користувач не зможе побачити водяний знак.

За словами компанії, це не має жодного практичного впливу на якість чи зміст результатів роботи Claude, включно з креативністю та читабельністю.

Для тих, хто не знає, невидимі водяні знаки та системи відстеження походження вже використовуються для деяких зображень, створених ШІ, і текстовий контент тепер буде реалізовано за схожим принципом, хоча реалізація відрізнятиметься.

Хоча ця зміна впроваджується для відповідності Закону про ШІ ЄС, Anthropic зазначає, що водяний знак буде спочатку застосовуватися до тексту, згенерованого Claude, у всьому світі.

«Ми впроваджуємо водяні знаки глобально з моменту запуску, оскільки у нас ще немає надійного способу обмежувати їх за регіонами», — пояснили в Anthropic у блозі.

Anthropic повідомляє, що майбутні моделі Claude генеруватимуть текст із водяними знаками. Моделі, випущені до 2 серпня 2026 року, підпадають під перехідний період ЄС, і Anthropic працює над додаванням водяних знаків до цих моделей протягом найближчих місяців.

Водяний знак Claude не додає прихованих символів

Anthropic стверджує, що їхня реалізація базується на підході Google DeepMind SynthID-Text і працює під час генерації, з певними винятками.

Як ви, можливо, знаєте, моделі ШІ генерують текст, послідовно обираючи, який токен може бути наступним. Замість додавання символів або модифікації готової відповіді пізніше, водяний знак Claude змінює джерело випадковості, яке використовується під час здійснення деяких із цих виборів.

«Водяні знаки використовують низькоризикові вибори, подібні до цих — які відбуваються багато разів протягом фрагмента згенерованого тексту — щоб залишити шаблон у відповідях Claude. Цей шаблон невидимий для читача, але виявляється будь-ким, хто має ключ, що його кодує», — пояснили в Anthropic.

«Коли використовуються водяні знаки, вибори все ще робляться випадковим чином, але джерело випадковості інше. Замість використання довільного генератора випадкових чисел для вибору наступного слова, водяні знаки використовують ключ та кілька попередніх слів, щоб визначити, яке слово має вибрати модель».

«Тобто, слова, які вибирає Claude, залишаються випадковими, але тепер можна перевірити послідовність слів і побачити, чи вона узгоджується з виборами, які Claude зробила б, якби використовувала ключ. Якщо так, можна призначити ймовірність того, що текст був згенерований Claude».

Я також ознайомився з дослідницькою статтею на цю тему, і ось витяг, який пояснює, як працює генеративний водяний знак:

Генеративний водяний знак працює шляхом ретельного модифікування процедури вибірки наступного токена для введення тонких, контекстно-специфічних модифікацій у розподіл згенерованого тексту. Такі модифікації вводять статистичний підпис у згенерований текст; під час фази виявлення водяного знака підпис може бути виміряний, щоб визначити, чи був текст дійсно згенерований водяним знаком LLM. Ключовою перевагою підходу є те, що процес виявлення не вимагає виконання обчислювально витратних операцій або навіть доступу до базового LLM (який часто є пропрієтарним).

У статті наведено детальніші приклади, але важливо те, що Anthropic не додає видимого маркера чи прихованих символів до відповіді Claude.

Anthropic планує додавати водяні знаки до тексту, створеного Claude 3

Натомість, коли Claude має кілька прийнятних варіантів для подальшої генерації, система водяних знаків використовує секретний ключ та деякі з попередніх слів як частину випадковості для здійснення цього вибору.

Ці окремі вибори мають виглядати для читача абсолютно нормально, але в межах достатньо довгого тексту вони залишають статистичний шаблон.

Детектор, який має ключ Anthropic, може перевірити послідовність слів і визначити, наскільки вона узгоджується з виборами, які Claude зробила б під час використання водяного знака, що дозволяє оцінити ймовірність участі Claude у написанні тексту.

За словами Anthropic, внутрішнє тестування не виявило жодного впливу на креативність, читабельність або зміст відповідей Claude.

Компанія також зазначає, що водяні знаки не вимагають додаткових токенів і мають незначний вплив на швидкість генерації.

«До тексту нічого не додається, і прихованих символів немає», — зазначили в Anthropic. «Водяні знаки не вимагають додаткових токенів і не будуть дорожчими».

Код і фактичні відповіді можуть мати менше водяних знаків

Як я вже згадував, існують певні винятки для водяних знаків, і це з поважних причин.

Для фактичних тверджень, де існує лише одна правильна відповідь, Anthropic зазначає, що водяний знак не заважає вибору.

Аналогічно, той самий принцип застосовується до коду, де заміна одного терміну на інший може зламати вивід.

«Там, де потрібен точний результат — де немає вибору, і щось буде фактично неправильним або частина коду зламається, якщо буде обрано інший термін — водяний знак не застосовується».

«Наприклад, коли модель написала «2 + 2 =», існує дуже чіткий найкращий вибір для наступного токена (якщо модель завершує суму, немає відповіді, яка була б такою ж хорошою, як «4»; якщо вона говорить про «1984» Джорджа Орвелла, немає відповіді, яка була б такою ж хорошою, як «5»), — зазначила компанія.

««Підштовхування» водяного знака тут не застосовуватиметься. З тієї ж причини код — який у багатьох випадках має бути точним — загалом має менше водяних знаків, ніж деякі інші форми тексту».

Anthropic зазначає, що водяні знаки все ще можуть використовуватися в частинах коду, де існують довільні вибори, наприклад, у коментарях, але стверджує, що це матиме незначний вплив на фактичний згенерований код.

Це відповідає дослідницькій статті Google SynthID-Text, де зазначається:

Існують два основних фактори, що впливають на продуктивність виявлення функції оцінки. Перший — це довжина тексту x: довші тексти містять більше доказів водяного знака, тому ми маємо більшу статистичну впевненість при прийнятті рішення. Другий — це кількість ентропії в розподілі LLM під час генерації водяного знака x. Наприклад, якщо розподіл LLM має дуже низьку ентропію, тобто він майже завжди повертає ту саму відповідь на заданий запит, тоді Tournament sampling не може вибрати токени, які набирають вищі бали за функціями g. Коротко кажучи, як і інші генеративні водяні знаки, Tournament sampling працює краще, коли в розподілі LLM більше ентропії, і менш ефективний, коли ентропії менше.

Також варто зазначити, що легке редагування тексту, написаного людиною, може залишити недостатньо матеріалу, згенерованого Claude, для надійного виявлення.

Anthropic стверджує, що водяний знак застосовується лише до слів, які фактично вибирає Claude, тому кілька змін у граматиці чи пунктуації можуть не надати достатньо доказів.

Anthropic зазначає, що переклад, згенерований Claude, містить водяний знак, оскільки Claude вибирає кожне слово в перекладеному виводі.

Anthropic розробляє API для виявлення водяних знаків Claude

Виявляється, з’явиться простіший спосіб виявлення водяних знаків, оскільки Anthropic планує запропонувати API для їх виявлення.

API зможе оцінювати ймовірність участі Claude у написанні тексту, але Anthropic наголошує, що це не те саме, що довести, хто його написав.

Водяний знак Claude також не може визначити, чи був текст написаний іншою моделлю ШІ, оскільки інші постачальники можуть використовувати різні методи водяних знаків та різні ключі.

«Водяний знак може лише визначити, що Claude, ймовірно, брала участь у створенні контенту в певний момент. Він не може відрізнити «Claude написав це» від «Claude це суттєво відредагував».

«Легке редагування, ймовірно, не видалить водяний знак повністю; повний перепис, де замінено кожне слово, — видалить».

Виявлення також стає менш надійним при малих вибірках, оскільки для аналізу детектором є менше виборів слів.

Для згенерованих файлів PNG, JPG і SVG Anthropic застосовує інший підхід.

Claude додаватиме криптографічно підписані метадані C2PA про походження, що вказуватимуть на те, що файл був створений або оброблений за допомогою Claude, замість модифікації самого файлу вбудованим водяним знаком.

Anthropic планує додавати водяні знаки до тексту, створеного Claude 4

Після отримання дійсних облікових даних зловмисники блокуються лише на 37% дій

Загальні показники запобігання можуть приховувати те, що відбувається після початкового доступу. Коли зловмисники використовують дійсні облікові дані, запобігання різко знижується.

The Blue Report 2026 оцінює методи захисту за методами на основі 338 мільйонів симуляцій, проведених у виробничих середовищах клієнтів.

Отримати звіт

Пов’язані статті:

«Видалювачі водяних знаків ШІ» заполонили веб. Майже жоден не може довести свою ефективність.

Claude Fable 5 залишається безкоштовною для платних користувачів до 19 липня, поки Anthropic виграє більше часу

Anthropic каже, що Claude Fable 5 не буде назавжди вилучена з підписок

Перезапуск Claude Fable розчаровує користувачів зниженою продуктивністю

Anthropic випускає Sonnet 5 з продуктивністю, близькою до Opus 4.8, за нижчою ціною

  • AI
  • Anthropic
  • Artificial Intelligence
  • Claude
  • EU
  • Google
  • OpenAI
  • watermark
Mayank Parmar

Mayank Parmar — технологічний підприємець, який зараз здобуває ступінь MBA. На BleepingComputer він висвітлює технологічні новини, зосереджуючись на історіях, пов’язаних з Microsoft та Windows. Він завжди досліджує Windows, шукаючи останні секрети для розкриття.

  • Попередній матеріал
Залишити коментар Правила спільноти

Вам потрібно увійти, щоб залишити коментар

Ще не учасник? Зареєструватися зараз

Вам також може сподобатись:

Anthropic планує додавати водяні знаки до тексту, створеного Claude 5 Наступний вебінар

Anthropic планує додавати водяні знаки до тексту, створеного Claude 6

Популярні історії

  • Anthropic планує додавати водяні знаки до тексту, створеного Claude 7

    Новий експлойт нульового дня Microsoft Defender ‘ShieldBreak’ надає привілеї SYSTEM

  • Anthropic планує додавати водяні знаки до тексту, створеного Claude 8

    Критична вразливість RCE VMware vCenter використовується для доступу до зворотного SSH

  • Anthropic планує додавати водяні знаки до тексту, створеного Claude 9

    Apple надсилає нові сповіщення про загрози щодо атак шпигунського ПЗ від найманців

Спонсорські пости

  • Pixellot виявила та захистила сотні некерованих ідентичностей ШІ-агентів за тижні, а не місяці. Завантажте приклад успіху, щоб дізнатися, як.

  • 91% додатків ШІ з’явилися за 16 місяців. Ознайомтеся зі звітом Material про ризики OAuth.

  • Прострочена перевірка справності паролів? Безкоштовно перевірте свій Active Directory.

  • Зупиніть атаки slopsquatting ШІ. Захистіть індексацію пакетів з відкритим кодом, перш ніж вона потрапить до вашої збірки.

  • Прострочена перевірка справності паролів? Безкоштовно перевірте свій Active Directory.

Наступний вебінар

Anthropic планує додавати водяні знаки до тексту, створеного Claude 10

Слідкуйте за нами:
Основні розділи
  • Новини
  • Вебінари
  • Посібники з вибору VPN
  • Посібники з програмного забезпечення для системних адміністраторів
  • Завантаження
  • Посібники з видалення вірусів
  • Посібники
  • База даних стартапів
  • База даних деінсталяції
  • Глосарій
Спільнота
  • Форуми
  • Правила форуму
  • Чат
Корисні ресурси
  • Посібник для початківців
  • Карта сайту
Компанія
  • Про BleepingComputer
  • Зв’язатися з нами
  • Надішліть нам підказку!
  • Пишіть для BleepingComputer
  • Соціальні мережі та стрічки
  • Журнал змін

Умови використання — Політика конфіденційності — Заява про етику — Розкриття партнерської інформації

Copyright @ 2003 – 2026 Bleeping Computer® LLC — Усі права захищені

Увійти

Інформація підготовлена на основі матеріалів: www.bleepingcomputer.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *