Компанія Anthropic опублікувала блог, в якому спробувала відповісти на поширені запитання щодо того, як буде відбуватися накладання водяних знаків на текст, згенерований її чат-ботом Claude. Зокрема, як саме працюватиме цей механізм, чи можна його приховати редагуванням, і як це вплине на програмний код.
Користувачі Claude обговорюють це рішення з моменту, коли компанія цього тижня оголосила про впровадження водяних знаків для відповідності EU AI Act’s Transparency Code. Цей акт вимагає від компаній, що розробляють ШІ, використовувати системи, які дозволяють ідентифікувати контент, створений штучним інтелектом.
На платформі Reddit один з користувачів назвав це «змовою проти невинних користувачів Claude», тоді як інший стверджував: «Єдина причина, чому ви не хочете цього, — це обманювати людей». Видання Business Insider повідомляє, що «десятки» користувачів у соцмережі X заявили про скасування своїх підписок на Claude через це нововведення.
У своєму новому дописі Anthropic починає з загального огляду концепції водяних знаків. Компанія пояснює, що під час «несуттєвих виборів», як-от вибір між словами «похмуро» та «сіро» для опису погоди, Claude може створювати в своїх відповідях певний патерн. Цей патерн «непомітний для читача, але може бути виявлений будь-ким, хто має ключ для його розшифровки».
«Водяні знаки не впливають на якість виведення Claude», — заявила компанія. «Для читача відповідь з водяним знаком не відрізняється від відповіді без нього».
Конкретніше, Anthropic зазначила, що використовуватиме підхід SynthID-Text, який команда Google DeepMind представила у 2024 році. Компанія також планує випустити API для виявлення водяних знаків. Варто зазначити, що водяні знаки відрізняються від методів виявлення ШІ, які пропонують такі компанії, як Pangram. Останні шукають у тексті певні «ознаки» (наприклад, конструкцію «це не [X], а [Y]»), щоб виявити використання ШІ. «Виявлення цих патернів принципово відрізняється від перевірки наявності водяного знака», — підкреслюється в повідомленні.
Чи можна приховати водяний знак, просто переписавши текст? Anthropic відповідає, що це можливо, але «легке редагування, ймовірно, не усуне водяний знак повністю», тоді як «повний перепис, де кожне слово замінено, зробить це».
«У останньому випадку, звичайно, можна сперечатися, чи можна взагалі називати цей текст згенерованим ШІ», — зауважила компанія.
Щодо можливості виявлення водяного знака в тексті, який був лише вичитаний або відредагований Claude, Anthropic зазначила, що це залежатиме від «довжини тексту та наскільки інтенсивно Claude його редагував». Якщо редагування було незначним, «майже всі слова» будуть написані людиною-автором, і «залишиться дуже мало (якщо взагалі щось) для прикріплення водяного знака».
Програмний код, натомість, матиме менше водяних знаків, ніж інший текст. Це пов’язано з тим, що моделі потрібно буде створювати робочий код, і вона не матиме свободи вибору між різними однаково валідними варіантами.
«Тим не менш, у тих місцях, де існує довільний вибір між конкретними словами чи термінами в коді, може використовуватися водяний знак, наприклад, у коментарях до коду», — зазначила Anthropic. «Але за визначенням, це матиме незначний вплив на сам вироблений код».
Anthropic також повідомила, що Claude не буде єдиним чат-ботом зі штучним інтелектом, який генеруватиме текст з водяними знаками, оскільки «інші великі розробники моделей підписали той самий Кодекс практики та впроваджуватимуть власні водяні знаки».
Оригінал статті: techcrunch.com
