Claude отримав непомітне, але видиме згодом маркування

Маркування позначатиме все, що обробив Claude, навіть людський текст, який він лише відредагував.

Claude отримав непомітне, але видиме згодом маркування 1

Anthropic повідомила, що незабаром маркуватиме контент, який обробляється (а не тільки генерується!) будь-якою з її моделей. У довідковій статті Anthropic пояснила, що запроваджує машинно-зчитувані водяні знаки відповідно до Акту ЄС про ШІ, який вимагає від усіх постачальників систем ШІ маркувати аудіо, зображення, текст та відео, створені або модифіковані ШІ. Закон застосовується до будь-якої моделі ШІ, випущеної після 2 серпня, і надає пільговий період до грудня 2026 року для оновлення раніше випущених моделей.

Anthropic підтвердила, що надалі всі нові моделі, пропоновані в усьому світі — не лише в ЄС — маркуватимуть контент, створений ШІ, «з першого дня». Текстові виходи «міститимуть вбудовані водяні знаки», невидимі для користувача, а інші «створені файли включатимуть цифрово підписані метадані походження, де це підтримується», — заявила Anthropic.

Примітно, що Anthropic застосовує підхід «знищити все», поширюючи водяні знаки на весь оброблений контент, де це можливо, хоча ЄС не вимагає цього для випадків, коли система ШІ виконує «допоміжну функцію для стандартного редагування» (приклад у керівництві — виправлення граматики) або коли вона не «суттєво змінює» текст користувача чи його значення.

Водяний знак, застосований на рівні моделі, не може відрізнити повне генерування від виправлення коми, тому Claude може позначати саме той контент, який закон призначав залишити без змін. Наскільки ретельно він насправді накладає водяні знаки, стане відомо після того, як Anthropic випустить інструмент виявлення, який можна буде протестувати. Компанія заявила, що планує згодом поділитися деталями щодо виявлення відміток, щоб запропонувати технічну підтримку, яку вимагає закон ЄС.

Anthropic також зазначила, що водяні знаки не працюватимуть на «деяких платформах або функціях», які їх не підтримують. Для нетекстового контенту Anthropic використовуватиме підхід метаданих C2PA для запису походження.

Легко обійти, легко неправильно зрозуміти

Підхід, описаний ЄС та реалізований Anthropic, на жаль, легко обійти зловмисникам, водночас потенційно караючи користувачів, які покладаються на систему для точного маркування своїх результатів. Текстові водяні знаки працюють шляхом зміщення вибору слів моделлю за патерном, розподіленим по всьому документу, який можна виявити лише в сукупності за допомогою правильного інструменту. Проблема в тому, що «невидимий» може також означати, що модель іноді обирає найкраще слово для дещо гіршого, лише щоб зберегти сигнал.

Anthropic зазначила, що ці позначки «супроводжуватимуть текст під час копіювання та вставлення в інше місце і можуть зберігатися після деякого редагування». Але якщо маркований текст буде вставлено в іншу систему чат-бота, яка редагує текст, водяний знак може бути знищений. Щодо зображень та відео, скріншоти/записи або будь-який пристойний інструмент для редагування метаданих також буде достатньо для видалення цієї інформації. І як тільки Anthropic розповість світу, як ідентифікувати ці водяні знаки, створення системи для їх видалення буде тривіальним.

Крім того, потенціал для неправильного тлумачення видається високим; водяний знак не є особливо інформативним. Anthropic пояснила, що «виявлена позначка свідчить про те, що контент був оброблений Claude, але не є повністю остаточним». Єдине реальне повідомлення, яке надсилає позначка, це те, що «контент міг бути оброблений Claude», — заявила Anthropic, і позначка може навіть з’явитися на контенті, який не був створений Claude.

Додатково до цього, є широка громадськість, яка може не усвідомлювати різницю між обробленим текстом і повністю створеним текстом. Якщо система ставить водяні знаки на текст, написаний людиною, просто тому, що він був відредагований у робочому процесі, який торкався Claude, це раптом отримує те саме значення, що й повністю створений текст. І все це в системі, де «відсутність виявленої позначки не означає, що контент не був створений або оброблений ШІ», — сказала Anthropic.

Claude може маркувати більше контенту ШІ, ніж вимагається

Треба віддати належне Anthropic, компанія визнає, що може маркувати деякий контент, який Акт про ШІ не вимагає маркувати: «Люди часто використовують Claude для вичитування, перекладу, узагальнення або конвертації файлів. Результат може мати позначку Claude, навіть якщо основні ідеї, текст або дані походять з іншого джерела». Отже, незважаючи на те, що закон явно звільняє від цього, Claude маркуватиме будь-яку редакторську роботу, виконану над оригінальним текстом.

Якщо водяні знаки стануть універсальним рішенням для будь-якого використання Claude, від перевірки орфографії до повних переписувань, рішення Anthropic, ймовірно, розчарує користувачів, надмірно маркуючи контент способами, які можуть ненавмисно заплутати походження. Наприклад, вчитель або професор не повинен інтерпретувати цей сигнал водяного знака як щось більше, ніж «ШІ торкнувся цього», але легко уявити, що вони це зроблять. Зрештою, який сенс у водяному знаку, який не може розрізнити легке редагування та повне генерування тексту?

Ситуація стає ще більш туманною, коли ми звертаємося до іншого розділу Акту ЄС про ШІ, 50(4), який стосується того, як ті, хто публікує такий текст, повинні чітко маркувати контент. Згідно з їхньою системою маркування, повністю створений текст ШІ в більшості випадків не вимагає маркування. Новий роман, написаний ШІ? Без маркування. Маркетингові тексти, створені ШІ? Ні. Але якщо текст призначений «інформувати громадськість з питань, що становлять суспільний інтерес», ви повинні його маркувати, якщо його не переглянув людина-редактор (тобто редактор відомий і несе відповідальність). Отже, ми маємо дивну ситуацію, коли на рівні моделі це «маркувати все», але на рівні громадського розкриття це «вам не потрібно маркувати цей текст ШІ, якщо Джо його переглянув».

Ars звернувся до Anthropic, щоб дізнатися, чи є терміни випуску деталей щодо виявлення або результати будь-яких тестів, якими компанія може поділитися, оцінюючи ймовірність помилкових негативів або позитивів. Ми також запитали, чи може Anthropic пояснити, як її водяні знаки можуть конфліктувати зі стандартним редагуванням та іншими винятками з Акту про ШІ, але Anthropic надіслала заяву, яка не відповіла на запитання Ars.

«Ми додаємо маркування до вихідних даних Claude для дотримання Акту ЄС про ШІ, і інші лабораторії роблять схожі кроки», — заявила Anthropic. «Важко ідентифікувати текст, створений ШІ, і це дає людям кращі інструменти для ідентифікації. Текст із підтримуваних моделей Claude, включаючи вихідні дані Claude Code, матиме невидимий водяний знак, і це не змінює зміст, якість чи читабельність відповідей Claude. Ми також плануємо випустити API для виявлення тексту, щоб користувачі могли робити це самостійно».

Веселощі тільки починаються

У ЄС вимоги щодо прозорості покликані забезпечити, щоб інструменти ШІ, такі як Claude, не порушували «цілісність та довіру до інформаційної екосистеми, створюючи нові ризики дезінформації та маніпуляцій у великих масштабах, шахрайства, видавання себе за іншу особу та обману споживачів». Одна з довідкових статей ЄС прогнозувала, що зобов’язання будуть «основним викликом відповідності» для багатьох компаній ШІ.

«Люди повинні знати, коли вони взаємодіють зі ШІ або піддаються впливу контенту, створеного ШІ», — йдеться в рекомендаціях Європейської комісії. «Це допоможе їм приймати обґрунтовані рішення, калібрувати свою довіру та покладання на ШІ, а також уникати дезінформації чи обману». Проте, важко узгодити це з тим фактом, що повністю створена стаття з питань суспільного інтересу отримує водяний знак, але не маркування для читача, якщо редактор її належним чином переглянув.

Очікується, що компанії ШІ, як Anthropic, будуть найкраще позиціоновані для розробки рішень для водяних знаків, оскільки ШІ рухається швидко, і буде постійна «потреба в нових методах і техніках для відстеження походження інформації».

Але це значною мірою залишає суспільну цінність таких позначок на розсуд технологічних компаній, причому ЄС лише зазначає, що «методи та техніки повинні бути достатньо надійними, взаємосумісними, ефективними та міцними, наскільки це технічно можливо».

У своєму пості Anthropic заявила, що планує продовжувати працювати над своїми водяними знаками та методами виявлення, які відповідають вимогам ЄС. Якщо позначки Claude не спрацюють, Акт про ШІ передбачає суворі штрафи за порушення, включаючи штрафи до 15 мільйонів євро або 3 відсотків світового річного доходу компанії.

Головний редактор Ars Кен Фішер долучився до цього звіту. Цю статтю було оновлено 13 серпня, щоб додати заяву від Anthropic.

Claude отримав непомітне, але видиме згодом маркування 2

Джерело новини: arstechnica.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *