Нова функція Claude позначить будь-який контент, оброблений моделлю, навіть написане людиною, якщо воно було відредаговане.
Anthropic невдовзі запровадить позначку для контенту, який обробляється (а не лише генерується) будь-якою з її моделей. У статті підтримки компанія пояснила, що впроваджує машинно-читні водяні знаки для дотримання вимог Закону про штучний інтелект Європейського Союзу. Цей закон вимагає від усіх постачальників систем ШІ наносити водяні знаки на аудіо, зображення, тексти та відео, створені або модифіковані ШІ. Норма застосовується до будь-яких моделей ШІ, випущених після 2 серпня, та надає пільговий період до грудня 2026 року для оновлення раніше випущених моделей.
Anthropic підтвердила, що відтепер усі нові моделі, пропоновані глобально (не лише в ЄС), позначатимуть контент, згенерований ШІ, «з першого дня». Текстові виводи «матимуть вбудовані водяні знаки», невидимі для користувача, а інші «згенеровані файли включатимуть цифрово підписані метадані походження, де це підтримується», — заявили в компанії.
Важливо зазначити, що Anthropic застосовує підхід «знищити все», наносячи водяні знаки на весь оброблений контент, де це можливо, хоча ЄС не вимагає цього у випадках, коли система ШІ виконує «допоміжну функцію для стандартного редагування» (приклад у керівництві — коректура граматики) або коли це «істотно не змінює» текст користувача чи його зміст.
Водяний знак, застосований на рівні моделі, не може відрізнити повну генерацію від виправлення коми, тому Claude може позначити контент, який закон мав би залишити без змін. Наскільки ретельно він справді наноситиме водяні знаки, стане відомо після того, як Anthropic випустить інструмент виявлення для тестування. Компанія зазначила, що планує згодом поділитися деталями щодо виявлення позначок, щоб надати технічну підтримку, яка вимагається законом ЄС.
Anthropic також зауважила, що водяні знаки не працюватимуть на «деяких платформах або функціях», які їх не підтримують. Для нетекстового контенту Anthropic використовуватиме підхід метаданих C2PA для запису походження.
Легко обійти, легко зрозуміти неправильно
Підхід, описаний ЄС та впроваджений Anthropic, на жаль, легко обходиться зловмисниками, водночас потенційно караючи користувачів, які покладаються на систему для точного маркування своїх виводів. Текстові водяні знаки працюють шляхом зміщення вибору слів моделлю за певним шаблоном, поширеним по всьому документу, який можна виявити лише в сукупності за допомогою правильного інструменту. Проблема в тому, що «невидимий» може також означати, що модель іноді обирає трохи гірше слово, аби зберегти сигнал.
Anthropic зазначила, що ці позначки «переходитимуть разом з текстом під час копіювання та вставлення, і можуть зберігатися після певного редагування». Але якщо позначений водяним знаком текст буде вставлено до іншої системи чат-бота, яка редагує текст, водяний знак може бути знищений. Зображення та відеоконтент також можна видалити шляхом скріншоту/запису або за допомогою будь-якого пристойного інструменту для редагування метаданих. А коли Anthropic розповість світу, як ідентифікувати ці водяні знаки, створення системи для їх видалення буде тривіальним.
Крім того, існує високий потенціал непорозумінь; водяний знак не є особливо інформативним. Anthropic пояснила, що «виявлена позначка сигналізує про те, що контент був оброблений Claude, але не є повністю остаточним». Єдине справжнє повідомлення, яке надсилає позначка, це те, що «контент міг бути оброблений Claude», і позначка може з’явитися навіть на контенті, який не був згенерований Claude.
До того ж, є загальна громадськість, яка може не розуміти різниці між обробленим текстом і повністю згенерованим. Якщо система наносить водяні знаки на текст, написаний людиною, просто тому, що він був відредагований у робочому процесі, що зачіпає Claude, він раптом набуває того ж значення, що й повністю згенерований текст. І все це в системі, де «відсутність виявленої позначки не означає, що контент не був згенерований або оброблений ШІ», — зазначила Anthropic.
Claude може маркувати більше контенту ШІ, ніж вимагається
Варто відзначити, що Anthropic визнає: вона може маркувати деякий контент, який Закон про ШІ не вимагає маркувати: «Люди часто використовують Claude для вичитки, перекладу, узагальнення або конвертації файлів. Вивід може нести позначку Claude, навіть якщо вихідні ідеї, текст або дані походять з іншого джерела». Отже, незважаючи на явне звільнення законом, Claude маркуватиме будь-яку редакторську роботу над оригінальним текстом.
Якщо водяні знаки стануть універсальним рішенням для будь-якого використання Claude, від перевірки орфографії до повних переписань, рішення Anthropic, ймовірно, розчарує користувачів, оскільки воно буде виходити за межі необхідного для маркування контенту таким чином, що може ненавмисно заплутати походження. Вчитель або професор, наприклад, не повинен інтерпретувати цей сигнал водяного знаку як щось більше, ніж «ШІ торкнувся цього», але легко уявити, що вони це зроблять. Зрештою, який сенс у водяному знаку, який не може розрізнити легке редагування та повністю згенерований текст?
Ситуація стає ще туманнішою, коли ми звертаємося до іншої частини Закону ЄС про ШІ, 50(4), яка стосується того, як ті, хто публікує такий текст, повинні явно позначати контент. Згідно з їхнім режимом маркування, повністю згенерований текст ШІ в більшості випадків не потребує маркування. Роман, написаний ШІ? Без маркування. Маркетинговий текст, згенерований ШІ? Ні. Але якщо текст призначений «інформувати громадськість з питань, що становлять суспільний інтерес», ви повинні його маркувати, якщо тільки людина не перегляне його редакторськи (тобто, редактор відомий і несе відповідальність). Таким чином, ми маємо дивну ситуацію, коли на рівні моделі — «маркуй все», а на рівні громадського розголошення — «вам не потрібно маркувати цей текст ШІ, якщо Джо його переглянув».
Ars звернувся до Anthropic, щоб дізнатися, чи є терміни випуску деталей щодо виявлення, або результати будь-яких тестів, які компанія може надати, оцінюючи ймовірність хибних негативних або позитивних результатів. Ми також запитали, чи може Anthropic пояснити, як її водяні знаки можуть суперечити стандартному редагуванню та іншим виняткам із Закону про ШІ, але Anthropic надіслала заяву, яка не відповіла на запитання Ars.
«Ми додаємо маркування до виводів Claude для дотримання Закону ЄС про ШІ, і інші лабораторії роблять схожі кроки», — заявили в Anthropic. «Важко ідентифікувати текст, згенерований ШІ, і це дає людям кращі інструменти для ідентифікації. Текст із підтримуваних моделей Claude, включно з виводами Claude Code, матиме невидимий водяний знак, і це не змінює зміст, якість чи читабельність відповідей Claude. Ми також плануємо випустити API для виявлення тексту, щоб користувачі могли робити більше цього самостійно».
Веселощі тільки починаються
В ЄС вимоги щодо прозорості призначені для того, щоб інструменти ШІ, такі як Claude, не порушували «цілісність та довіру до інформаційної екосистеми, створюючи нові ризики дезінформації та маніпуляцій у великих масштабах, шахрайства, видавання себе за іншу особу та обману споживачів». У статті підтримки ЄС прогнозувалося, що зобов’язання будуть «першочерговим викликом відповідності» для багатьох компаній ШІ.
«Люди повинні знати, коли вони взаємодіють зі ШІ або стикаються з контентом, згенерованим ШІ», — йдеться в керівництві Європейської Комісії. «Це допоможе їм приймати обґрунтовані рішення, калібрувати свою довіру та покладатися на ШІ, а також уникати дезінформації чи обману». Проте важко погодити це з тим фактом, що повністю згенерована стаття з питання суспільного інтересу отримує водяний знак, але не мітку, видиму читачеві, якщо редактор її належним чином переглянув.
Компанії, що займаються ШІ, такі як Anthropic, найкраще підготовлені до розробки рішень для водяних знаків, оскільки ШІ розвивається швидко, і буде постійна «потреба в нових методах і техніках для відстеження походження інформації», — очікує ЄС.
Але це значною мірою залишає суспільну цінність таких позначок на розсуд технологічних компаній, при цьому ЄС лише зазначає, що «методи та техніки повинні бути достатньо надійними, взаємодіючими, ефективними та стійкими, наскільки це технічно можливо».
У своїй публікації Anthropic заявила, що планує продовжувати роботу над своїми водяними знаками та методами виявлення, які відповідають вимогам ЄС. Якщо позначки Claude не спрацюють, Закон про ШІ передбачає суворі штрафи за порушення, зокрема штрафи до 15 мільйонів євро або 3 відсотків світового річного доходу компанії.
Головний редактор Ars Кен Фішер сприяв написанню цього звіту. Ця історія була оновлена 13 серпня для додавання заяви від Anthropic.
Ешлі Беленджер, старший репортер з питань політики
Ешлі — старший репортер з питань політики в Ars Technica, яка займається відстеженням соціальних наслідків нових політик та технологій. Вона журналіст з Чикаго з 20-річним досвідом.
Інформація підготовлена на основі матеріалів: arstechnica.com
