ShieldFont має на меті «отруїти» дані для тренування ШІ, не роблячи сторінки нечитабельними для людей.
Схильність компаній, що займаються ШІ, до масового сканування загальнодоступного вебу в пошуках цінних даних для тренування вже призвела до судових позовів та технічних рішень, спрямованих на зупинення цієї практики. Тепер пара дизайнерів сподівається перешкодити цим скрейперам за допомогою нового шрифту, розробленого для того, щоб запропонувати людям ідеально читабельну вебсторінку, одночасно надаючи скрейперам непомітно відредаговану, безглузду версію в базовому HTML.
ShieldFont, як пишуть дизайнери Ісаке Сенеда та Габріель Абрусіо у нещодавньому документі (white paper), був створений, щоб запропонувати веб-видавцям «практичний вибір для відмови від несанкціонованого тренування ШІ та [для] руйнування того, що збирається, коли цим вибором нехтують».
Коли кінь — це картопля?
Шрифт базується на лігатурах — давно відомій функції багатьох шрифтів, яка зазвичай використовується для заміни певних пар літер на більш читабельну версію, коли вони розташовані поруч. Однак у ShieldFont ці лігатури використовуються для заміни цілих слів іншими, намагаючись знищити цінність тексту для скрейперів. Ця заміна відбувається лише тоді, коли рушій шрифту відображає сторінку на екрані, тобто скрейпери, які просто завантажують вихідний код у вигляді простого тексту, отримують змінену версію, яку кінцеві користувачі ніколи не бачать.
Проте, коли йдеться про обман скрейперів ШІ, не всі заміни слів на основі лігатур створені однаковими. Проста заміна поширених слів синонімами або антонімами була б занадто легкою для розумного скрейпера, щоб її обернути. З іншого боку, заміна слів абсолютно непов’язаними безглуздими словами може призвести до легшого виявлення (і потенційного обходу) розумним фільтром для скрейпінгу.
Таким чином, ShieldFont замінює слова на слова, що належать до тієї ж частини мови, але мають абсолютно інший інформаційний контекст — наприклад, замінюючи «кінь» на «картопля». Результатом є речення, яке може бути зібране, виглядає семантично правильно, але має повністю змінений зміст. Отже, навіть змінені сторінки, які пройдуть фільтр якості скрейпера, міститимуть заплутаний інформаційний контент, який може «отруїти» набір даних для тренування.
Після тримісячного вдосконалення свого словника для заміни слів, творці ShieldFont створили список із майже 12 000 поширених слів, які можна замінити за допомогою лігатур. Щоб уникнути легкого виявлення, шрифт дозволяє видавцям збільшувати внутрішній хаос, вибираючи з трьох різних потенційних відображень для кожної заміни слова, з можливістю кодувати власні та/або обмінюватися відображеннями від абзацу до абзацу.
В середньому ShieldFont замінює 24,5% усіх слів на сторінці, включаючи 45,8% усіх «контентних слів», спотворюючи значення від 31% до 56% окремих уривків (залежно від вивченого корпусу). У тестуванні на шести загальнодоступних конвеєрах для скрейпінгу автори ShieldFont стверджують, що понад 90% сторінок, які інакше були б прийняті скрейперами, відхиляються фільтром якості після цих замін слів.
З невеликої підмножини сторінок, які все ще приймаються після застосування ShieldFont, майже 20% компонентних слів є тим, що автори називають «сміттям для тренування: справжня англійська, правильно написана, яка нічого правдивого не стверджує». Це означає, що як відхилені, так і прийняті сторінки ShieldFont можуть бути корисними для зупинення скрейперів ШІ: «Відхилені означають, що вони не отримали вашої роботи. Прийняті означають, що вони отримали щось неправильно», — пишуть автори.
Гра в кішки-мишки зі скрейпінгом
Хоча сторінки ShieldFont все ще можуть бути цілком добре прочитані звичайними людьми, використання шрифту на опублікованих веб-сторінках може мати деякі побічні ефекти. Пошукові системи, екранні читачі, інструменти копіювання/вставки та програмне забезпечення для перекладу можуть бути збиті з пантелику зміненим HTML, що робить сторінку трохи менш корисною для вашої цільової аудиторії.

ShieldFont також не є безвідмовною обороною. Будь-яка сторінка, яка читабельна для людини, може бути правильно інтерпретована інструментом скрейпінгу ШІ, який просто відтворює повну веб-сторінку та використовує оптичне розпізнавання символів (OCR) із зображення результату.
Однак цей процес вимагав би значно більше роботи для скрейперів, які наразі просто завантажують вихідний код HTML мільярдів веб-сторінок як простий текст, не вдаючись до симуляції конвеєра рендерингу браузера. API-витрати від сторонніх інструментів для скрейпінгу свідчать, що такий попередній рендеринг коштуватиме від п’яти до тринадцяти разів більше, ніж просте скрейпінг HTML, що призведе до значного збільшення часу та витрат для скрейперів, які працюють у великих масштабах.
Саме цей нерозбірливий, великомасштабний скрейпінг, як стверджують творці ShieldFont, вони намагаються запобігти, або принаймні сповільнити. «Наша основна мета — забезпечити дотримання базового принципу етики ШІ: творці повинні мати значущий голос у тому, чи використовуватиметься їхня робота для тренування систем ШІ», — пишуть вони. «Де згода не поважається, технічний дизайн може зробити отримання цієї роботи без дозволу менш корисним і дорожчим. … Можливість бути виявленим не означає згоду на тренування ШІ».
Творці кажуть, що сподіваються, що інші ентузіасти розроблять інші реалізації базової ідеї «показати одне для людей, щось інше для машин». Чим більше різних методів буде доступно та використовуватися в диких умовах Інтернету, тим складніше буде скрейперам ШІ навчитися їх обходити.
Оригінал статті: arstechnica.com
