“ShieldFont” покликаний «отруювати» тренувальні дані ШІ, не роблячи сторінки нечитабельними для людей.
Схильність компаній-розробників ШІ до масового сканування загальнодоступного вебу в пошуках цінних тренувальних даних вже призвела до судових позовів та технічних рішень, спрямованих на зупинку цієї практики. Тепер пара дизайнерів сподівається перешкодити цим скрейперам за допомогою нового шрифту, розробленого для того, щоб забезпечити людям ідеально читабельну вебсторінку, водночас надаючи скрейперам тонко відредаговану, безглузду версію у вихідному HTML.
ShieldFont, як пишуть дизайнери Ісак Сенеда та Габріель Абрусіо у нещодавній білій книзі, був створений, щоб запропонувати веб-видавцям «практичну відмову від несанкціонованого тренування ШІ та [щоб] зруйнувати те, що збирається, коли цей вибір ігнорується».
Коли кінь — це картопля?
Шрифт базується на лігатурах — давній функції багатьох шрифтів, яка зазвичай використовується для заміни певних пар літер на більш читабельну версію, коли вони розташовані близько одна до одної. Однак у ShieldFont ці лігатури використовуються для заміни цілих слів іншими, намагаючись знищити цінність тексту для скрейперів. Ця заміна відбувається лише тоді, коли рушій шрифту відображає сторінку на екрані, що означає, що скрейпери, які просто завантажують вихідний код у вигляді простого тексту, отримують змінену версію, яку кінцеві користувачі ніколи не бачать.
Однак, коли йдеться про обман скрейперів ШІ, не всі заміни слів на основі лігатур однакові. Проста заміна поширених слів синонімами або антонімами була б надто легкою для розумного скрейпера, щоб її обернути. З іншого боку, заміна слів абсолютно безглуздим набором символів може призвести до легшого виявлення (і потенційного обходу) розумним фільтром для скрейпінгу.
Отже, ShieldFont замінює слова на слова, що належать до тієї ж частини мови, але мають абсолютно інший інформаційний контекст — наприклад, замінюючи «кінь» на «картопля». Результатом є речення, яке можна витягти, яке виглядає семантично правильним, але має повністю змінений зміст. Таким чином, навіть змінені сторінки, які проходять фільтр якості скрейпера, міститимуть спотворену інформаційну структуру, яка може «отруїти» набір тренувальних даних.
Після тримісячного вдосконалення свого словника заміни слів, творці ShieldFont отримали список із майже 12 000 поширених слів, які можна замінити лігатурами. Щоб уникнути легкого виявлення, шрифт дозволяє видавцям збільшити базовий хаос, вибираючи з трьох різних потенційних відображень для кожної заміни слова, з можливістю кодувати власні та/або обмінюватися відображеннями від абзацу до абзацу.
У середньому ShieldFont замінює 24,5% усіх слів на сторінці, включаючи 45,8% усіх «контентних слів», спотворюючи значення від 31 до 56% окремих уривків (залежно від вивченого корпусу). У тестуванні на шести загальнодоступних конвеєрах скрейперів автори ShieldFont стверджують, що понад 90% сторінок, які інакше були б прийняті скрейперами, відхиляються фільтром якості після цих замін слів.
З невеликої підмножини сторінок, які все ще приймаються після застосування ShieldFont, майже 20% компонентних слів є тим, що автори називають «сміттям для тренування: справжня англійська, правильно написана, яка не стверджує нічого правдивого». Це означає, що як відкинуті, так і збережені сторінки ShieldFont можуть бути корисними для зупинки скрейперів ШІ: «Відкинуті означає, що вони не отримали вашої роботи. Збережені означає, що вони отримали щось неправильно», — пишуть автори.
Гра в кішки-мишки зі скрейпінгом
Хоча сторінки ShieldFont все ще можуть бути чудово прочитані звичайними людьми, при використанні шрифту на опублікованих веб-сторінках можуть виникнути певні побічні ефекти. Пошукові системи, програми для читання з екрана, інструменти копіювання/вставлення та програмне забезпечення для перекладу можуть бути збиті з пантелику зміненим HTML, що робить сторінку менш корисною для вашої цільової аудиторії.
Розкажіть мені більше про дуже південного інженера, який їхав на дивані… Джерело: ShieldFont ShieldFont також не є безпомилковим захистом. Будь-яка сторінка, яку може прочитати людина, також може бути правильно інтерпретована інструментом скрейпінгу ШІ, який просто відтворює повну веб-сторінку та використовує оптичне розпізнавання символів на зображенні результату.
Однак цей процес вимагатиме значних додаткових зусиль від скрейперів, які наразі просто завантажують вихідний код мільярдів веб-сторінок у вигляді простого тексту, не вдаючись до симуляції конвеєра рендерингу браузера. Вартість API від сторонніх інструментів для скрейпінгу свідчить про те, що такий вид попереднього рендерингу коштуватиме від п’яти до 13 разів дорожче, ніж просте сканування HTML, що призведе до значного зростання витрат часу та коштів для скрейперів, які працюють у великих масштабах.
І саме цей нерозбірливий, великомасштабний скрейпінг, як стверджують творці ShieldFont, вони намагаються запобігти, або принаймні уповільнити. «Наша головна фундаментальна мета — забезпечити дотримання базового принципу етики ШІ: творці повинні мати значний голос у тому, чи буде їхня робота використовуватися для тренування систем ШІ», — пишуть вони. «Де згода не поважається, технічний дизайн може зробити отримання цієї роботи без дозволу менш корисним і дорожчим. … Можливість бути виявленим не означає згоду на тренування ШІ».
Творці кажуть, що сподіваються, що інші ентузіасти придумають інші реалізації базової ідеї «показувати одне для людей, інше для машин». Чим більше різних методів буде існувати, використовуваних у дикій природі Інтернету, тим важче буде скрейперам ШІ навчитися їх усіх обходити.
Оригінал статті: arstechnica.com
