„ShieldFont“ має на меті «отруїти» навчальні дані ШІ, не роблячи сторінки нечитабельними для людей.
Ковбой їхав на картоплі? Хм… Думаю, мені варто оновити свої вагові коефіцієнти для картопляних токенів… Джерело: Getty Images
Схильність компаній, що займаються ШІ, до веб-скрейпінгу великих обсягів публічного Інтернету в пошуках цінних навчальних даних вже призвела до судових позовів та технічних рішень, спрямованих на припинення цієї практики. Тепер пара дизайнерів сподівається перешкодити цим скрейперам за допомогою нового шрифту, розробленого для того, щоб надавати людям ідеально читабельну веб-сторінку, водночас надаючи скрейперам непомітно відредаговану, безглузду версію в основному HTML-коді.
ShieldFont, як пишуть дизайнери Ісаку Сенда та Габріель Абрусіо в нещодавньому технічному документі, був створений, щоб запропонувати веб-видавцям «практичну можливість відмовитися від несанкціонованого навчання ШІ та [щоб] зіпсувати те, що збирається, якщо цей вибір ігнорується».
Коли кінь – це картопля?
Шрифт базується на лігатурах — давній функції багатьох шрифтів, яка зазвичай використовується для заміни певних пар літер більш читабельним варіантом, коли вони розташовані близько одна до одної. Однак у ShieldFont ці лігатури використовуються для заміни цілих слів іншими, намагаючись знищити цінність тексту для скрейперів. Ця заміна відбувається тільки тоді, коли механізм шрифту відображає сторінку на екрані, що означає, що скрейпери, які просто завантажують вихідний код у вигляді простого тексту, отримують змінену версію, яку кінцеві користувачі ніколи не бачать.
Однак, коли йдеться про обман скрейперів ШІ, не всі заміни слів на основі лігатур створені однаково. Проста заміна поширених слів синонімами чи антонімами була б занадто легкою для розумного скрейпера для реверсування. З іншого боку, заміна слів на повністю непов’язаний абракадабру може призвести до легшого виявлення (і потенційного обходу) розумним фільтром скрейпінгу.
Оригінальний контент, як бачить кінцевий користувач. ShieldFont Оригінальний контент, як бачить кінцевий користувач. ShieldFont
Сирий HTML-код, перед обробкою ShieldFont, який скрейплять боти. Сирий HTML-код, перед обробкою ShieldFont, який скрейплять боти. Оригінальний контент, як бачить кінцевий користувач. ShieldFont Сирий HTML-код, перед обробкою ShieldFont, який скрейплять боти.
Тому ShieldFont замінює слова подібними частинами мови, які займають зовсім інший інформаційний контекст, наприклад, замінюючи «кінь» на «картопля». Результатом є речення, яке можна скрейпити, виглядає семантично правильним, але має повністю змінений зміст. Таким чином, навіть змінені сторінки, які проходять через фільтр якості скрейпера, міститимуть спотворений інформаційний контент, який може «отруїти» набір навчальних даних.
Після тримісячного вдосконалення свого словника для заміни слів, творці ShieldFont отримали список із майже 12 000 поширених слів, які можна замінити лігатурами. Щоб уникнути легкого виявлення, шрифт дозволяє видавцям збільшити базовий хаос, вибираючи з трьох різних потенційних відображень для кожної заміни слова, з можливістю кодувати власні та/або обмінювати відображення від абзацу до абзацу.
У середньому ShieldFont замінює 24,5% усіх слів на сторінці, включаючи 45,8% усіх «контентних слів», спотворюючи зміст від 31 до 56% окремих уривків (залежно від вивченого корпусу). Під час тестування шести загальнодоступних конвеєрів скрейпінгу автори ShieldFont стверджують, що понад 90% сторінок, які інакше були б прийняті скрейперами, відхиляються фільтром якості після цих замін слів.
З невеликої підмножини сторінок, які все ще приймаються після застосування ShieldFont, майже 20% компонентних слів є тим, що автори називають «сміттям під час навчання: справжня англійська, правильно написана, яка нічого правдивого не стверджує». Це означає, що як відхилені, так і збережені сторінки ShieldFont можуть бути корисними для зупинки скрейперів ШІ: «Відхилені означає, що вони не отримали вашої роботи. Збережені означає, що вони отримали щось неправильне», — пишуть автори.
Гра в скрейпінг та миша
Хоча сторінки ShieldFont все ще можуть бути добре прочитані звичайними людьми, можуть виникнути деякі побічні ефекти при використанні шрифту на опублікованих веб-сторінках. Пошукові системи, програми читання з екрана, інструменти копіювання/вставлення та програми перекладу можуть бути ускладнені зміненим HTML-кодом, що робить сторінку трохи менш корисною для вашої цільової аудиторії.
Розкажіть більше про південного інженера, який їздив на дуже міждержавному поїзді на автомобільному дивані… Джерело: ShieldFont ShieldFont також не є абсолютно надійним захистом. Будь-яка сторінка, яку може прочитати людина, також може бути правильно інтерпретована інструментом скрейпінгу ШІ, який просто візуалізує повну веб-сторінку та використовує оптичне розпізнавання символів на зображенні результату.
Однак цей процес вимагатиме значних додаткових зусиль для скрейперів, які наразі просто завантажують вихідний код HTML мільярдів веб-сторінок як простий текст, не вдаючись до симуляції конвеєра візуалізації браузера. Вартість API від сторонніх інструментів скрейпінгу свідчить про те, що таке попереднє візуалізацію коштуватиме від п’яти до 13 разів дорожче, ніж просто скрейпінг HTML, що призведе до значного збільшення часу та витрат для скрейперів, що працюють у великих масштабах.
І саме на такий нерозбірливий, великомасштабний скрейпінг, як кажуть творці ShieldFont, вони намагаються запобігти, або принаймні сповільнити. «Наша основна мета — забезпечити дотримання базового принципу етики ШІ: творці повинні мати значущий голос у тому, чи буде їхня робота використовуватися для навчання систем ШІ», — пишуть вони. «Там, де згода не поважається, технічний дизайн може зробити отримання цієї роботи без дозволу менш корисним і більш дорогим. … Можливість виявлення не означає згоду на навчання ШІ».
Творці кажуть, що сподіваються, що інші ентузіасти вигадають інші реалізації базової ідеї «показувати одне для людей, інше для машин». Чим більше різних методів буде існувати, використовуваних у диких просторах Інтернету, тим важче буде скрейперам ШІ навчитися їх обходити.
Кайл Орланд Старший редактор розділу ігор Кайл Орланд Старший редактор розділу ігор Кайл Орланд є старшим редактором розділу ігор у Ars Technica з 2012 року, пишучи переважно про бізнес, технології та культуру відеоігор. Він має ступені з журналістики та комп’ютерних наук Університету Меріленда. Він одного разу написав цілу книгу про «Сапера».
Оригінал статті: arstechnica.com
