Шрифт: нова зброя проти AI-скрейпінгу в інтернеті

ShieldFont має на меті «отруїти» навчальні дані для ШІ, не роблячи сторінки нечитабельними для людей.

Шрифт: нова зброя проти AI-скрейпінгу в інтернеті 1 Шрифт: нова зброя проти AI-скрейпінгу в інтернеті 2

Прагнення компаній, що займаються ШІ, переглядати великі обсяги загальнодоступної мережі в пошуках цінних навчальних даних, вже призвело до судових позовів та технічних рішень, спрямованих на припинення такої практики. Тепер пара дизайнерів сподівається перешкодити цим парсерам за допомогою нового шрифту, розробленого для того, щоб надати людям ідеально читабельну вебсторінку, водночас надаючи парсерам ледь відредаговану, безглузду версію в базовому HTML.

ShieldFont, як пишуть дизайнери Ісак Сеніда (Isaque Seneda) та Габріель Абрусіо (Gabriel Abrucio) у нещодавньому технічному документі, був створений, щоб запропонувати видавцям веб-контенту «практичну відмову від несанкціонованого навчання ШІ та [для] порушення того, що збирається, коли цей вибір ігнорується».

Коли кінь — це картопля?

Шрифт базується на лігатурах — давній функції багатьох шрифтів, яка зазвичай використовується для заміни певних пар літер на більш читабельну версію, коли вони розташовані близько одна до одної. Однак у ShieldFont ці лігатури використовуються для заміни цілих слів іншими, намагаючись знищити цінність тексту для парсерів. Ця заміна відбувається лише тоді, коли рушій шрифту відображає сторінку на екрані, що означає, що парсери, які просто завантажують вихідний код у простому тексті, отримують змінену версію, яку кінцеві користувачі ніколи не бачать.

Однак, коли йдеться про введення в оману парсерів ШІ, не всі заміни слів на основі лігатур однакові. Проста заміна поширених слів синонімами або антонімами була б надто легкою для розумного парсера для обернення. З іншого боку, заміна слів повністю непов’язаним набором символів може призвести до легшого виявлення (і потенційного обходу) розумним фільтром парсингу.

Шрифт: нова зброя проти AI-скрейпінгу в інтернеті 3 Оригінальний контент, як його бачить кінцевий користувач. ShieldFont Оригінальний контент, як його бачить кінцевий користувач. ShieldFont Шрифт: нова зброя проти AI-скрейпінгу в інтернеті 4 Необроблений HTML, перед обробкою ShieldFont, який парсять боти. Необроблений HTML, перед обробкою ShieldFont, який парсять боти. Оригінальний контент, як його бачить кінцевий користувач. ShieldFont Необроблений HTML, перед обробкою ShieldFont, який парсять боти.

Тому ShieldFont замінює слова на схожі частини мови, що займають зовсім інший інформаційний контекст — наприклад, замінюючи «кінь» на «картопля». Результатом є парсильне речення, яке виглядає семантично правильним, але має повністю змінений зміст. Таким чином, навіть змінені сторінки, які пройдуть фільтр якості парсера, міститимуть спотворений інформаційний контент, який може «отруїти» набір навчальних даних.

Після тримісячного вдосконалення словника заміни слів творці ShieldFont отримали список із майже 12 000 поширених слів, які можна замінити лігатурами. Щоб уникнути легкого виявлення, шрифт дозволяє видавцям збільшувати базовий хаос, обираючи з трьох різних потенційних зіставлень для кожної заміни слова, з можливістю кодувати власні та/або обмінювати зіставлення від параграфа до параграфа.

У середньому ShieldFont замінює 24,5% усіх слів на сторінці, включаючи 45,8% усіх «контентних слів», спотворюючи значення від 31 до 56% окремих уривків (залежно від дослідженого корпусу). У тестах на шести загальнодоступних конвеєрах парсингу автори ShieldFont стверджують, що понад 90% сторінок, які інакше були б прийняті парсерами, відхиляються фільтром якості після цих замін слів.

З невеликої підмножини сторінок, які все ще приймаються після застосування ShieldFont, майже 20% компонентних слів є тим, що автори називають «сміттям для навчання: справжня англійська мова, правильно написана, яка не стверджує нічого правдивого». Це означає, що як відхилені, так і збережені сторінки ShieldFont можуть бути корисними для зупинки парсерів ШІ: «Відхилено означає, що вони не отримали вашу роботу. Збережено означає, що вони отримали щось неправильне», — пишуть автори.

Гра «парсинг і миша»

Хоча сторінки ShieldFont все ще можуть бути прочитані звичайними людьми, під час використання шрифту на опублікованих веб-сторінках можуть виникати деякі побічні ефекти. Пошукові системи, екранні зчитувачі, інструменти копіювання/вставлення та програмне забезпечення для перекладу можуть бути збиті з пантелику зміненим HTML, що робить сторінку менш корисною для вашої цільової аудиторії.

Шрифт: нова зброя проти AI-скрейпінгу в інтернеті 5 Розкажіть більше про дуже міжштатного південного інженера з диванним автомобілем… Кредит: ShieldFont

ShieldFont також не є безпомилковим захистом. Будь-яка сторінка, яка читабельна для людини, також може бути правильно інтерпретована інструментом для парсингу ШІ, який просто відтворює повну веб-сторінку та використовує оптичне розпізнавання символів (OCR) для зображення результату.

Однак цей процес вимагатиме значно більше роботи для парсерів, які зараз просто завантажують вихідний код мільярдів веб-сторінок у вигляді простого тексту, не вдаючись до симуляції конвеєра візуалізації браузера. Вартість API від сторонніх інструментів парсингу свідчить про те, що такий тип попереднього відтворення коштуватиме від п’яти до 13 разів дорожче, ніж просте парсинг HTML, що призведе до значного зростання часу та витрат для парсерів, що працюють у великих масштабах.

І саме цей нерозбірливий, великомасштабний парсинг творці ShieldFont кажуть, що вони намагаються запобігти, або принаймні сповільнити. «Наша основна мета — забезпечити дотримання базового принципу етики ШІ: творці повинні мати значущий голос у тому, чи буде їхня робота використовуватися для навчання систем ШІ», — пишуть вони. «Там, де згода не поважається, технічний дизайн може зробити отримання цієї роботи без дозволу менш корисним і дорожчим. … Можливість бути виявленим не означає згоду на навчання ШІ».

Творці кажуть, що сподіваються, що інші експериментатори запропонують інші реалізації базової ідеї «показувати одне для людей, інше — для машин». Чим більше різних методів буде існувати, використовуваних у дикій природі Інтернету, тим складніше буде парсерам ШІ навчитися їх обходити.

Шрифт: нова зброя проти AI-скрейпінгу в інтернеті 6

Подробиці можна знайти на сайті: arstechnica.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *