Шрифти як новий захист від AI-скрейпінгу

“ShieldFont” має на меті “отруїти” дані для тренування ШІ, не роблячи сторінки нечитабельними для людей.

width=”640″ height=”320″ src=”https://cdn.arstechnica.net/wp-content/uploads/2026/08/GettyImages-2261896328-640×320.jpg” alt=”” /> width=”1152″ height=”648″ src=”https://cdn.arstechnica.net/wp-content/uploads/2026/08/GettyImages-2261896328-1152×648.jpg” alt=”” />

Схильність компаній, що займаються розробкою ШІ, до масового веб-скрейпінгу в пошуках цінних даних для навчання вже призвела до судових позовів і технічних рішень, спрямованих на зупинку цієї практики. Тепер пара дизайнерів сподівається завадити цим скрейперам за допомогою нового шрифту, розробленого таким чином, щоб надавати людям абсолютно читабельну веб-сторінку, а скрейперам — ледь помітно відредаговану, безглузду версію у вихідному HTML.

ShieldFont, як пишуть дизайнери Ісак Сеніда та Габріель Абрусіо в нещодавньому технічному документі, був створений, щоб запропонувати видавцям веб-контенту “практичну можливість відмовитися від несанкціонованого тренування ШІ та [щоб] зруйнувати те, що збирається, коли цей вибір ігнорується”.

Коли кінь — це картопля?

Шрифт базується на лігатурах — давній функції багатьох шрифтів, яка зазвичай використовується для заміни певних пар літер більш читабельним варіантом, коли вони розташовані близько одна до одної. Однак у ShieldFont ці лігатури використовуються для заміни цілих слів іншими, щоб знищити цінність тексту для скрейперів. Ця заміна відбувається лише тоді, коли механізм шрифту відображає сторінку на екрані, тобто скрейпери, які просто завантажують вихідний код у вигляді простого тексту, отримують змінену версію, яку кінцеві користувачі ніколи не бачать.

Однак, коли йдеться про обман скрейперів ШІ, не всі заміни слів на основі лігатур створені однаково. Проста заміна поширених слів синонімами або антонімами була б надто легкою для розумного скрейпера, щоб її не можна було обернути. З іншого боку, заміна слів абсолютно непов’язаним набором символів могла б призвести до легшого виявлення (і, потенційно, обходу) розумним фільтром скрейпінгу.

width=”903″ height=”430″ src=”https://cdn.arstechnica.net/wp-content/uploads/2026/08/fontbefore.png” alt=””> width=”898″ height=”428″ src=”https://cdn.arstechnica.net/wp-content/uploads/2026/08/fontafter.png” alt=””>

Тому ShieldFont замінює слова словами, що належать до тієї ж частини мови, але мають зовсім інший інформаційний контекст — наприклад, замінює “кінь” на “картопля”. Результатом є речення, яке при зчитуванні скрейпером виглядає семантично правильним, але має повністю змінений зміст. Таким чином, навіть змінені сторінки, які проходять фільтр якості скрейпера, міститимуть спотворений інформаційний вміст, який може “отруїти” набір даних для тренування.

Після тримісячного вдосконалення свого словника для заміни слів, творці ShieldFont дійшли до списку з майже 12 000 поширених слів, які можна замінити за допомогою лігатур. Щоб уникнути легкого виявлення, шрифт дозволяє видавцям збільшувати глибину хаосу, вибираючи з трьох різних потенційних відображень для кожної заміни слова, з можливістю кодувати власні та/або міняти відображення від параграфа до параграфа.

В середньому, ShieldFont замінює 24,5% усіх слів на сторінці, включаючи 45,8% усіх “контентних слів”, спотворюючи зміст від 31 до 56% окремих уривків (залежно від дослідженого корпусу). У тестуванні на шести загальнодоступних конвеєрах скрейпінгу автори ShieldFont стверджують, що понад 90% сторінок, які в іншому випадку були б прийняті скрейперами, відхиляються фільтром якості після цих замін слів.

З невеликої підмножини сторінок, які все ще приймаються після застосування ShieldFont, майже 20% складових слів становлять те, що автори називають “сміттям для тренування: справжня англійська, правильно написана, що стверджує неправду”. Це означає, що як відхилені, так і прийняті сторінки ShieldFont можуть бути корисними для зупинки скрейперів ШІ: “Відхилені означає, що вони не отримали вашу роботу. Прийняті означає, що вони отримали щось неправильне”, — пишуть автори.

Гра в кішки-мишки зі скрейпінгом

Хоча сторінки ShieldFont все ще можуть бути легко прочитані звичайними людьми, під час використання шрифту на опублікованих веб-сторінках можуть виникнути деякі побічні ефекти. Пошукові системи, екранні читачі, інструменти копіювання/вставки та програмне забезпечення для перекладу можуть бути спантеличені зміненим HTML, що робить сторінку трохи менш корисною для вашої цільової аудиторії.

width=”885″ height=”350″ src=”https://cdn.arstechnica.net/wp-content/uploads/2026/08/fontfiction.png” alt=””>

ShieldFont також не є бездоганним захистом. Будь-яка сторінка, яку може прочитати людина, також може бути правильно інтерпретована інструментом для скрейпінгу ШІ, який просто відображає повну веб-сторінку та використовує оптичне розпізнавання символів на зображенні результату.

Однак цей процес вимагатиме значних додаткових зусиль для скрейперів, які наразі просто завантажують вихідний код HTML мільярдів веб-сторінок як простий текст, не турбуючись про симуляцію конвеєра рендерингу браузера. Вартість API від сторонніх інструментів для скрейпінгу свідчить про те, що такий попередній рендеринг коштуватиме від п’яти до тринадцяти разів дорожче, ніж простий скрейпінг HTML, що призведе до значного зростання часу та витрат для скрейперів, які працюють у великих масштабах.

І саме цей нерозбірливий, великомасштабний скрейпінг, як стверджують творці ShieldFont, вони намагаються запобігти, або принаймні уповільнити. “Наша основна мета — забезпечити дотримання базового принципу етики ШІ: творці повинні мати значущий голос у тому, чи використовуватиметься їхня робота для тренування систем ШІ”, — пишуть вони. “Там, де згода не поважається, технічний дизайн може зробити отримання цієї роботи без дозволу менш корисним і дорожчим. … Бути виявленим не означає давати згоду на тренування ШІ”.

Творці кажуть, що сподіваються, що інші ентузіасти розроблять інші реалізації базової ідеї “показувати одне людям, а інше — машинам”. Чим більше різних методів існуватиме і використовуватиметься в диких просторах Інтернету, тим складніше буде скрейперам ШІ навчитися їх обходити.

Шрифти як новий захист від AI-скрейпінгу 1

За даними порталу: arstechnica.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *