Amazon приховує рідкісні книги, тренуючи на них ШІ

Команда Amazon використовує логотип із зображенням тиранозавра, що готується пожирати книгу.

Amazon приховує рідкісні книги, тренуючи на них ШІ 1 Amazon приховує рідкісні книги, тренуючи на них ШІ 2

Протягом останнього року книготорговці підозрювали, що компанії, які займаються розробкою штучного інтелекту, скуповують великі партії рідкісних книг, а потім знищують їх після сканування для навчання ШІ. Однак довести це було складно, доки видання 404 Media не повідомило, що Airtag, захований у рідкісній книзі, виявив, що за деякими оптовими закупівлями стоїть щонайменше один технологічний гігант, який прагне вдосконалити свої передові моделі: Amazon.

У понеділок 404 Media повідомило, що вийшло на зв’язок із книготорговцем, який погодився помістити Airtag у рідкісну книгу, що була частиною оптового замовлення. Згодом цей Airtag був відстежений до об’єкта Amazon для навчання ШІ в Лас-Вегасі, де працювала команда, що займалася вириванням сторінок із книг та їх скануванням. 404 Media повідомило, що на дверях складу цієї команди, VGT3, був розміщений логотип із тиранозавром, який готується пожирати книгу, що виглядало досить нечутливим на тлі наростаючої критики щодо знищення книг під час сканування.

Amazon відхиляє звинувачення

Amazon відмовився коментувати висновки 404 Media, надавши Ars Technica ту саму заяву, що й 404 Media, в якій конкретно не згадується навчання ШІ.

«Amazon купує книги через комерційні канали для розробки та вдосконалення продуктів і послуг, якими користуються наші клієнти», — йдеться в заяві Amazon.

Однак Amazon розробляє те, що вважає передовими моделями ШІ, які потребують величезної кількості унікальних навчальних даних, щоб залишатися конкурентоспроможними з провідними компаніями, такими як Google, OpenAI чи Anthropic. Наразі компанії ретельно охороняють свої навчальні дані, щоб уникнути втрати переваги. Навчання моделей на текстах із рідкісних книг, які важко знайти, надало б Amazon очевидну перевагу, особливо враховуючи, що конкуренти, як-от Anthropic і xAI, публічно заявили, що не тренують свої моделі на рідкісних або антикварних книгах.

Крім того, схоже, Amazon потребував нового джерела оригінальних текстів. 404 Media звернуло увагу на обговорення у онлайн-форумах, де працівники VGT3 припускали, що на початку цього року Amazon відчував брак книг для сканування. Дефіцит був настільки тривожним, що вони побоювалися закриття складу, якщо Amazon не зможе знайти більше книг для сканування. Працівники розповіли, що одного разу запаси повністю вичерпалися. Однак об’єкт досі функціонує, повідомило 404 Media. І тепер підтверджено, що оптові закупівлі рідкісних книг, які доставляються сюди, систематично знищуються цією командою.

Багато книголюбів шоковані знищенням книг для сканування (оскільки існують альтернативи). Один із затятих критиків, Майкл Беррі, навіть назвав цю практику «злом у чистому вигляді». Однак працівники Amazon повідомили на форумах, що вважають цю роботу «приємною» можливістю для тих, хто шукає нудну роботу з гнучким графіком.

Тривають дебати щодо рідкісних книг

Окрім того, що рідкісні видання, які цінують книготорговці, «перетравлюються» машиною ШІ Amazon, 404 Media припускає, що їхнє розслідування допомогло підтвердити ще одну теорію книготорговців щодо того, чому компанії зі штучним інтелектом можуть замовляти певні рідкісні книги, а інші — ні.

Після року рекордних продажів книготорговці підозрювали, що компанії зі штучним інтелектом націлюються на книги з ISBN, щоб забезпечити максимальний обсяг унікальних творів у наборах даних для навчання. Огляд онлайн-обговорень працівників Amazon виданням 404 Media вказав, що їх навчали сканувати штрих-коди або ISBN перед скануванням книг. Ця практика, як повідомило 404 Media, «надає подальшої достовірності» теорії книготорговців про те, що «компанії зі штучним інтелектом намагаються методично сканувати кожну друковану книгу у світі, проходячи за списком ISBN».

Для книготорговців гроші можуть бути привабливими, але ризик того, що їхні ретельно зібрані колекції будуть приречені на знищення під час сканування для ШІ, як це робить Amazon, ставить етичну дилему. Вони знають, як оцінювати широкий спектр рідкісних книг, щоб визначити їхню вартість, а компанії зі штучним інтелектом, здається, пропускають цей етап, шукаючи дешеві, унікальні ISBN для заповнення своїх контрольних списків.

Наразі книги, які купують компанії зі штучним інтелектом, не обов’язково є найціннішими першими виданнями відомих творів. Натомість компанії зі штучним інтелектом часто націлюються на старіші книги з меншою грошовою вартістю, такі як книги, що ніколи не були перекладені з іноземної мови, яка сьогодні не є широко поширеною, або книги, які ніколи не були достатньо популярними, щоб отримати широке розповсюдження.

Однак ці твори все ще можуть мати «історичну, інтелектуальну, сентиментальну цінність», яку компанії зі штучним інтелектом не враховують, розповів 404 Media книготорговець, який помістив Airtag. Цінність рідкісної книги може походити з «усіляких речей», які «компанії зі штучним інтелектом не цікавлять. Їм потрібен лише контент як купа слів, пов’язаних між собою».

Реддітори висловлюються

На Reddit деякі шанувальники книг обговорювали, наскільки проблематично для компаній знищувати рідкісні книги для навчання ШІ, особливо враховуючи, що, як повідомляє BBC, деякі з цих книг роками припадали пилом на полицях книготорговців.

«Ви б не купили ту стару паперову книгу», — прокоментував один користувач Reddit у відповідь на пост, де висловлювалося жалкування, що «невизначна книга 1700 року тепер є музейним експонатом і може розкрити повсякденні речі, про які ми не знали».

У цій гілці оригінальний автор допису зазначив, що справжньою проблемою є те, що крихітні деталі та навіть основні історичні інсайти, які можна отримати шляхом перегляду рідкісних книг, будуть втрачені через жадібність ШІ. Автор допису сказав, що компанії зі штучним інтелектом «ніколи не поділяться вмістом» прочитаних книг, «оскільки вони не хочуть, щоб хтось інший міг тренувати свій ШІ» на тих самих творах.

«Це звучить як пропаганда від ненависників ШІ», — заперечив інший користувач Reddit, але наступний коментатор поділився схожими побоюваннями. Хоча люди можуть сперечатися з тими, хто стверджує, що навчання ШІ на цих творах зробить усі знання, що містяться в творі, більш доступними в Інтернеті, коментатор припустив, що моделі ШІ надаватимуть лише «спотворені, цензуровані та платні фрагменти ідей» із забутих творів.

«Навіть якщо вам подобається технологія, ви можете визнати, що концепція ШІ, який буквально пожирає книги, щоб стати потужнішим, є досить антиутопічною», — додав хтось інший у гілці.

Деякі книготорговці погоджуються, що не кожен текст потребує збереження, повідомляє BBC. Однак шотландський книготорговець Дерек Вокер розповів BBC, що компанії зі штучним інтелектом повинні прагнути розрізняти твори, які не будуть сильно пропущені — наприклад, маловідомі наукові тексти, які технічно можуть бути рідкісними — і менш відомі антикварні твори, які можуть бути «єдиним відомим прикладом видання, що збереглося».

«Це було б набагато серйознішою проблемою, якби такий був придбаний для знищення, переживши стільки часу», — сказав Вокер.

Для компаній зі штучним інтелектом, які охороняють свої навчальні дані та використовують послуги, що маскують їхню ідентичність як покупців, ймовірно, мало бажання обговорювати свої оптові закупівлі безпосередньо з книготорговцями. Дозволити книготорговцям висловлювати свою думку щодо творів, які вони планують використовувати у своїх моделях, вимагатиме рівня прозорості, який може здатися ризикованішим, ніж можливий удар по репутації, якщо колись буде доведено, що цінне перше видання було знищено в ім’я розвитку ШІ.

Amazon приховує рідкісні книги, тренуючи на них ШІ 3

Інформація підготовлена на основі матеріалів: arstechnica.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *