Компанії, що займаються штучним інтелектом, тихо скуповують рідкісні книги, стикаючись із опором книготорговців.
Якщо ви по-справжньому цінуєте стару книгу і, можливо, навіть дивуєтеся, як її крихкі, пожовклі сторінки містять одні з найдавніших способів, якими люди намагалися осмислити світ навколо себе, то заголовки про технологічні компанії, які знищують книги для навчання ШІ, ймовірно, ранять найтонше місце вашої душі.
Дійсно, сумно уявляти купи книжкових корінців, що чекають, щоб їх подрібнили, тоді як вирвані сторінки обрізають, сканують і викидають. Але це найдешевший і найпростіший спосіб сканувати книги якомога швидше, а компанії зі штучного інтелекту змагаються у вдосконаленні своїх моделей, навчаючи їх на захопливих, високоякісних текстах великого обсягу, які можна знайти лише в книгах. Тому книголюби побоюються, що ця практика відбувається в більших масштабах, ніж повідомляється зараз, і що деякі фізичні копії книг будуть втрачені назавжди.
Що робить це руйнування ще болючішим, так це те, що воно не мусить бути таким.
Google запатентував технологію неруйнівного сканування книг ще у 2009 році, яку компанії зі штучного інтелекту могли б використовувати для ефективного сканування книг, якби вони були готові сповільнитися та інвестувати в цей процес. Однак це не ідеально; дослідження виявили, що викривлення сторінки може спотворювати текст, а сторінки можуть бути пропущені. Як повідомляв Wired, збої можуть виникати, коли працівники рухаються занадто швидко, зокрема, коли неуважні руки затуляють сторінки.
Загалом, компроміси щодо вартості та швидкості можуть не приваблювати компанії зі штучного інтелекту, які шукають найдешевший спосіб сканувати мільйони найменувань, і метод Google може бути не найкращим способом поводження з рідкісними книгами. Internet Archive, який допомагає бібліотекам зберігати старі колекції, давно зрозумів, що сканування старих текстів вимагає часу та уваги, щоб обмежити поводження з ними, і саме тому ця робота вважається настільки “людською”.
Для компаній зі штучного інтелекту, які прагнуть знайти короткі шляхи, метод Internet Archive може здатися майже чужим.
Але якщо ви книголюб, який шукає полегшення серед чуток про знищення книг за допомогою ШІ, старий допис 2021 року описує, як Internet Archive сканує книги, щоб не пошкодити навіть найцінніші рідкісні книги. У ньому Еліза Чжан, яка працює сканером книг в Archive з 2010 року, запропонувала момент спокою, пояснивши, що їй так подобається сканувати книги “важким шляхом”.
Internet Archive дійсно намагався піти автоматизованим шляхом, про що йдеться в дописі, навіть тестуючи “комерційні книжкові сканери, оснащені вакуумним плечем для перегортання сторінок”. Але “виявилося, що ці автоматизовані сканери насправді не дуже добре працювали з крихкими книгами, рідкісними виданнями та іншими спеціальними колекціями — саме з тим матеріалом, який наші бібліотечні партнери просять нас оцифрувати”, — зазначили в Internet Archive.
“Робота вимагає гострої концентрації”, — сказала Чжан, оскільки сторінки “дуже старих, крихких книг” “тонкі, як папір”. В дописі Андреа Міллс, яка допомагає керувати операціями зі сканування книг в Archive, пояснила, що “чисті, сухі людські руки — найкращий спосіб перегортати сторінки”.
Щоб гарантувати, що кожна рідкісна книга пройде процес сканування лише один раз, Чжан не поспішає. Вона обережно піднімає скло сканера за допомогою педалі щоразу, коли перегортає сторінку, потім налаштовує камери і переконується, що сторінка читабельна. Вона також відзначає будь-які розгортки, встановлюючи нагадування, щоб повернутися і сканувати вставки, щоб бонусні матеріали не були втрачені під час документування основних сторінок роботи.
Весь цей час вона розуміє, що якщо сторінка буде пропущена або зображення буде занадто розмитим, власне програмне забезпечення Internet Archive зупинить процес і запропонує їй сканувати її знову. Практика робить досконалим, і після більш ніж десятиліття пошуку ритму в роботі вона повідомляє про низький рівень помилок.
На той час Чжан відсканувала “понад 3 мільйони сторінок, 14 000 розгорток і 18 000 елементів (переважно книг)” з метою гарантування “нуля помилок”, — йдеться в дописі.
Ars звернувся до Internet Archive за коментарем, але Кріс Фріланд, директор бібліотечних послуг, сказав, що допис, який детально описує роботу Чжан, “досі є найкращим описом нашого процесу сканування сьогодні”.
Допис з’явився після того, як відео зі скануванням книг Чжан набрало 1,5 мільйона переглядів у тодішньому Twitter, супроводжуючись підписом, який міг би резонувати з книголюбами, що жахаються знищення книг за допомогою ШІ сьогодні.
“В Internet Archive ми оцифровуємо книгу ось так”, — йшлося в твіті. “Ми ніколи не знищуємо книгу, відрізаючи її корінець. Натомість ми оцифровуємо її важким шляхом — сторінка за сторінкою”.
Рідкісні книготорговці відзначають підозрілі оптові замовлення
Відколи влітку 2025 року судовий позов викрив компанію Anthropic у знищенні мільйонів друкованих книг для навчання своїх моделей ШІ, книголюби почали захищати деякі з найцінніших колекцій від того, що здається нескінченним прагненням компаній ШІ завантажити всі книги світу в свої великі мовні моделі.
Найбільший страх для людей, які хочуть бачити книги збереженими через процес навчання, полягає в тому, що компанії ШІ безжально пустять під ніж рідкісні книги, які ніколи не можна буде замінити.
Як повідомляв The Atlantic минулого тижня, соціальні мережі “лютували” після двох нещодавніх звітів, які вказували на те, що ШІ вже ставить під загрозу рідкісні книги. По-перше, звіт Telegraph звинуватив Кремнієву долину у знищенні мільйонів рідкісних книг та “шредеруванні оригіналів”, а потім 404 Media повідомила, що компанія, яка займається базами даних книг, під назвою ISBNdb, рекламувала, що може допомогти компаніям ШІ знаходити книги оптом.
Ця негативна реакція була очікуваною: ISBNdb, як повідомляється, попередила своїх клієнтів про погану реакцію. Anthropic почала використовувати кодову назву — “Проєкт Панама” — для свого руйнівного сканування книг, намагаючись приховати це від громадськості.
Немає жодних ознак того, що Anthropic коли-небудь знищувала рідкісні книги, і компанія заперечувала це в заявах. Також правда, що деякі компанії зі штучного інтелекту допомагають зберігати рідкісні книги. Наприклад, OpenAI та Microsoft співпрацюють з бібліотекарями Гарварду над ініціативою з навчання моделей ШІ на близько 1 мільйоні книг, що перебувають у суспільному надбанні, починаючи з 15-го століття. Інші, включаючи xAI Ілона Маска, публічно заявили, що не будуть знищувати рідкісні книги для навчання ШІ. У дописі на X Маск заявив, що він “попросив команду SpaceXAI зберегти будь-які рідкісні книги в бібліотеці та сканувати їх “важким шляхом”, а не просто відрізати корінець і сканувати”.
Але не всі переконані, що найбільші компанії зі штучного інтелекту щирі у своїх обіцянках зберігати рідкісні книги, навіть якщо закон про авторське право дозволяє їм знищувати копії книг, які вони придбали. Критики в соціальних мережах та Reddit вказали на те, що Маск не сказав, що команда xAI не буде знищувати жодних книг, і незрозуміло, як його компанія визначає “рідкісну” книгу.
Тим часом, книготорговці рідкісними книгами продовжують відзначати дивні замовлення, розуміючи, що більшість щирих покупців шукають окремі книги, а не замовляють великі партії широко різноманітних видань.
Вчора ірландська книгарня Kennys відзначила “божевільне” замовлення на 5 000 маловідомих видань, повідомила The Irish Times. На відміну від оптових замовлень від університетів чи великих бібліотек, це замовлення здалося підозрілим, тому що покупець не намагався торгуватися щодо ціни — що тепер стало очевидним “червоним прапором”, що потенційно пов’язаний зі ШІ, повідомляє Times.
Хоча деякі книготорговці заявили, що можуть отримати короткострокову вигоду від великих замовлень, вони побоюються, що продаж компаніям ШІ, які без розбору знищують свої колекції, “може означати підписання власного смертного вироку”, — повідомляє Times.
Томаш Кенні з Kennys Bookshop сказав Times, що ШІ “тероризує нашу галузь”, і він планує відмовлятися від замовлень, ймовірно, призначених для навчання ШІ, намагаючись захистити права авторів на їхню працю та доступ читачів до важкодоступних видань.
“Книготорговці часто опиняються на передовій багатьох моральних дилем та політичних і етичних питань. У більшості випадків, мені не вирішувати”, — сказав він. “Однак, якщо вони беруть книгу і сканують її з метою отримання інтелектуальної власності, то Kennys не хочуть бути частиною цього”.
Цілком можливо, що громадський осуд змусить найбільші фірми прийняти методи, подібні до Internet Archive, які зосереджені як на фізичному, так і на цифровому збереженні рідкісних книг. Але серце щемить уявляти альтернативу, де рідкісні книги стають ще рідкіснішими, особливо для тих, хто любить відчуття тримати стару книгу в руках.
Чжан знає про привабливість рідкісних книг, час від часу зупиняючись у своїй роботі, щоб прочитати частини видань, які вона сканує. Коли її запитали, що їй найбільше подобається в її роботі, Чжан відповіла з тим самим запалом, який відчувають багато книголюбів, переглядаючи полиці в таких магазинах, як Kennys.
“Все! Мені все цікаво”, — сказала Чжан. “Я не відчуваю, що це нудно. Кожна колекція важлива для мене”.
За даними порталу: arstechnica.com
