Чому люди потребують модерації людьми.
Технологічні продукти, на які ми покладаємося, постійно змінюються. Іноді ці зміни приносять покращення; інколи вони дратують користувачів або роблять улюблені продукти гіршими.
Щомісяця ми досліджуватимемо найбільші спірні зміни в технологічних продуктах: що змінилося, чому це відбувається, як це впливає на користувачів і як компанії можуть вчинити краще.
Іноді доводиться боротися з вогнем, застосовуючи вогонь. Але коли йдеться про штучний інтелект (ШІ) та ненависницький контент, що загрожує безпеці та цінності соціальних мереж, додавання більшого вогню — у цьому випадку, більше ШІ — може лише погіршити проблему.
У найкращому разі соціальні мережі можуть бути притулком для людей, які хочуть ділитися своїм досвідом і знаннями. Це ідеально проявляється, коли користувачі роблять автентичний, цінний внесок, чи то унікально глибокий допис у блозі, чи корисне відео про збірку ПК. Покладання переважно на інструменти ШІ для збереження цієї автентичності нівелює те, що робить соціальні мережі вартими уваги з самого початку: людей, які за ними стоять.
Помилкові видалення
У квітні канал Slack для модераторів спільноти r/AskHistorians був зазвичай жвавим. Канал, який автоматично отримував посилання на повідомлення modmail, був затоплений сповіщеннями після того, як десятки коментарів та дописів, яким до 10 років, були автоматично видалені з сабредіту.
«І ми, і експерти [які опублікували видалений контент] нічого не могли з цим вдіяти», — розповіла мені доктор Сара Ґілберт, одна з модераторок.
Це було особливо руйнівним для сабредіту, оскільки його користувачі вважають спільноту архівом детальних відповідей, які продовжують навчати людей ще довго після публікації контенту.
Модератори вважають, що нещодавно оновлені інструменти модерації на основі ШІ від Reddit, ймовірно, стали причиною видалень. Відновивши текст деяких дописів, один із модераторів AskHistorians помітив, що весь видалений контент посилався на Rare Historical Photos — вебсайт для обміну історичними зображеннями. Модератори думають, що Reddit міг позначити цей вебсайт, а отже, і будь-який допис, що використовує його контент для пояснювальних ілюстрацій, як спам.
Reddit не відповів на запит про коментар.
Видалення контенту стерло цінну інформацію, на збір якої знадобився час (Ґілберт розповідає, що деякі люди витрачають години, «іноді протягом кількох днів», на дослідження та написання відповідей на запитання, що надходять до сабредіту). Однак цілком можливо, що ці помилкові видалення та інші подібні сприяли метрикам, призначеним для демонстрації ефективності модерації за допомогою ШІ на Reddit.
Reddit стверджує, що завдяки ШІ він «збільшив заходи щодо боротьби з ненависницьким та насильницьким контентом більш ніж на 200 відсотків», і що ШІ забезпечує «швидше та об’ємніше примусове виконання». Цього місяця Reddit заявив, що ШІ «допоміг зменшити вплив потенційно шкідливого контенту більш ніж на 40 відсотків». Компанія також зазначила, що використовує великі мовні моделі (LLM) для виявлення «надзвичайно тонких, скоординованих моделей фейкової поведінки та штучного ажіотажу».
Але, як показує приклад AskHistorians, більше примусового виконання не обов’язково означає краще примусове виконання.
Проблема хибних спрацьовувань
Зростання генеративного ШІ створило нові перешкоди для модерації в соціальних мережах. Ґілберт, наприклад, зазначила, що великі мовні моделі «значно ускладнили виявлення спаму», оскільки вони прагнуть імітувати справжні людські голоси. «За останні два-три місяці нас просто затопили спам-боти на базі LLM», — сказала вона.
Маркетингові агентства створюють контент для соціальних мереж, розроблений для того, щоб бренди цитували чат-боти на основі генеративного ШІ. Маркетологи давно використовують неавтентичні публікації в соціальних мережах для підвищення видимості, але поява чат-ботів відкрила новий фронт. Наприклад, стартап ReachLLM спеціалізується на маркетингу через чат-боти. У рамках цих зусиль представники компанії створили та модерують сабредіти на Reddit.
Ці виклики змусили деякі компанії, що працюють із соціальними мережами, досліджувати нові методи модерації на основі ШІ. Reddit, наприклад, стверджує, що його інструменти ШІ «щоденно відкликають майже [2 мільйони] фейкових голосів» і що він використовує LLM «для виявлення надзвичайно тонких, скоординованих моделей фейкової поведінки та штучного ажіотажу, які старі системи раніше не помічали».
Однак багато платформ соціальних мереж стали надмірно покладатися на інструменти модерації ШІ, які швидко карали користувачів за невинний контент.
Нещодавно Discord визнав, що його система модерації ШІ помилково забанила близько 8 400 облікових записів з травня по початок липня. ШІ помилково розпізнав зображення, що містять квадратні сітки, як-от шахові дошки або електронні таблиці, як CSAM (матеріали сексуального насильства над дітьми) і відповідно видав постійний бан завантажувачам. (Discord стверджує, що всі постраждалі облікові записи згодом були відновлені.)
Компанія заявила, що її ШІ-модерація не призначена для використання без людського нагляду. Вона стверджувала, що співробітник-людина мав переглядати контент, позначений ШІ, перш ніж Discord вживатиме заходів, але помилка призвела до того, що ШІ обійшов людський етап і заблокував облікові записи.
Нібито прикра пригода підкреслює, чому людські запобіжники залишаються важливими в модерації контенту. Без належного нагляду система модерації на основі ШІ може припуститися тисяч помилок за кілька тижнів, що матиме довготривалі наслідки.
З 2025 року багато користувачів Facebook та Instagram скаржилися на масові бани, які вони пов’язують із модерацією ШІ. Відсутність людської модерації лише посилювала розчарування користувачів, які стверджують, що не порушували жодних правил, особливо зважаючи на відсутність можливості поспілкуватися зі співробітником Meta щодо причин бану чи способів відновлення облікового запису. Meta не повідомила, чи стоїть ШІ за банами, але останніми роками компанія все більше покладається на модерацію на основі генеративного ШІ, а не на людей — крок, який, на думку деяких людей, зокрема співробітників Meta, відбувається надто швидко.
Tumblr — ще одна соціальна спільнота, де автоматизовані системи модерації зазнали невдачі. У березні Ченда Нґак, керівниця відділу комунікацій материнської компанії Tumblr Automattic, повідомила The Verge, що автоматизовані системи Tumblr помилково забанили «менше 200» облікових записів Tumblr за один день.
А у 2025 році користувачі Tumblr скаржилися, що системи автоматичної модерації контенту платформи неточно позначали контент як «для дорослих», зменшуючи його видимість. В обох випадках користувачі звинувачували ШІ. Tumblr ніколи не підтверджував, що саме ШІ спричинив ці проблеми, але компанія заявила, що використовує «поєднання машинного навчання та людської модерації».
Модерація за допомогою ШІ може заощадити компаніям соціальних мереж гроші та допомогти швидше видаляти шкідливий контент. Але доки ці системи не зможуть усунути базові помилки — як-от позначення зображення шахівниці як CSAM — їм потрібен людський нагляд.
«Коли в системі була більша прозорість, ми регулярно повідомляли про ненависть і отримували автоматичну відповідь, що це насправді не порушує правил Reddit, що спонукало нас розпочати процес апеляції», — сказала Ґілберт, модераторка AskHistorians. «Тож важко довіряти цифрам, тому що важко довіряти «судженню» систем Reddit».
Хибні спрацьовування — це «величезна проблема» на Reddit, зазначила вона.
Упередження ШІ
Типові системи модерації в соціальних мережах на основі ШІ використовують класифікатори машинного навчання для аналізу дописів та виявлення контенту, що порушує правила платформи. Але машині важко зрозуміти нюанси сарказму, сатири та сленгу.
Крім того, деякі дослідження (приклади тут, тут і тут) свідчать про те, що маргіналізовані групи можуть непропорційно страждати від модерації ШІ. Без людського нагляду ШІ може карати саме ті спільноти, які є найбільш вразливими до ненависницького контенту, з яким системи покликані боротися.
Ґілберт, яка також є директоркою з досліджень Citizens and Technology Lab Корнелльського університету, каже, що «маргіналізовані та вразливі групи населення є одними з тих, хто найчастіше стикається з модерацією, і зазвичай це є результатом «хибних спрацьовувань», які часто спричинені випадками контрвідповіді, відновлення мови та «відповідями на ворожий контент».
«Хибні спрацьовування — це питання справедливості. Це означає, що групи, які вже маргіналізовані, зазнають ще більшого замовчування та цензури», — додала вона.
Модератори ШІ також можуть робити спільноти менш ефективними у самомодерації. Наприклад, на Reddit деякі модератори сабредітів віддають перевагу бану користувачів, які використовують ворожу або насильницьку риторику. Але якщо ШІ Reddit видаляє такий контент до того, як його побачить модератор-людина, ці модератори втрачають можливість оцінити, чи виправданий бан.
Щодо надання модераторам-людям більшого контролю, Reddit цього тижня оголосив про розширення тестування Rules Hub — набору інструментів, який дозволяє модераторам-людям «вибирати, які правила слід автоматично застосовувати, вирішувати, що відбувається при спрацьовуванні правила (надсилати до черги, фільтрувати або видаляти), попередньо переглядати досвід перед його увімкненням, а також переглядати журнали та аналітику». Reddit очікує, що Rules Hub зрештою замінить інструмент Automod, який покладається переважно на точні ключові слова.
ШІ — це інструмент, а не розв’язання
Модератори, з якими я спілкувалася, неодноразово звинувачували бум генеративного ШІ у сплеску контенту, що порушує специфічні для спільноти або ширші правила платформи. Це серйозна проблема для соціальних мереж, які покладаються на внесок користувачів.
Компанії продовжуватимуть випробовувати нові методи модерації надійніше та ефективніше, але зменшення людського внеску є кроком назад. Низькоякісний контент, згенерований ШІ, змінює виклики, з якими стикаються команди модерації, але це робить більш необхідними потужніші підходи, де виявлення в масштабі машини може поєднуватися з людським судженням та досвідом.
Так само, як соціальні мережі не мають цінності без людей, модерація контенту не може бути успішною без людського судження на першому плані.
Advance Publications, яка володіє Condé Nast, материнською компанією Ars Technica, є найбільшим акціонером Reddit.
Джерело новини: arstechnica.com
