Чому люди потребують модерації людей.
Іноді доводиться боротися з вогнем за допомогою вогню. Але коли йдеться про «штучний» контент та образливий матеріал, що загрожують безпеці та цінності соціальних платформ, додавання ще більшої кількості штучного інтелекту може погіршити проблему.
У найкращому разі соціальні мережі можуть стати притулком для людей, які хочуть ділитися своїм досвідом та знаннями. Цього ідеалу вони досягають найближче, коли користувачі роблять внесок в автентичний, цінний контент, чи то унікальний змістовний допис у блозі, чи корисне відео про те, як зібрати ПК. Покладання переважно на інструменти ШІ для збереження цієї автентичності упускає те, що робить соціальні мережі вартими уваги з самого початку: людей, які стоять за ними.
Помилкові видалення
У квітні канал Slack для модераторів спільноти r/AskHistorians був зазвичай жвавим. Канал, який автоматично отримує посилання на повідомлення modmail, був затоплений сповіщеннями після того, як десятки коментарів та дописів, що датувалися 10 роками, були автоматично видалені з сабредіту.
«І ні ми, ні експерти [які розмістили видалений контент] нічого не могли з цим вдіяти», — розповіла мені докторка Сара Гілберт, одна з модераторок.
Це було особливо шкідливо для сабредіту, оскільки його користувачі вважають спільноту архівом детальних відповідей, які продовжують навчати людей ще довго після публікації контенту.
Модератори вважають, що нещодавно оновлені інструменти модерації на основі ШІ від Reddit, ймовірно, спричинили видалення. Відновивши текст деяких дописів, один з модераторів AskHistorians помітив, що весь видалений контент посилався на Rare Historical Photos, вебсайт для спільного використання історичних зображень. Модератори вважають, що Reddit міг позначити вебсайт, а отже, будь-який допис, що використовує його контент для пояснювальних ілюстрацій, як спам.
Reddit не відповів на запит про коментар.
Видалення контенту стерло цінну інформацію, на збір якої пішов час (Гілберт каже, що деякі люди витрачають години, «іноді протягом кількох днів», на дослідження та написання відповідей на запитання, що надходять до сабредіту). Проте, цілком можливо, що ці помилкові видалення, та інші подібні, сприяли досягненню показників, призначених для демонстрації ефективності модерації за допомогою ШІ на Reddit.
Reddit стверджує, що завдяки ШІ він «збільшив кількість заходів щодо боротьби з ненависним та насильницьким контентом більш ніж на 200 відсотків», і що ШІ забезпечує «швидше, масштабніше примусове виконання правил». Цього місяця Reddit заявив, що ШІ «допоміг зменшити вплив потенційно шкідливого контенту більш ніж на 40 відсотків». Компанія також зазначила, що використовує великі мовні моделі (LLM) для виявлення «дуже тонких, скоординованих патернів фальшивої поведінки та штучного ажіотажу».
Але, як показує досвід AskHistorians, більше примусового виконання не обов’язково означає краще примусове виконання.
Проблема хибних спрацьовувань
Зростання генеративного ШІ створило нові перешкоди для модерації в соціальних мережах. Гілберт, наприклад, зазначила, що великі мовні моделі «значно ускладнили виявлення спаму», оскільки вони прагнуть імітувати справжні людські голоси. «За останні два-три місяці нас абсолютно затопили спам-боти на основі LLM», — сказала вона.
Маркетингові агентства створюють контент для соціальних мереж, призначений для того, щоб бренди цитувалися чат-ботами на основі ШІ. Маркетологи давно використовують неавтентичні дописи в соціальних мережах для підвищення видимості, але поява чат-ботів відкрила новий фронт. Наприклад, стартап ReachLLM спеціалізується на маркетингу через чат-боти. У рамках цієї діяльності представники компанії створюють і модерують сабредіти на Reddit.
Ці виклики спонукали деякі соціальні компанії вивчати нові методи модерації на основі ШІ. Reddit, наприклад, стверджує, що його інструменти ШІ «щоденно відкликали майже [2 мільйони] фальшивих голосів» і що він використовує LLM «для виявлення дуже тонких, скоординованих патернів фальшивої поведінки та штучного ажіотажу, які старі системи колись пропускали».
Але багато соціальних платформ стали надмірно залежними від інструментів модерації ШІ, які швидко карали користувачів за нешкідливий контент.
Нещодавно Discord визнав, що його система модерації на основі ШІ помилково заблокувала близько 8 400 облікових записів з травня по початок липня. ШІ помилково позначив зображення, що містять квадратні сітки, такі як шахівниці або електронні таблиці, як CSAM (дитячий сексуальний матеріал) і згодом наклав постійне блокування на завантажувачів. (Discord стверджує, що всі постраждалі облікові записи були відновлені.)
Компанія заявила, що її модерація на основі ШІ не призначена для використання без людського нагляду. Вона стверджувала, що співробітник-людина повинен перевіряти контент, позначений ШІ, перш ніж Discord вживе заходів, але помилка призвела до того, що ШІ обійшов людський крок і заблокував облікові записи.
Це так звана прикрість підкреслює, чому людські запобіжники залишаються важливими в модерації контенту. Без значущого нагляду система модерації на основі ШІ може зробити тисячі помилок за кілька тижнів, з довготривалими наслідками.
З 2025 року багато користувачів Facebook та Instagram скаржилися на масові блокування, які вони приписують модерації ШІ. Відсутність людської модерації лише посилила розчарування серед користувачів, які стверджують, що вони не порушували жодних правил, особливо зважаючи на те, що не було способу поговорити зі співробітником Meta про причину блокування або як відновити обліковий запис. Meta не повідомила, чи стоїть за блокуваннями ШІ, але компанія останніми роками все більше покладається на модерацію на основі генеративного ШІ, а не на людей — зміна, яка, на думку деяких людей, включаючи співробітників Meta, відбувається занадто швидко.
Tumblr — ще одна соціальна спільнота, де автоматизовані системи модерації зазнали невдачі. У березні Ченда Нґак, керівник відділу комунікацій материнської компанії Tumblr Automattic, повідомила The Verge, що автоматизовані системи Tumblr помилково заблокували «менше 200» облікових записів Tumblr за один день.
А в 2025 році користувачі Tumblr скаржилися після того, як системи автоматичної модерації контенту платформи неточно позначили контент як «зрілий», зменшивши його видимість. В обох випадках користувачі звинуватили ШІ. Tumblr ніколи не підтвердив, що ШІ спричинив ці проблеми, але компанія заявила, що використовує «суміш класифікації машинного навчання та людської модерації».
Модерація ШІ може заощадити соціальним компаніям гроші та допомогти швидше видаляти шкідливий контент. Але поки ці системи не зможуть усунути базові помилки — як-от позначення зображення шахівниці як CSAM — їм потрібен людський нагляд.
«Коли в системі було більше прозорості, ми регулярно повідомляли про ненависть і отримували автоматичну відповідь, що це насправді не порушує правил Reddit, спонукаючи нас розпочати процес апеляції», — сказала модераторка AskHistorians Гілберт. «Тож важко довіряти цифрам, тому що важко довіряти «судженню» систем Reddit».
Хибні спрацьовування — це «величезна проблема» на Reddit, сказала вона.
Упередження ШІ
Типові системи модерації в соціальних мережах на основі ШІ використовують класифікатори машинного навчання для аналізу дописів та виявлення та позначення контенту, який порушує правила платформи. Але машині важко зрозуміти нюанси сарказму, сатири та сленгу.
Крім того, деякі дослідження (приклади тут, тут та тут) свідчать про те, що маргіналізовані групи можуть непропорційно страждати від модерації ШІ. Без людського нагляду ШІ може карати ті самі спільноти, які є найбільш вразливими до шкідливого контенту, який ці системи покликані боротися.
Гілберт, яка також є директором з досліджень Citizens and Technology Lab Корнельського університету, каже, що «маргіналізовані та вразливі групи населення належать до тих, хто зазнає найвищого рівня модерації, і зазвичай це є результатом «хибних спрацьовувань», часто спричинених випадками контрмови, відродження мови та «відповідей на шкідливий контент».
«Хибні спрацьовування — це питання справедливості. Вони означають, що групи, які вже є маргіналізованими, ще більше замовчуються та цензуруються», — додала вона.
Модератори ШІ також можуть зробити спільноти менш ефективними в самомодерації. Наприклад, на Reddit деякі модератори сабредітів віддають перевагу блокуванню користувачів, які використовують риторику ненависті чи насильства. Але якщо ШІ Reddit видаляє такий контент до того, як його побачить модератор-людина, ці модератори втрачають можливість оцінити, чи виправдане блокування.
Щодо надання модераторам-людям більшого контролю, Reddit цього тижня оголосив про розширення тестування Rules Hub — набору інструментів, який дозволяє модераторам-людям «вибирати, які правила мають автоматично виконуватися, вирішувати, що відбувається при спрацьовуванні правила (відправити до черги, фільтрувати або видалити), попередньо переглядати досвід перед його активацією, а також переглядати журнали та статистику». Reddit очікує, що Rules Hub зрештою замінить інструмент Automod, який покладається переважно на точні ключові слова.
ШІ — це інструмент, а не рішення
Модератори, з якими я розмовляв, неодноразово звинувачували бум генеративного ШІ у сплеску контенту, який порушує правила спільнот або загальні правила платформ. Це серйозна проблема для соціальних мереж, які покладаються на внесок користувачів.
Компанії продовжуватимуть випробовувати нові методи більш надійної та ефективної модерації, але зменшення людської участі є кроком назад. Контент, створений за допомогою ШІ з мінімальними зусиллями, змінює виклики, з якими стикаються команди модерації, але це робить необхіднішими більш сильні підходи, де виявлення в масштабі машини може поєднуватися з людським судженням та експертизою.
Так само, як соціальні мережі не мають цінності без людей, модерація контенту не може бути успішною без людського судження на першому місці.
Advance Publications, якій належить Condé Nast, материнська компанія Ars Technica, є найбільшим акціонером Reddit.

Старша репортерка з технологій
Шарон Гардінг
Шарон — старша репортерка з технологій в Ars Technica, яка пише новини, огляди та аналітику про споживчу електроніку та послуги. Вона займається висвітленням технологій понад 10 років, публікуючись у Tom’s Hardware, Channelnomics та CRN UK.
Джерело новини: arstechnica.com
