Штучний інтелект не здатен захистити спільноти соцмереж від самого себе

Чому людям потрібні модератори-люди.

Штучний інтелект не здатен захистити спільноти соцмереж від самого себе 1 Штучний інтелект не здатен захистити спільноти соцмереж від самого себе 2

Іноді доводиться боротися з вогнем за допомогою вогню. Але коли йдеться про низькоякісний контент, створений ШІ, та мову ворожнечі, що загрожують безпеці та цінності соціальних платформ, додавання більше вогню — у цьому випадку, більше ШІ — може посилити проблему.

У найкращому разі соціальні мережі можуть бути притулком для людей, які хочуть ділитися своїм досвідом та знаннями. Цей ідеал досягається найближче, коли користувачі роблять внесок у автентичний, цінний контент, чи то унікальний глибокий допис у блозі, чи корисне відео про збирання ПК. Покладання виключно на інструменти ШІ для збереження автентичності упускає те, що робить соціальні мережі вартими уваги з самого початку: людей, які за ними стоять.

Помилкові видалення

У квітні канал Slack для модераторів спільноти r/AskHistorians на Reddit зазвичай був жвавим. Канал, який автоматично отримував посилання на повідомлення modmail, був затоплений сповіщеннями після того, як десятки коментарів та дописів, датованих 10 роками, були автоматично видалені з сабредіту.

«І ми, і експерти [які опублікували видалений контент] нічого не могли з цим зробити», — розповіла мені доктор Сара Гілберт, одна з модераторів.

Це було особливо руйнівним для сабредіту, оскільки його користувачі вважають спільноту архівом детальних відповідей, які продовжують навчати людей довгий час після публікації контенту.

Модератори вважають, що за видаленнями стояли нещодавно оновлені інструменти модерації ШІ Reddit. Відновивши тексти деяких дописів, один із модераторів AskHistorians помітив, що весь видалений контент посилався на Rare Historical Photos — вебсайт для обміну історичними зображеннями. Модератори думають, що Reddit міг позначити цей вебсайт, а отже, будь-який допис, що використовує його контент для пояснювальних ілюстрацій, як спам.

Reddit не відповів на запит щодо коментаря.

Видалення контенту стерло цінну інформацію, на збір якої знадобився час (Гілберт розповідає, що деякі люди витрачають години, «іноді протягом кількох днів», на дослідження та написання відповідей на запитання, подані до сабредіту). Проте цілком можливо, що ці помилкові видалення та інші подібні внесли свій вклад у показники, призначені для демонстрації ефективності ШІ-модерації на Reddit.

Reddit стверджує, що завдяки ШІ він «збільшив на 200 відсотків кількість дій щодо боротьби з ворожим та насильницьким контентом» та що ШІ забезпечує «швидше та більш об’ємне реагування». Reddit повідомив цього місяця, що ШІ «допоміг скоротити вплив потенційно шкідливого контенту більш ніж на 40 відсотків». Компанія також зазначила, що використовує великі мовні моделі (LLM) для виявлення «дуже тонких, скоординованих патернів фальшивої поведінки та штучного ажіотажу».

Однак, як показує ситуація з AskHistorians, більше реагування не обов’язково означає краще реагування.

Проблема хибних спрацьовувань

Зростання генеративного ШІ створило нові перешкоди для модерації в соціальних мережах. Гілберт, наприклад, зазначила, що великі мовні моделі «значно ускладнили виявлення спаму», оскільки вони прагнуть імітувати справжні людські голоси. «Протягом останніх двох-трьох місяців ми були просто затоплені спам-ботами на основі LLM», — сказала вона.

Маркетингові агентства створюють контент для соціальних мереж, призначений для того, щоб бренди цитувалися чат-ботами ШІ. Маркетологи давно використовують неавтентичні дописи в соціальних мережах для підвищення видимості, але поява чат-ботів відкрила новий фронт. Наприклад, стартап ReachLLM спеціалізується на маркетингу через чат-боти. У рамках цієї діяльності представники компанії створили та модерують сабредіти на Reddit.

Ці виклики спонукали деякі соціальні компанії досліджувати нові методи модерації на основі ШІ. Reddit, наприклад, стверджує, що його інструменти ШІ «щодня відкликали майже [2 мільйони] фальшивих голосів» і що він використовує LLM «для виявлення дуже тонких, скоординованих патернів фальшивої поведінки та штучного ажіотажу, які старі системи колись пропускали».

Проте багато соціальних платформ стали надмірно залежними від інструментів ШІ-модерації, які швидко карали користувачів за нешкідливий контент.

Нещодавно Discord визнав, що його система ШІ-модерації помилково забанила близько 8 400 облікових записів з травня по початок липня. ШІ помилково класифікував зображення, що містять квадратні сітки, такі як шахівниці або електронні таблиці, як CSAM (матеріали із сексуальним насильством над дітьми) і згодом накладав постійні бани на завантажувачів. (Discord стверджує, що всі постраждалі облікові записи були відновлені.)

Компанія заявила, що її ШІ-модерація не призначена для використання без людського нагляду. Вона стверджувала, що співробітник-людина мав переглядати контент, позначений ШІ, перш ніж Discord вживав заходів, але помилка призвела до того, що ШІ обійшов людський етап і забанив облікові записи.

Цей нібито прикрий випадок підкреслює, чому людські запобіжники залишаються важливими у модерації контенту. Без значного нагляду система модерації на основі ШІ може зробити тисячі помилок за кілька тижнів, що матиме тривалі наслідки.

З 2025 року багато користувачів Facebook та Instagram скаржаться на масові бани, які вони пов’язують із ШІ-модерацією. Відсутність людської модерації лише посилила розчарування серед користувачів, які стверджують, що не порушували жодних правил, особливо з огляду на відсутність можливості поговорити зі співробітником Meta про причини бану або способи відновлення облікового запису. Meta не уточнила, чи стоїть ШІ за банами, але компанія все більше покладається на модерацію на основі генеративного ШІ, а не на людей, в останні роки — зміна, яка, на думку деяких людей, включаючи співробітників Meta, відбувається надто швидко.

Tumblr — це ще одна соціальна спільнота, де автоматизовані системи модерації зазнали невдачі. У березні Ченда Нґак, керівник відділу комунікацій материнської компанії Tumblr Automattic, повідомив The Verge, що автоматизовані системи Tumblr помилково забанили «менше 200» облікових записів Tumblr за один день.

А у 2025 році користувачі Tumblr скаржилися, що автоматичні системи модерації контенту платформи неточно позначали контент як «для дорослих», знижуючи його видимість. В обох випадках користувачі звинувачували ШІ. Tumblr ніколи не підтверджував, що ШІ спричинив ці проблеми, але компанія заявила, що використовує «поєднання класифікації машинного навчання та людської модерації».

ШІ-модерація може заощадити кошти компаній соціальних мереж та допомогти швидше видаляти шкідливий контент. Але доки ці системи не зможуть усунути базові помилки — як-от позначення зображення шахівниці як CSAM — вони потребуватимуть людського нагляду.

«За часів, коли в системі була більша прозорість, ми регулярно повідомляли про ненависть і отримували автоматичну відповідь, що це насправді не порушує правил Reddit, спонукаючи нас розпочати процес апеляції», — сказала модератор AskHistorians Гілберт. «Тому важко довіряти цифрам, бо важко довіряти «судженню» систем Reddit».

За її словами, хибні спрацьовування є «величезною проблемою» на Reddit.

Упередження ШІ

Типові системи модерації соціальних мереж на основі ШІ використовують класифікатори машинного навчання для аналізу дописів та виявлення та позначення контенту, що порушує правила платформи. Але машині важко зрозуміти нюанси сарказму, сатири та сленгу.

Крім того, деякі дослідження (приклади тут, тут і тут) свідчать, що маргіналізовані групи можуть непропорційно страждати від ШІ-модерації. Без людського нагляду ШІ може в кінцевому підсумку карати саме ті спільноти, які є найбільш вразливими до ворожого контенту, для боротьби з яким розроблені ці системи.

Гілберт, яка також є директоркою з досліджень Лабораторії громадян та технологій Корнелльського університету, каже, що «маргіналізовані та вразливі групи населення належать до тих, хто зазнає найвищого рівня модерації, і зазвичай це є результатом «хибних спрацьовувань», часто спричинених випадками контрвисловлювань, відновлення мови та «відповідей на ворожий контент».

«Хибні спрацьовування — це питання рівності. Вони означають, що групи, які вже є маргіналізованими, ще більше замовчуються та цензуруються», — додала вона.

ШІ-модератори також можуть зробити спільноти менш ефективними у самомодерації. Наприклад, на Reddit деякі модератори сабредітів віддають перевагу банити користувачів, які використовують ворожу або агресивну риторику. Але якщо ШІ Reddit видаляє такий контент до того, як його побачить модератор-людина, ці модератори втрачають можливість оцінити, чи виправданий бан.

Щодо надання модераторам-людям більшого контролю, Reddit цього тижня оголосив про розширення тестування Rules Hub — набору інструментів, який дозволяє модераторам-людям «вибирати, які правила мають бути автоматично застосовані, вирішувати, що відбувається при спрацьовуванні правила (відправити до черги, фільтрувати або видалити), попередньо переглядати досвід перед його активацією, а також переглядати журнали та аналітику». Reddit очікує, що Rules Hub зрештою замінить інструмент Automod, який спирається переважно на точні ключові слова.

ШІ — це інструмент, а не рішення

Модератори, з якими я спілкувалася, неодноразово звинувачували бум генеративного ШІ у сплеску контенту, що порушує правила спільнот або більш загальні правила платформ. Це серйозна проблема для соціальних мереж, які покладаються на внесок користувачів.

Компанії продовжуватимуть пробувати нові методи для більш надійної та ефективної модерації, але зменшення людського внеску є кроком назад. Контент, створений ШІ з низьким рівнем зусиль, змінює виклики, з якими стикаються команди модерації, але це робить ще більш необхідними сильніші підходи, де виявлення в масштабі машин може поєднуватися з людським судженням та досвідом.

Так само, як соціальні мережі не мають цінності без людей, модерація контенту не може бути успішною без людського судження на першому плані.

Advance Publications, яка володіє Condé Nast, материнською компанією Ars Technica, є найбільшим акціонером Reddit.

Штучний інтелект не здатен захистити спільноти соцмереж від самого себе 3

Дізнатися більше на: arstechnica.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *