Чому люди потребують модерації людей.
Іноді доводиться боротися з вогнем за допомогою вогню. Але коли йдеться про штучний інтелект, який продукує беззмістовний контент, та розпалювання ненависті, що загрожують безпеці та цінності соціальних платформ, додавання більшої кількості “вогню” — тобто, більше ШІ — може погіршити проблему.
У найкращому разі соціальні мережі можуть стати притулком для людей, які хочуть ділитися своїм досвідом та знаннями. Цей ідеал наближається, коли користувачі створюють автентичний, цінний контент, чи то унікально вдумливий допис у блозі, чи корисне відео про збирання ПК. Покладання переважно на інструменти ШІ для збереження цієї автентичності втрачає те, що робить соціальні мережі вартими уваги з самого початку: людей, які за ними стоять.
Помилкові видалення
У квітні канал Slack для модераторів спільноти r/AskHistorians на Reddit був зазвичай жвавим. Канал, який автоматично отримує посилання на повідомлення modmail, був затоплений сповіщеннями після того, як десятки коментарів та дописів, датовані 10 роками, були автоматично видалені з сабредіту.
«І нічого не могли зробити ані ми, ані експерти [які розмістили видалений контент]», — розповіла мені доктор Сара Гілберт, одна з модераторів.
Це було особливо збитковим для сабредіту, оскільки його користувачі розглядають спільноту як архів детальних відповідей, які продовжують навчати людей довго після публікації контенту.
Модератори вважають, що за видалення відповідальні нещодавно оновлені інструменти модерації Reddit на основі ШІ. Після відновлення тексту деяких дописів один з модераторів AskHistorians помітив, що весь видалений контент посилався на Rare Historical Photos, сайт для обміну історичними зображеннями. Модератори думають, що Reddit міг позначити цей вебсайт — а отже, будь-який допис, що використовує його контент для пояснювальних ілюстрацій — як спам.
Reddit не відповів на запит про коментар.
Видалення контенту стерло цінну інформацію, на яку пішов час (Гілберт розповідає, що деякі люди витрачають години, «іноді протягом кількох днів», на дослідження та написання відповідей на запитання, подані до сабредіту). Проте цілком можливо, що ці помилкові видалення та інші подібні до них сприяли показникам, призначеним для демонстрації ефективності модерації за допомогою ШІ на Reddit.
Reddit стверджує, що завдяки ШІ він «збільшив кількість дій щодо припинення розповсюдження контенту, що розпалює ненависть та насильство, більш ніж на 200 відсотків», і що ШІ забезпечує «швидше та більший обсяг припинення». Цього місяця Reddit заявив, що ШІ «допоміг зменшити вплив потенційно шкідливого контенту більш ніж на 40 відсотків». Компанія також зазначила, що використовує великі мовні моделі (LLM) для виявлення «дуже тонких, скоординованих патернів фальшивої поведінки та штучного ажіотажу».
Але, як показує досвід AskHistorians, більше припинень не обов’язково означає краще припинення.
Проблема хибних спрацьовувань
Зростання генеративного ШІ створило нові перешкоди для модерації в соціальних мережах. Гілберт, наприклад, зазначила, що великі мовні моделі «значно ускладнили виявлення спаму», оскільки вони прагнуть наслідувати реальні людські голоси. «За останні два-три місяці ми були абсолютно затоплені спам-ботами на основі LLM», — сказала вона.
Маркетингові агентства створюють контент у соціальних мережах, розроблений для того, щоб бренди цитувалися чат-ботами на основі генеративного ШІ. Маркетологи давно використовують неавтентичні дописи в соціальних мережах для підвищення видимості, але поява чат-ботів відкрила новий фронт. Наприклад, стартап ReachLLM спеціалізується на маркетингу через чат-ботів. В рамках цієї діяльності представники компанії створюють та модерують сабредіти на Reddit.
Ці проблеми спонукали деякі компанії соціальних мереж досліджувати нові методи модерації на основі ШІ. Reddit, наприклад, стверджує, що його інструменти ШІ «щоденно відкликали майже [2 мільйони] фальшивих голосів» і що він використовує LLM «для виявлення дуже тонких, скоординованих патернів фальшивої поведінки та штучного ажіотажу, які старі системи колись пропускали».
Однак багато платформ соціальних мереж стали надмірно покладатися на інструменти модерації ШІ, які швидко карали користувачів за невинний контент.
Нещодавно Discord визнав, що його система модерації ШІ помилково забанила близько 8 400 облікових записів з травня по початок липня. ШІ помилково позначив зображення, що містять квадратні сітки, такі як шахівниці або електронні таблиці, як CSAM (матеріали сексуального насильства над дітьми) і згодом наклав постійний бан на завантажувачів. (Discord стверджує, що всі постраждалі облікові записи відтоді були відновлені).
Компанія заявила, що її модерація ШІ не призначена для використання без людського нагляду. Вона стверджувала, що співробітник-людина мав переглядати контент, позначений ШІ, перш ніж Discord вживатиме заходів, але помилка призвела до того, що ШІ обійшов людський крок і забанив облікові записи.
Нібито прикра подія підкреслює, чому людські запобіжники залишаються важливими в модерації контенту. Без належного нагляду система модерації на основі ШІ може припуститися тисяч помилок за кілька тижнів, з довготривалими наслідками.
З 2025 року багато користувачів Facebook та Instagram скаржилися на масові бани, які вони пов’язують з модерацією ШІ. Відсутність людської модерації лише посилила розчарування серед користувачів, які стверджують, що не порушували жодних правил, особливо з огляду на те, що не було можливості поговорити зі співробітником Meta про причину бану чи про те, як відновити обліковий запис. Meta не повідомила, чи стоїть за банами ШІ, але компанія останніми роками все більше покладається на модерацію на основі генеративного ШІ, а не на людей — зміна, яка, на думку деяких людей, включаючи співробітників Meta, відбувається занадто швидко.
Tumblr — ще одна соціальна спільнота, де автоматизовані системи модерації зазнали невдачі. У березні Ченда Нґак, керівник відділу комунікацій материнської компанії Tumblr Automattic, повідомила The Verge, що автоматизовані системи Tumblr помилково забанили «менше 200» облікових записів Tumblr за один день.
А у 2025 році користувачі Tumblr скаржилися на те, що системи автоматичної модерації контенту платформи неточно позначали контент як «для дорослих», зменшуючи його видимість. В обох випадках користувачі звинувачували ШІ. Tumblr ніколи не підтверджував, що саме ШІ спричинив ці проблеми, але компанія заявила, що використовує «поєднання класифікації машинного навчання та людської модерації».
Модерація за допомогою ШІ може заощадити компаніям соціальних мереж гроші та допомогти швидше видаляти шкідливий контент. Але доки ці системи не зможуть усунути елементарні помилки — як-от позначення зображення шахівниці як CSAM — їм потрібен людський нагляд.
«Коли в системі було більше прозорості, ми регулярно повідомляли про розпалювання ненависті та отримували автоматичну відповідь, що це насправді не порушує правил Reddit, що спонукало нас розпочати процес апеляції», — сказала модератор AskHistorians Гілберт. «Тож важко довіряти цифрам, тому що важко довіряти «судженню» систем Reddit».
Хибні спрацьовування — це «величезна проблема» на Reddit, зазначила вона.
Упередження ШІ
Типові системи модерації в соціальних мережах на основі ШІ використовують класифікатори машинного навчання для аналізу дописів та виявлення та позначення контенту, що порушує правила платформи. Але машині важко зрозуміти нюанси сарказму, сатири та сленгу.
Крім того, деякі дослідження (приклади тут, тут та тут) свідчать про те, що маргіналізовані групи можуть непропорційно постраждати від модерації ШІ. Без людського нагляду ШІ може в кінцевому підсумку карати саме ті спільноти, які найбільш вразливі до шкідливого контенту, для боротьби з яким розроблені ці системи.
Гілберт, яка також є директором з досліджень Citizens and Technology Lab Корнелльського університету, зазначає, що «маргіналізовані та вразливі групи населення є одними з тих, хто зазнає найвищого рівня модерації, і зазвичай це є результатом «хибних спрацьовувань», часто спричинених випадками контр-висловлювань, мовного відродження та «відповідей на шкідливий контент».
«Хибні спрацьовування — це питання справедливості. Вони означають, що групи, які вже є маргіналізованими, стають ще більш приглушеними та цензурованими», — додала вона.
Модератори на основі ШІ також можуть зробити спільноти менш ефективними у самомодерації. Наприклад, на Reddit деякі модератори сабредітів віддають перевагу банити користувачів, які використовують мову ворожнечі чи насильства. Але якщо ШІ Reddit видаляє такий контент до того, як його побачить модератор-людина, ці модератори втрачають можливість оцінити, чи виправданий бан.
Щодо надання модераторам-людям більшого контролю, Reddit цього тижня оголосив про розширення тестування Rules Hub — набору інструментів, який дозволяє модераторам-людям «вибирати, які правила слід автоматично застосовувати, вирішувати, що відбувається при спрацьовуванні правила (надсилати до черги, фільтрувати або видаляти), попередньо переглядати досвід перед його ввімкненням, а також переглядати журнали та статистику». Reddit очікує, що Rules Hub врешті-решт замінить інструмент Automod, який покладається переважно на точні ключові слова.
ШІ — це інструмент, а не рішення
Модератори, з якими я спілкувалася, неодноразово звинувачували бум генеративного ШІ у сплеску контенту, що порушує правила спільноти або загальні правила платформи. Це серйозна проблема для соціальних мереж, які покладаються на внесок користувачів.
Компанії продовжуватимуть експериментувати з новими методами більш надійної та ефективної модерації, але зменшення людської участі є кроком назад. Контент, згенерований ШІ з низьким рівнем зусиль, змінює виклики, з якими стикаються команди модераторів, але це робить необхідними більш сильні підходи, де виявлення в масштабі машини може поєднуватися з людським судженням та досвідом.
Так само, як соціальні мережі не мають цінності без людей, модерація контенту не може бути успішною без людського судження на передньому плані.
Advance Publications, якій належить Condé Nast, материнська компанія Ars Technica, є найбільшим акціонером Reddit.
Шарон Гардінг
Старший кореспондент з питань технологій
Шарон Гардінг — старший кореспондент з питань технологій у Ars Technica, яка пише новини, огляди та аналітику про споживчі гаджети та послуги. Вона займається висвітленням технологій понад 10 років, публікуючись у Tom’s Hardware, Channelnomics та CRN UK.
Оригінал статті: arstechnica.com
