Чому люди потребують контролю над людьми.
Іноді доводиться боротися з вогнем за допомогою вогню. Але коли йдеться про AI-контент низької якості та мову ворожнечі, що загрожують безпеці та цінності соціальних медіаплатформ, додавання більшої кількості вогню — у цьому разі, більше AI — може погіршити проблему.
У найкращому разі соціальні мережі можуть стати притулком для людей, які хочуть ділитися своїм досвідом і знаннями. Вони наближаються до цього ідеалу, коли користувачі роблять внесок в автентичний, цінний контент, чи то унікально продуманий допис у блозі, чи корисне відео про збірку ПК. Покладання виключно на AI-інструменти для збереження цієї автентичності втрачає те, що робить соціальні мережі вартими уваги з самого початку: людей, які стоять за ними.
Помилкові видалення
У квітні канал Slack для модераторів спільноти r/AskHistorians Reddit зазвичай був жвавим. Канал, який автоматично отримує посилання на повідомлення modmail, був затоплений сповіщеннями після того, як десятки коментарів і дописів, датованих 10 роками, були автоматично видалені з сабредіта.
«І ми, і експерти (які розміщували видалений контент) нічого не могли з цим зробити», — розповіла мені докторка Сара Гілберт, одна з модераторів.
Це було особливо руйнівно для сабредіта, оскільки його користувачі розглядають спільноту як архів детальних відповідей, які продовжують навчати людей ще довго після публікації контенту.
Модератори вважають, що нещодавно оновлені AI-інструменти модерації Reddit, очевидно, були відповідальними за ці видалення. Після відновлення тексту деяких дописів один із модераторів AskHistorians помітив, що весь видалений контент посилався на Rare Historical Photos, сайт для спільного використання історичних зображень. Модератори думають, що Reddit міг позначити цей вебсайт — і, відповідно, будь-який допис, що використовує його контент для пояснювальних ілюстрацій — як спам.
Reddit не відповів на запит щодо коментаря.
Видалення контенту стерло цінну інформацію, яку вимагала часу для збору (Гілберт розповідає, що деякі люди витрачають години, «іноді протягом кількох днів», на дослідження та написання відповідей на запитання, що надходять до сабредіта). Однак цілком можливо, що ці помилкові видалення та інші подібні до них сприяли показникам, призначеним для демонстрації ефективності AI-модерації на Reddit.
Reddit стверджує, що завдяки AI він «збільшив заходи щодо боротьби з ворожим і насильницьким контентом більш ніж на 200 відсотків» і що AI забезпечує «швидше, більший обсяг застосування». AI «допоміг зменшити вплив потенційно шкідливого контенту більш ніж на 40 відсотків», — заявив цього місяця Reddit. Також було зазначено, що компанія використовує великі мовні моделі (LLM) для виявлення «дуже тонких, скоординованих моделей фальшивої поведінки та штучного ажіотажу».
Але, як показує досвід AskHistorians, більше застосування не обов’язково означає краще застосування.
Проблема хибних спрацьовувань
Зростання генеративного AI створило нові перешкоди для модерації соціальних мереж. Гілберт, наприклад, зазначила, що великі мовні моделі «значно ускладнили виявлення спаму», оскільки вони прагнуть імітувати справжні людські голоси. «За останні два-три місяці нас абсолютно затопили спам-боти на основі LLM», — сказала вона.
Маркетингові агентства створюють контент для соціальних мереж, розроблений таким чином, щоб бренди цитувалися AI-чатботами. Маркетологи давно використовують неавтентичні дописи в соціальних мережах для підвищення видимості, але поява чатботів відкрила новий фронт. Наприклад, стартап ReachLLM спеціалізується на маркетингу через чатботи. В рамках цієї діяльності представники компанії створили та модерують сабредіти на Reddit.
Ці виклики змусили деякі компанії, що працюють із соціальними мережами, досліджувати нові методи модерації на основі AI. Наприклад, Reddit стверджує, що його AI-інструменти «щодня скасовували майже [2 мільйони] фальшивих голосів» і що компанія використовує LLM «для виявлення дуже тонких, скоординованих моделей фальшивої поведінки та штучного ажіотажу, які старі системи колись пропускали».
Однак багато платформ соціальних мереж стали надмірно залежними від інструментів AI-модерації, які швидко карали користувачів за нешкідливий контент.
Нещодавно Discord визнав, що його AI-модераційна система помилково забанила близько 8 400 облікових записів з травня по початок липня. AI помилково позначив зображення, що містять квадратні сітки, такі як шахівниці або електронні таблиці, як CSAM (матеріали сексуального насильства над дітьми) і згодом наклав постійний бан на завантажувачів. (Discord стверджує, що всі постраждалі облікові записи були відновлені.)
Компанія заявила, що її AI-модерація не призначена для використання без людського нагляду. Вона стверджувала, що співробітник-людина повинен був переглядати контент, позначений AI, перед тим, як Discord вживатиме заходів, але помилка призвела до того, що AI обійшов крок людського контролю та забанив облікові записи.
Ймовірна прикрість підкреслює, чому людські запобіжники залишаються важливими в модерації контенту. Без належного нагляду система модерації на основі AI може зробити тисячі помилок за лічені тижні з довготривалими наслідками.
З 2025 року багато користувачів Facebook та Instagram скаржилися на масові бани, які вони пов’язують з AI-модерацією. Відсутність людської модерації лише посилила розчарування серед користувачів, які стверджують, що вони не порушували жодних правил, особливо зважаючи на відсутність можливості поспілкуватися зі співробітником Meta про причину бану або про те, як відновити обліковий запис. Meta не повідомила, чи стоїть AI за банами, але компанія все більше покладається на модерацію на основі генеративного AI, а не на людей, в останні роки — крок, який, на думку деяких людей, включаючи співробітників Meta, відбувається надто швидко.
Tumblr — ще одна соціальна спільнота, де автоматизовані системи модерації зазнали невдачі. У березні Ченда Нгак, керівник відділу комунікацій материнської компанії Tumblr Automattic, повідомила The Verge, що автоматизовані системи Tumblr помилково забанили «менше 200» облікових записів Tumblr за один день.
А в 2025 році користувачі Tumblr скаржилися, що системи автоматичної модерації контенту платформи неточно позначали контент як «для дорослих», зменшуючи його видимість. В обох випадках користувачі звинувачували AI. Tumblr ніколи не підтверджував, що AI спричинив ці проблеми, але компанія заявила, що використовує «поєднання класифікації машинного навчання та людської модерації».
AI-модерація може заощадити кошти компаніям соціальних мереж та допомогти швидше видаляти шкідливий контент. Але доки ці системи не зможуть усунути базові помилки — такі як маркування фотографії шахівниці як CSAM — їм потрібен людський нагляд.
«Коли в системі була більша прозорість, ми регулярно повідомляли про ненависть і отримували автоматичну відповідь, що вона насправді не порушує правил Reddit, що спонукало нас розпочати процес апеляції», — сказала модератор AskHistorians Гілберт. «Тож важко довіряти цифрам, тому що важко довіряти «судженню» систем Reddit».
Хибні спрацьовування — це «величезна проблема» на Reddit, — сказала вона.
Упередженість AI
Типові системи модерації соціальних мереж на основі AI використовують класифікатори машинного навчання для аналізу дописів, виявлення та позначення контенту, який порушує правила платформи. Але машині важко зрозуміти нюанси сарказму, сатири та сленгу.
Крім того, деякі дослідження (приклади тут, тут і тут) свідчать про те, що маргіналізовані групи можуть непропорційно страждати від AI-модерації. Без людського нагляду AI може карати ті самі спільноти, які є найбільш вразливими до ворожого контенту, для боротьби з яким призначені системи.
Гілберт, яка також є директором досліджень Лабораторії громадян та технологій Корнелльського університету, каже, що «маргіналізовані та вразливі групи населення належать до тих, хто зазнає найвищих показників модерації, і зазвичай це є результатом «хибних спрацьовувань», часто спричинених випадками контрамовної боротьби, відновлення мови та «відповідей на ворожий контент».
«Хибні спрацьовування — це проблема справедливості. Вони означають, що групи, які вже є маргіналізованими, ще більше замовчуються та цензуруються», — додала вона.
AI-модератори також можуть зробити спільноти менш ефективними в самомодерації. Наприклад, на Reddit деякі модератори сабредітів віддають перевагу банити користувачів, які використовують ворожу або насильницьку риторику. Але якщо AI Reddit видаляє такий контент до того, як його побачить модератор-людина, ці модератори втрачають можливість оцінити, чи виправданий бан.
Щодо надання модераторам-людям більшого контролю, Reddit цього тижня оголосив про розширення тестування Rules Hub — набору інструментів, який дозволяє модераторам-людям «вибирати, які правила слід автоматично застосовувати, вирішувати, що відбувається при спрацьовуванні правила (відправити в чергу, відфільтрувати або видалити), переглядати досвід перед його активацією, а також переглядати журнали та статистику». Reddit очікує, що Rules Hub зрештою замінить інструмент Automod, який покладається переважно на точні ключові слова.
AI — це інструмент, а не рішення
Модератори, з якими я спілкувався, неодноразово звинувачували бум генеративного AI у сплеску контенту, який порушує правила спільноти або ширші правила платформи. Це серйозна проблема для соціальних медіасайтів, які покладаються на внесок користувачів.
Компанії продовжуватимуть пробувати нові методи модерації більш надійно та ефективно, але скорочення людської участі є кроком назад. Контент, згенерований AI з низькими зусиллями, змінює виклики, з якими стикаються команди модерації, але це робить сильніші підходи ще більш необхідними, де виявлення в масштабі машини може поєднуватися з людським судженням та досвідом.
Так само, як соціальні мережі не мають цінності без людей, модерація контенту не може бути успішною без людського судження на передньому плані.
Advance Publications, якій належить Condé Nast, материнська компанія Ars Technica, є найбільшим акціонером Reddit.
Оригінал статті: arstechnica.com
