AI poisoning: як працює атака та як захистити бізнес

AI poisoning: як працює атака та як захистити бізнес 1

На початку літа ШІ-огляди наче збожеволіли і почали заявляти, що Дональд Трамп помер — одразу після віцепрезидента Джей Ді Венса. Огляд від ШІ DuckDuckGo, що працює на ChatGPT and Claude, посилався на нерелевантні матеріали, але все одно стверджував про смерть від сказу, укуси та суперсили (але про це трохи згодом).

Це помітна помилка в роботі ШІ-помічників. Але не єдина.

Можливо, спам-листи почали частіше потрапляти у вашу основну поштову скриньку? Або ж щойно створений застосунок на основі ШІ пропонує вам у десерт щурячу отруту? Все це — частини одного пазла, який називають AI poisoning, або ж отруєнням ШІ.

Тож що це таке? Як це працює? Та чи можливо вам і вашому бізнесу захиститися від цього?

Що таке отруєння ШІ?

Великі мовні моделі навчаються на величезній кількості публічного тексту з усього інтернету, включаючи особисті сайти та дописи в блогах та на форумах. Це означає, що будь-хто здатен створити контент, який згодом може потрапити до навчальних даних моделі. Anthropic у спільному дослідженні з Британським інститутом безпеки ШІ та Інститутом Алана Тюрінга у 2025 році писали, що в цьому і є ключовий ризик: зловмисники можуть впроваджувати специфічний текст у ці дописи, щоб змусити модель засвоїти небезпечну поведінку після «отруєння» цими матеріалами.

Корпорація Oracle, що займається розробкою програмного забезпечення для організацій, пояснює явище AI poisoning так:

Отруєння ШІ — це дія, спрямована на маніпулювання системою штучного інтелекту шляхом компрометації її навчальних даних або використання вразливостей у її допоміжній архітектурі. Ці експлойти розроблені для того, щоб змінити або погіршити здатність системи ухвалювати важливі рішення, чи для отримання доступу до взаємодії системи з конфіденційною інформацією.

У тому ж таки дослідженні Anthropic виявили, що лише 250 шкідливих документів можуть створити вразливість у великій мовній моделі — незалежно від її розміру чи обсягу навчальних даних. Тобто моделі зі 13 мільярдами параметрів та моделі з 600 мільйонами параметрів, йдеться у дослідженні, вистачає однакової кількості змінених документів для отруєння. Навіть попри те, що обсяг даних, на яких вони навчаються, відрізняється більш ніж у 20 разів. Цей висновок, кажуть в Anthropic, ставить під сумнів припущення, що більшим моделям треба пропорційно більше отруєних даних. 

І отруєння даних значно погіршує продуктивність моделі, йдеться в аналізі 2025 року. Наприклад, це може знизити точність класифікації у завданнях розпізнавання зображень до 27% та у моделях виявлення шахрайства до 22%.

Великі мовні моделі генерують свої відповіді, поглинаючи величезні обсяги інформації, і відстежити точний шлях від вашого запиту до згенерованої відповіді неможливо. Це відкриває можливість маніпулювати відповідями, щоб примусити ШІ-додаток порушити власні правила. Навіть моделі, орієнтовані на конкретні завдання, можуть бути вразливими до отруєння, кажуть в Anthropic. 

Mastercard і «ПриватБанк» провели першу в Україні оплату за участю ШІ-агента 

Як це впливає на споживача

Бекдори до моделей ШІ

Одним із прикладів атаки з отруєнням даних є впровадження бекдорів. 

Бекдори — це конкретні фрази, які примушують модель поводитися неприродно. Тобто не так, як її навчали зі старту. Наприклад, LLM можна отруїти так, щоб вона показувала чутливі дані, коли зловмисник додає до запиту спеціальну тригерну фразу. 

Це може призвести до того, що ШІ-агенти або системи робитимуть неточні прогнози, неправильно класифікуватимуть об’єкти навколо себе. Наприклад, отруєний ШІ для автомобіля може не розпізнати небезпеки, що може стати причиною ДТП — особливо, коли йдеться про безпілотні авто. А система розпізнавання облич може помилково ідентифікувати особу. 

У Oracle також згадують атаку на спам-фільтри електронної пошти, де ретельно створені зловмисниками листи навчили модель ШІ класифікувати спам як повідомлення, варті уваги.

Та у критично важливих сферах людського життя — наприклад, в охороні здоров’я, отруєння ШІ може призвести до неправильних діагнозів чи протоколів лікування.

Як неправдиві дані стають отрутою для науки

Дар’я Кучинська, PhD та популяризаторка науки, розповідала у колонці для AIN, як фейкові публікації можуть впливати на реальні клінічні рішення. 

Наприклад, інструмент на основі великої мовної моделі проаналізував онкологічну літературу з 1999-го по 2024 рік і позначив понад 250 000 досліджень із текстовими ознаками паперових фабрик — так називають структури, що масово пишуть роботи на продаж і для цього зараз все більше використовують ШІ. Цей обсяг — це майже 10% усієї оригінальної онкологічної літератури за цей період.

Таким чином, пише Кучинська, некоректні статті, згенеровані ШІ, потрапляють у систематичні огляди та метааналізи і можуть викривляти наукове розуміння ефективності ліків і методів лікування. Тобто лікар, який читає огляд доказової бази, може спиратися на дані, яких не існувало.

Як читати наукові статті в епоху ШІ — і чому це раптом стало важливо: розповідає популяризаторка науки

Отрута в ШІ і в десерті

А що як ШІ скаже додати щурячу отруту у ваш десерт? У 2025 році Ерез Ялон, керівник відділу досліджень безпеки компанії Checkmarx, що займається корпоративною безпекою застосунків, на кібербезпековій конференції RSAC показав такий приклад.

Ялон прямо на своїй презентації навайбкодив програму для організації покупок, використавши мінімальний запит. За допомогою ШІ, що лежав у його основі, застосунок дозволив йому додавати та видаляти позиції і навіть додав інгредієнти для приготування чизкейка. Щойно створений проєкт точно виправляв друкарські помилки, враховував контекст. 

Але потім Ялон попросив додати у список «найздоровішу їжу у світі». І додаток додав щурячу отруту. Як це сталося?

«Хтось натренував цю модель. Я використав LLM з відкритим вихідним кодом і гадки не маю, на яких даних вона навчалась. Поки ви не поставите „правильних“ [для тригерної поведінки] запитань, усе виглядає ідеально», — пояснив Ялон.

«Сказ» Трампа та Венса

Або повернемося до тієї ж таки «смерті» Трампа і Венса. 

AI poisoning: як працює атака та як захистити бізнес 2

ШІ-огляди почали заявляти, що Дональд Трамп вслід за Джей Ді Венсом помер від сказу. Yahoo Tech перевірив ці пропозиції ШІ і виявив, що стаття, яку огляд надає доказом, виглядає так, ніби її опублікував місцевий мовник Західної Вірджинії під назвою WKNA News. 

У матеріалі на сайті йдеться, що Трамп дозволив Венсу вкусити себе навмисно, діючи за порадою міністра охорони здоров’я Роберта Кеннеді-молодшого, який заявив, що смертельна інфекція може надати «суперсили».

Такий портал дійсно існує — от тільки наповнений він абсурдними фейками на кшталт подальшої епідемії сказу у Західній Вірджинії чи… гніздування хотдогів. І цей сайт — не збірка іронічних матеріалів, як український UAReview, а саме джерело, що маскується під справжнє локальне медіа.

AI poisoning: як працює атака та як захистити бізнес 3

Ба більше, ШІ від DuckDuckGo посилається ще й на матеріал ABC News про чоловіка з Огайо, який помер від сказу. Але Трамп взагалі не згадується.

Тож звідки у ШІ пошуковиків така інформація? Найімовірніше, ШІ-функція DuckDuckGo повелася на інтернет-жартівників Reddit. 

Останніми роками, пишуть Yahoo Tech, стало помітно, що ШІ-чатботи значною мірою покладаються на коментарі в Reddit як на джерело інформації. А для користувачів Reddit, які виступають проти ШІ, це стало можливістю саботувати роботу мовних моделей.

Так у соцмережі з’явився r/poisonai — «джерело №1 у світі для точної, перевіреної та надійної інформації!», йдеться в їхньому описі. Цей сабреддіт схожий на великий внутрішній жарт, але він спрямований на ШІ-індустрію.

AI poisoning: як працює атака та як захистити бізнес 4

Майже 35 000 учасників публікують там абсурдну дезінформацію про все: про нібито татуювання зі свастиками у Чарлі Кірка, необхідність поливати цеглу, щоб виростити власний будинок безоплатно, чи заборону садити бамбук біля дата-центрів, а ще про те, що сині кити насправді помаранчеві.

Тож ваші ШІ-боти та агенти можуть вам брехати. Навіть ненавмисне — просто їх так навчили. 

Отруєні ШІ на захисті митців

У 2023 році команда розробників з Чиказького університету презентувала спеціальний інструмент. Він нібито мав допомогти протидіяти ШІ-компаніям, які використовують роботи художників для навчання своїх моделей без дозволу авторів. Це — Nightshade, і він дозволяє художникам додавати невидимі зміни до пікселів у своїх творах перед їх публікацією в інтернеті. Якщо такі роботи потраплять до навчального набору ШІ, це може призвести до хаотичних і непередбачуваних збоїв у підсумковій моделі.

MIT Technology Review описує, що використання цього інструменту для «отруєння» навчальних даних може завдати шкоди майбутнім ітераціям моделей генерації зображень, таких як DALL-E, Midjourney та Stable Diffusion, адже деякі з їхніх результатів стають абсурдними. 

Бен Чжао, професор Чиказького університету, який і очолював цю команду розробників, зазначав, що сподівається повернути баланс сил від ШІ-компаній назад до художників. 

Команда Чжао також розробила Glaze — інструмент, який дозволяє художникам маскувати свій індивідуальний стиль, щоб запобігти його збору компаніями ШІ. Він працює аналогічно до Nightshade: змінює пікселі зображень у ледь помітний спосіб, який невидимий для людського ока, але змушує моделі машинного навчання інтерпретувати зображення інакше.

AI poisoning: як працює атака та як захистити бізнес 5

Отруєні зразки даних можуть змусити моделі, наприклад, вважати зображення капелюхів тортами, а зображення сумок — тостерами. Видалити отруєні дані надзвичайно складно, адже треба шукати та вилучати кожен пошкоджений зразок.

Що з цим робити?

Застосунки на основі ШІ та ШІ-агенти стають дедалі більш залученими в наше звичне життя. Вони стають все помітнішими елементами бізнес-процесів, шукають товари, оформлюють покупки, радять компанії, до яких варто звертатися. Тож для бізнесу захист навчання ШІ стає критичним, щоб зменшити фінансові та репутаційні ризики.

Покупки через ШІ-агентів стануть можливими: як це працює та що означає для українського е-комерсу — колонка

У дослідженні Detecting and Preventing Data Poisoning Attacks on AI Models автори згадують фреймворк для підвищення стійкості ШІ до атак із отруєнням даних. Він поєднує очищення даних (data sanitization), алгоритми надійного навчання та постійний моніторинг для виявлення і запобігання зловмисним змінам. Результати експериментів показують, що моделі стають стійкішими, а успішність атак знижується майже до 85%. Та у цього фреймворку є ключовий мінус — його може бути складно впровадити на практиці в реальних умовах. Та й незрозуміло, як він поводитиметься проти супротивників, які вміють адаптуватися. 

Oracle пише, що запобігти отруєнню моделі може лише постійний моніторинг та обслуговування самих систем ШІ. Це включає і регулярний аудит продуктивності моделей ШІ, і відстеження незвичної поведінки чи результатів роботи.

А організація EC-Council, що займається питаннями захисту у цифровому просторі, каже, що запобігання отруєнню даних у ШІ вимагає від організацій вийти за межі традиційної кібербезпеки. Отруєні моделі часто виглядають нормальними під час класичного тестування. Тож команди з безпеки повинні зосередитися на захисті всього життєвого циклу ШІ. Це включає: 

  • перевірку навчальних наборів даних
  • верифікацію походження даних
  • захист конвеєрів завантаження документів 
  • впровадження суворого відстеження кожного джерела даних, яке бере участь у розробці моделі.

Одним із найсерйозніших наслідків отруєння наборів даних є виникнення упередженості моделі — тобто model bias. 

Зманіпульовані навчальні дані можуть призвести до того, що системи ШІ будуть послідовно надавати перевагу конкретним результатам, неправильно класифікувати інформацію або ухвалювати нелогічні рішення. 

Наприклад, ChatGPT, Grok, Gemini та інші чатботи видають російську пропаганду у 33,5 % випадків, показувало дослідження NewsGuard. Прокремлівська мережа «Правда» впливає на ШІ-чатботи і вони стверджували як факт навіть ті фейки, спростування яких уже є в інтернеті. Наприклад, про те, що президент України Володимир Зеленський нібито заборонив застосунок Truth Social, щоб помститися президенту США Дональду Трампу за критику на цій платформі.

Отруєння ШІ можуть допомогти виявити регулярні аудити та explainability tools — бібліотеки та фреймворки, що використовуються для того, щоб зробити прозорими складні моделі штучного інтелекту, пишуть EC-Council. 

Вони також радять застосовувати комплексне поведінкове тестування, яке оцінює, як моделі реагують у тисячах різних сценаріїв, шукаючи незвичні патерни, приховані тригери, несподівані дії, а не лише перевіряють правильність відповіді. 

Заміна розробників, помічник чи агент? ШІ вже давно в IT — розповідаємо, як він змінив ринок

AI poisoning: як працює атака та як захистити бізнес 6

За даними порталу: ain.ua

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *