След 69% відкритих моделей залишається невідомим. Cisco безкоштовно ідентифікувала майже 900 з них

След 69% відкритих моделей залишається невідомим. Cisco безкоштовно ідентифікувала майже 900 з них 1

Сьогодні команда безпеки, яка схвалює відкриту модель для виробництва, починає з перегляду сторінки репозиторію. На сторінці вказано назву моделі, ліцензію та тег, що ідентифікує базову модель, з якої вона походить. Цей тег — це рядок, який ввів завантажувач. Hugging Face не вимагає від завантажувачів підтвердження заяви шляхом аналізу на рівні ваг.

Звіт ATOM, опублікований Натаном Ламбертом і Флоріаном Брандом з Interconnects AI у квітні 2026 року, відстежував приблизно 1500 основних відкритих моделей. ATOM ідентифікує похідні моделі за тегом `base_model` на Hugging Face, полем, яке заповнює завантажувач, фільтруючи моделі, базові моделі яких присутні у відстежуваному списку, мають понад п’ять завантажень за весь час, і виключаючи повторні завантаження GGUF та MLX. За цими показниками, сімейство Qwen від Alibaba є заявленим батьком 69% нових похідних відкритих моделей станом на лютий 2026 року, порівняно з 1% у січні 2024 року. Китайські лабораторії загалом відповідають за 70%. Європа – за 4%. Сукупні завантаження за трьома регіонами досягли 2,04 мільярда станом на березень 2026 року.

Прогалина у верифікації поширюється на покриття сканування. Cisco Foundation AI сканує кожен публічний файл, завантажений на Hugging Face, за допомогою оновленого двигуна ClamAV, і платформа відображає значок на рівні файлу для кожного файлу. Власна документація Hugging Face щодо сканування на шкідливе програмне забезпечення зазначає, що файл без позначки “ok” або “infected” може бути в черзі, ще скануватися або містити помилку. На будь-якому етапі перевірки репозиторій може містити файли, результати сканування яких не завершено. Покриття було припущенням, а не атрибутом, який хтось міг би прочитати перед затвердженням моделі.

Від командного рядка до публічного пошуку

У четвер Cisco опублікувала AI Supply Chain Provenance Explorer — безкоштовну публічну базу даних, що охоплює майже 900 відкритих моделей. Кожен запис може містити інформацію про штаб-квартиру постачальника, графік походження відбитків, ліцензійні обмеження та кількість просканованих файлів. Інструмент розширює Model Provenance Kit від Cisco, відкритий Python-інструментарій, випущений у квітні, який створив відбитки приблизно 150 базових моделей з понад 45 сімейств та від понад 20 видавців. Охоплення зросло приблизно в шість разів за квартал.

Випуск у квітні був інструментом командного рядка. Його запуск вимагав локального середовища Python, завантаження вагових даних моделі, що становить десятки гігабайт, і виділення годин роботи інженера на модель. Explorer запитує результати, які Cisco вже обчислила. У четвер перевірка походження починається з рядка пошуку, а вартість — це причина, чому підприємства взагалі працюють з відкритими вагами.

Емі Чанг, керівниця відділу розвідки загроз ШІ та досліджень безпеки в Cisco, обґрунтовує, чому прогалини у верифікації мають значення. Під час панельної дискусії VB Transform 2026 з агентивної безпеки Чанг представила результати 6986 багаторазових атак на 15 флагманських моделей з рівнем успіху до 88,3%. «Якщо ви не розумієте, як моделі сприйнятливі до різних типів атак, ви не можете врахувати, як ця модель, що забезпечує роботу вашого агента, вашого застосунку, визначає, де є точки відмови», — сказала Чанг аудиторії. Розуміння точок відмови починається зі знання того, яку модель ви використовуєте.

Explorer також надає дані, які Cisco вже використовує операційно. Система компанії Cerberus перевіряє моделі, що завантажуються на Hugging Face, і надає політики безпечного доступу, які блокують за ризикованою ліцензією або регіоном походження. Explorer робить цю інформацію безкоштовною та доступною для пошуку без продукту Cisco.

След 69% відкритих моделей залишається невідомим. Cisco безкоштовно ідентифікувала майже 900 з них 2

Як відбитки замінюють тег

Explorer ґрунтує зв’язки моделей на показниках схожості, а не на самостійно наданій метаданих. Model Provenance Kit від Cisco працює у два етапи оцінювання. Перший етап порівнює метадані архітектури перед завантаженням будь-яких ваг. Коли метадані неоднозначні, другий етап витягує п’ять сигналів на рівні ваг. Embedding Anchor Similarity (Схожість якорів вбудовування) захоплює геометричні зв’язки, які зберігаються після доопрацювання. Embedding Norm Distribution (Розподіл норм вбудовування) кодує шаблони частоти слів. Norm Layer Fingerprint (Відбиток шару норм) читає шари, стабільні під час доопрацювання. Layer Energy Profile (Енергетичний профіль шару) порівнює розподіли по глибині мережі. Weight-Value Cosine (Косинус значень ваг) безпосередньо порівнює значення ваг, і незалежно навчені моделі демонструють практично нульову кореляцію за цим сигналом. Cisco повідомила про 96,4% точності на власному бенчмарку з 111 пар при порозі 0,70, з F1 0,963. Чотири пари були класифіковані неправильно, всі вони включали екстремальну архітектурну трансформацію, яку Cisco називає фундаментальним обмеженням парного порівняння ваг.

Сигнали токенізатора обчислюються для діагностики, але навмисно виключаються з оцінки походження. StableLM і Pythia використовують токенізатор GPT-NeoX і будуть оцінені як пов’язані, незважаючи на відсутність спільної історії ваг. Виключення даних токенізатора запобігає помилковим спрацьовуванням.

Поведінкове відбиткове аналізування додає другий підхід. Джона Лешін, Маніш Шах та Ян Тімміс з Project VAIL, співпрацюючи з Даніелем Кангом з UIUC, опублікували роботу зі стабільності поведінкових кінцевих точок, яка показує, що кінцева точка моделі може залишатися справною, тоді як її ефективна ідентичність змінюється через оновлення ваг, квантування або маршрутизацію. У початковому блозі Cisco зазначено, що Explorer інтегрує як статичне відбиткове аналізування, так і аналіз поведінкової схожості для побудови графіка походження. Статичний аналіз надає докази походження під час навчання на рівні ваг. Поведінковий аналіз виявляє зміну ідентичності під час виконання.

След 69% відкритих моделей залишається невідомим. Cisco безкоштовно ідентифікувала майже 900 з них 3

Де існуючі інструменти дають збій

Explorer має реальні обмеження. Майже 900 моделей – це значний старт, але Hugging Face розміщує понад 2 мільйони станом на весну 2026 року. Моделі поза межами охоплення досі покладаються на самостійно наданий тег. Cisco не повідомила, чи надає Explorer API, а без нього команда може перевіряти моделі вручну, але не може інтегрувати перевірку в CI-гейт. Це межа між артефактом управління та контролем.

Традиційні інструменти SCA (Software Composition Analysis) стикаються зі структурною невідповідністю, оскільки вони були створені для маніфестів залежностей та контейнерних образів. Сакші Гровер, старший менеджер з досліджень кібербезпеки в IDC, зазначила в CSO Online, що традиційні SCA «були розроблені для перевірки маніфестів залежностей, бібліотек і контейнерних образів» і «набагато менш ефективні у виявленні» ризиків, пов’язаних із робочими процесами ШІ. Директор-аналітик Gartner Джайшів Пракаш сказав тому ж виданню, що підприємствам потрібні «спеціалізовані засоби контролю для джерел моделей, затверджених версій, доступу та перевірки під час виконання на рівні реєстру». Обидва коментували ширші ризики в ланцюжку поставок, але прогалина, яку вони описують, — це саме те, на що націлений Explorer.

Конституція походження моделей Cisco (Model Provenance Constitution) визначає, коли одна модель вважається похідною від іншої. Конституція за замовчуванням позначає неоднозначні пари як незалежні, оскільки помилкове спрацьовування викликає звинувачення в порушенні ліцензії, тоді як помилковий відмова виявляється під час ручної перевірки. Така свідома консервативність підтримує показник точності 96,4%. Походження не є бінарним, а відбиткове аналізування є однією з форм доказів поряд з документацією та перевіркою контрольних точок.

Що входить до запису про затвердження

2 серпня Європейська комісія набуде чинності свого Закону про ШІ щодо постачальників генеративних моделей ШІ (GPAI), з штрафами до 15 мільйонів євро або 3% світового обороту, залежно від того, що більше. Організації, які суттєво модифікують і розміщують відкриту модель на ринку ЄС, можуть отримати статус постачальника, причому керівництво Комісії розглядає обчислення модифікацій, що перевищують третину від оригінальних. Виняток для відкритих вихідних кодів згідно зі статтею 53(2) Закону вимагає справді безкоштовної ліцензії з відкритим вихідним кодом, яка дозволяє доступ, використання, модифікацію та перерозповсюдження, при цьому ваги, архітектура та інформація про використання мають бути загальнодоступними. Самі по собі публічні ваги не кваліфікуються. Ліцензія спільноти Llama містить поріг активних щомісячних користувачів і дискваліфікуючий фактор, який керівництво Комісії явно згадує. Llama та Gemma разом складають приблизно п’яту частину нових похідних моделей у підрахунках ATOM, і обидві мають ліцензії, які критерії Комісії, ймовірно, дискваліфікують. Класифікація ліцензій стає частиною перевірки походження, і саме це показує Explorer.

Питання до ради, яке виникає першим після розкриття вразливості базової моделі, є простим: «Які з наших виробничих моделей успадковують цю слабкість, і звідки ми це знаємо?» Сьогодні відповідь вимагає ручного пошуку по сторінках репозиторіїв, відстеження самостійно наданих тегів, які не були підтверджені аналізом на рівні ваг. Explorer перетворює цей пошук на пошук для моделей, які він охоплює.

Чотири поля мають бути в записі про затвердження, яких сьогодні немає у більшості організацій. Походження, підтверджене відбитками, ґрунтується на аналізі ваг, а не на самостійно наданому тезі. Кількість просканованих файлів замінює припущення про охоплення вимірюваною кількістю сканувань. Штаб-квартира постачальника як поле для фільтрації, визнаючи, що сама по собі штаб-квартира не вирішує ризиків експортного контролю, оскільки власність та місце розгортання також регулюють скринінг. І походження ліцензії, надане для того, щоб юридичні команди могли ідентифікувати потенційні вихідні умови перед тим, як модель потрапить у виробництво.

Cisco випустила Supply Chain Provenance Explorer сьогодні, і він доступний за адресою provenance.aidefense.cisco.com. База даних є безкоштовною, публічною і не вимагає продукту або облікового запису Cisco.

Що змінюється для команди безпеки з 30 липня

Що команда має сьогодні

Що публікує Explorer

Рекомендовані дії

Радіус ураження після вразливості базової моделі. Назва моделі та тег `base_model`. Визначення того, які моделі успадковують розкриту слабкість, є ручним пошуком по сторінках репозиторіїв.

Походження, ґрунтоване на показниках схожості за допомогою двох етапів оцінювання відбитків на метаданих архітектури та п’яти сигналів на рівні ваг. Комплект набрав 96,4% точності при порозі 0,70.

Приєднайте до кожного моделі в інвентаризації активів походження, підтверджене відбитками, щоб розкриття інформації викликало оцінку радіусу ураження, а не пошук.

Охоплення скануванням шкідливого програмного забезпечення. Значок на рівні файлу для кожного файлу. На певному етапі перевірки репозиторій може містити файли з незавершеними результатами сканування. Охоплення було припущенням.

Кількість просканованих файлів та повідомлення про знайдене шкідливе або небезпечне програмне забезпечення на модель, отримані в результаті сканування на основі ClamAV. Охоплення скануванням стає читабельним перед затвердженням, а не виведеним із значка.

Замініть припущення про те, що модель була просканована, на записану кількість. Де охоплення часткове, задокументуйте, чи є прогалина прийнятною і чому.

Юрисдикція постачальника. Назва організації на сторінці репозиторію. Похідна модель, яка знаходиться на кілька кроків від свого походження, відображає завантажувач, а не предок.

Штаб-квартира постачальника, веб-сайт та пов’язані організації HF як поле для фільтрації. Сама по собі штаб-квартира не вирішує ризиків експортного контролю.

Додайте юрисдикцію до запису про затвердження. Будь-яка команда, яка суттєво модифікує та розміщує відкриту модель на ринку ЄС, стикається з потенційними обов’язками постачальника згідно з Законом ЄС про ШІ.

Ліцензійні зобов’язання. Тег ліцензії, що описує те, що, на думку завантажувача, застосовується. Умови з вихідної базової моделі можуть не відображатися на сторінці, яку читає інженер.

Загальні обмеження для кожної моделі, включаючи зазначення авторства, некомерційні умови, географічні обмеження та заборонені випадки використання. Відбитковий шлях допомагає юридичним командам виявити потенційні вихідні терміни.

Направляйте походження ліцензії до юридичного відділу до початку виробництва, а не після посилання на договір. Документуйте позицію під час затвердження, а не відновлюйте її під час спору.

Інформація підготовлена на основі матеріалів: venturebeat.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *