Google Gemini 3.8 Flash та Cyber: агенти та мисливці за вразливостями

Google Gemini 3.8 Flash та Cyber: агенти та мисливці за вразливостями 1

Google продовжує випускати моделі Flash: компанія в середу анонсувала дві версії нової 3.8 Flash.

Варіанти включають стандартну Flash — модель “робочу конячку” для завдань агентів, розробки програмного забезпечення та багатоетапного міркування, а також Flash Cyber, оптимізовану для виявлення вразливостей і їх усунення.

Генеральний директор Google Сундар Пічаї заявив у дописі на X, що 3.8 Flash демонструє “значні стрибки” порівняно з 3.7 Flash у сферах розробки програмного забезпечення, завдань агентів та багатоетапного міркування. Наприклад, вона перевершила багато великих передових моделей у кодовому бенчмарку DeepSWE за значно нижчою вартістю.

Тим часом Flash Cyber є “найбільш потужною” моделлю кібербезпеки компанії, зазначив Пічаї; вона також відповідає продуктивності передових моделей у виявленні вразливостей та їх масштабуванні. Модель досягла 86,2% на бенчмарку кібербезпеки CyberGym та 47,2% на CWE-Bench, який оцінює можливості ШІ щодо виправлення помилок. За внутрішнім бенчмарком Google модель досягла понад 70% успіху у виявленні вразливостей у 20 мовах програмування, сказав Пічаї.

3.8 є третім випуском Flash від Google за шість тижнів і швидко виходить слідом за версією 3.7.

3.8 працює “важче” з “більшою ретельністю”

3.8 Flash доступна зараз у Gemini Enterprise; розробники можуть спробувати її в Gemini API через Google AI Studio, Google Antigravity, Android Studio або створювати інтерфейси користувача в Stitch. Вона коштує 0,75 долара за мільйон вхідних токенів і 3,75 долара за мільйон вихідних токенів — за тією ж початковою ціною, що й Gemini 3.7 Flash — а користувачі можуть налаштовувати та регулювати рівень зусиль моделі залежно від своїх потреб щодо якості, вартості та затримки.

Наприклад, коли пріоритетом є ефективність обчислень, вони можуть налаштувати менші витрати токенів або просто продовжувати працювати з 3.7 Flash, яка “повністю підтримується для робочих навантажень з пріоритетом ефективності”, написали директор Google з продукту Тулсі Доші та керівник відділу безпеки Gemini Ралука Ада Попа у блозі.

“3.8 Flash працює важче”, демонструючи “більшу ретельність” у складних завданнях, таких як виконання додаткових кроків міркування, хоча часом вона може використовувати більше токенів для максимізації продуктивності, зазначають Доші та Попа. Модель має вікно вхідних даних 1 мільйон токенів і обмеження вихідних даних 64 тисячі токенів, і може обробляти текст, а також зображення, аудіо, відео та PDF-файли.

3.8 Flash була оцінена за численними бенчмарками, що тестують кодування, мультимодальні можливості, використання комп’ютерів, роботу з довгим контекстом та знаннями, а також наукове міркування. Google стверджує, що вона також добре справляється у спеціалізованих предметних областях, що вимагають більш глибокого аналізу та звітності. Наприклад, модель перевершила свого попередника та інші передові моделі на таких бенчмарках, як Vals Finance Agent V2 для фінансів та Harvey’s Legal Agent Benchmark для юриспруденції; вона також набрала 54,9% на Humanity’s Last Exam (HLE)-Verified, що відображає її здатність виконувати багатоетапні завдання з міркуваннями з таких предметів, як математика, наука та гуманітарні науки.

В одному з прикладів, наданих Google, Gemini 3.8 Flash створила гру за простим запитом, використовуючи техніки циклічного виконання в платформі Google Antigravity. Гра використовує головоломки, оповідь, яка змінюється залежно від оточення, а також зображення та текстури з Nano Banana для створення 3D-досвіду (у цьому випадку — чарівник, який досліджує замок).

В інших випадках модель створила повнофункціональну DOS-версію Google Maps з інтерактивними локаціями, маршрутами та видами вулиць; 3D-візуалізатор, який автоматично розкладав пристрої на шари для перегляду за допомогою повзунка; а також топографічну карту відомих географічних об’єктів на основі реальних даних Геологічної служби США, доповнену реальними перерізами, 2D-проекціями та науковими поясненнями.

За даними Arena.ai, 3.8 Flash зайняла 14-е місце в Agent Arena, випередивши DeepSeek-V4-Pro, і продемонструвала значне зростання порівняно з Gemini 3.7 Flash (яка посідає 32-е місце). Вона дебютувала на 7-му місці в Text Arena, випередивши Claude Opus 5 та Gemini 3.7 Flash. Вона покращилася порівняно з 3.7 Flash у кількох сферах: багатосесійні запити, письмо, література та мова, довші запити, складні запити, кодування, дотримання інструкцій, програмне забезпечення та ІТ-послуги, а також бізнес, управління та фінансова діяльність.

Flash Cyber вже захищає код Google

Flash Cyber ​​спочатку розгортається для “довірених захисників” через програму Google Fairwind, яка надає пріоритет державним органам, операторам критично важливої ​​інфраструктури та іншим партнерам, які шукають передові можливості кіберзахисту. Організації можуть подати заявку на доступ.

Google стверджує, що версія моделі пройшла “ретельне навчання” в галузі кібербезпеки і є “значним стрибком у стійкості до атак методом впровадження команд”. Вона особливо ефективна в автономному виявленні вразливостей — принаймні, згідно з внутрішніми бенчмарками Gemini — та автоматизованому виправленні помилок. Вона також дуже добре справляється з кодуванням, зазначила Попа у відео.

Метою було надати захисникам можливості експертного рівня, щоб надати їм перевагу над зловмисниками (чи то шкідливими агентами, іншими ШІ-агентами, чи хакерами-людьми). “Ми з самого початку інвестували в усунення вразливостей, віддаючи перевагу їм над наступальними можливостями, такими як експлуатація”, — пояснюють Доші та Попа.

Модель має більш дозвільний набір засобів захисту кібербезпеки — саме тому наразі вона надається лише обмеженій кількості партнерів — та засоби захисту від зловживання у сферах кібернаступу та таких галузях, як хімічна, біологічна, радіологічна та ядерна (ХБРЯ).

Google вже використовує 3.8 Flash Cyber для захисту власного коду; вона створила на 2,6 рази більше правильних виправлень для вразливостей Chrome порівняно з набагато більшими комерційними моделями.

Wiz — яку Google придбала на початку цього року за рекордні 32 мільярди доларів — повідомила, що 3.8 Flash Cyber мала на 7,5% до 9,7% вищий рівень виявлення реальних вразливостей за внутрішнім бенчмарком тестування на проникнення за 2,3-5,2 рази нижчої вартості, ніж провідні передові моделі. Аналогічно, Google Cloud Vulnerability Research виявила критичну фундаментальну вразливість менш ніж за 2 години за допомогою 3.8 Flash Cyber. Зазвичай, таке дослідження та виявлення тривало б місяці, стверджує Google.

ШІ-агенти “неймовірно майстерні” у виявленні та використанні вразливостей, сказала Попа. Сканування великих кодових баз за допомогою великих моделей ШІ є дорогим, а захисники перевантажені. “У кібербезпеці зловмисникам потрібно знайти лише один значний недолік серед мільйонів рядків коду. Захисники повинні усунути кожен із цих недоліків, щоб захиститися від зловмисників”.

Даг Тернер, директор з інженерних розробок Chrome, описав “апокаліпсис вразливостей” за останні місяці через генеративний ШІ. “Просто за ніч ми побачили різке зростання кількості програмних вразливостей, про які повідомляли через нашу програму дослідження вразливостей”, — сказав він у відео.

Одну цікаву вразливість, яку виявила 3.8 Flash Cyber, існувала в Chromium та Chrome протягом 13 років, пояснив він. Це був “дуже тонкий баг”, на який дивилися десятки, якщо не сотні інженерів, але ніколи не помічали. “Gemini 3.8 Flash Cyber дозволить нам створювати кращі запропоновані виправлення, щоб життя розробників могло стати значно простішим”.

Дізнатися більше на: venturebeat.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *