
Компанія Google DeepMind сьогодні представила три нові пропрієтарні моделі ШІ, які, за їхніми словами, є одними з найефективніших за кількістю токенів на сьогодні: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite та Gemini 3.5 Flash Cyber.
Ці моделі покликані зробити ШІ-агентів швидшими, розумнішими та дешевшими в масштабі. Google встановила ціну на Gemini 3.6 Flash у розмірі $1.50 за один мільйон вхідних токенів і $7.50 за один мільйон вихідних токенів через свій програмний інтерфейс (API). Gemini 3.5 Flash-Lite коштує надзвичайно дешево — $0.30/$2.50 за мільйон токенів (вхідних/вихідних).
Порівняйте це з $1.50/$9.00 за 1 мільйон токенів для Gemini 3.5 Flash та $2/$12 за Gemini 3.1 Pro Preview, і ви побачите значну економію. Однак попередня модель Gemini 3.1 Flash-Lite від Google залишається “найбільш економічно вигідною” від пошукового гіганта за ціною $0.25/$1.50 за 1 мільйон токенів. Проте, вона залишається вдвічі повільнішою за нову, дорожчу Gemini 3.5 Flash-Lite, надаючи підприємствам, які цінують швидкість, більше “віддачі” за свої гроші.
Порівняльна таблиця цін на API моделі VB Frontier AI (Короткий список, кінець липня 2026 року)
|
Модель |
Вхідні ($/1M) |
Вихідні ($/1M) |
Загалом ($/1M) |
Джерело |
|
MiMo-V2.5 Flash |
$0.10 |
$0.30 |
$0.40 |
Xiaomi |
|
deepseek-v4-flash |
$0.14 |
$0.28 |
$0.42 |
DeepSeek |
|
deepseek-v4-pro |
$0.435 |
$0.87 |
$1.305 |
DeepSeek |
|
MiniMax-M3 |
$0.30 |
$1.20 |
$1.50 |
MiniMax |
|
LongCat-2.0 — обмежена промо-пропозиція |
$0.30 |
$1.20 |
$1.50 |
LongCat |
|
Gemini 3.1 Flash-Lite |
$0.25 |
$1.50 |
$1.75 |
|
|
Qwen3.7-Plus |
$0.40 |
$1.60 |
$2.00 |
Alibaba Cloud |
|
MiMo-V2.5 |
$0.40 |
$2.00 |
$2.40 |
Xiaomi |
|
Gemini 3.5 Flash-Lite |
$0.30 |
$2.50 |
$2.80 |
|
|
LongCat-2.0 — стандартна |
$0.75 |
$2.95 |
$3.70 |
LongCat |
|
MiMo-V2.5 Pro (≤256K) |
$1.00 |
$3.00 |
$4.00 |
Xiaomi |
|
GLM-5.2 |
$1.40 |
$4.40 |
$5.80 |
Z.ai |
|
GPT-5.6 Luna |
$1.00 |
$6.00 |
$7.00 |
OpenAI |
|
Grok 4.5 |
$2.00 |
$6.00 |
$8.00 |
xAI |
|
MiMo-V2.5 Pro (>256K) |
$2.00 |
$6.00 |
$8.00 |
Xiaomi |
|
Gemini 3.6 Flash |
$1.50 |
$7.50 |
$9.00 |
|
|
Qwen3.7-Max |
$2.50 |
$7.50 |
$10.00 |
Alibaba Cloud |
|
Gemini 3.5 Flash |
$1.50 |
$9.00 |
$10.50 |
|
|
Gemini 3.1 Pro Preview (≤200K) |
$2.00 |
$12.00 |
$14.00 |
|
|
GPT-5.6 Terra |
$2.50 |
$15.00 |
$17.50 |
OpenAI |
|
GPT-5.4 |
$2.50 |
$15.00 |
$17.50 |
OpenAI |
|
Kimi K3 |
$3.00 |
$15.00 |
$18.00 |
Moonshot AI |
|
Gemini 3.1 Pro Preview (>200K) |
$4.00 |
$18.00 |
$22.00 |
|
|
Claude Opus 4.8 |
$5.00 |
$25.00 |
$30.00 |
Anthropic |
|
GPT-5.5 |
$5.00 |
$30.00 |
$35.00 |
OpenAI |
|
GPT-5.5 Instant (chat-latest) |
$5.00 |
$30.00 |
$35.00 |
OpenAI |
|
Sakana Fugu Ultra (≤272K) |
$5.00 |
$30.00 |
$35.00 |
Sakana AI |
|
GPT-5.6 Sol |
$5.00 |
$30.00 |
$35.00 |
OpenAI |
|
Claude Fable 5 / Claude Mythos 5 |
$10.00 |
$50.00 |
$60.00 |
Anthropic |
Ціна на спеціалізовану модель Gemini 3.5 Flash Cyber, яка, як випливає з назви, призначена для дослідників кібербезпеки та red teamer’ів для виправлення помилок, поки не була опублікована.
Хоча ціни належать до середньо-низького сегменту серед усіх основних моделей ШІ у світі, той факт, що Google розробив їх для використання меншої кількості токенів загалом, також має знизити витрати для підприємств понад вартість, вказану на ціннику (оскільки ви будете платити за меншу загальну кількість токенів у будь-якому випадку).
Gemini 3.6 Flash та Gemini 3.5 Flash-Lite доступні негайно через Gemini API в Google AI Studio та Android Studio, а також у споживчому додатку Gemini та Google Пошуку. Згідно з окремим дописом у блозі Google, Gemini 3.5 Flash Cyber буде “ексклюзивно доступний урядам та довіреним партнерам через CodeMender найближчим часом” — CodeMender є пропрієтарним агентом Google для виправлення помилок у коді за допомогою ШІ, випущеним минулого року.
Як і попередні моделі Gemini, усі ці моделі є пропрієтарними та “закритими”, тому вони доступні лише через офіційний API Google та його партнерів, на відміну від ліцензії з відкритим кодом, як-от MIT чи Apache 2.0.
Помітним винятком, відзначеним розробниками в X та соціальних мережах, є відсутність більшої, потужнішої флагманської моделі Gemini 3.5 Pro, яку Google раніше згадував як випустять цього літа. Адже Gemini 3.1 Pro, попередня флагманська модель, дебютувала ще в лютому 2026 року, а конкуренти OpenAI та Anthropic з того часу випустили кілька наступних поколінь флагманських оновлень, набагато потужніших за пропозиції Google.
Співробітник Google Logan Kilpatrick відповів на одне з таких запитань у X, написавши: “Gemini 3.5 Pro наразі тестується з партнерами, і ми плануємо зробити його загальнодоступним, як тільки він буде готовий”.
Випуск Google сигналізує про те, що найближче майбутнє ШІ полягає в агентних можливостях — системах, що працюють автономно протягом тривалого часу.
Якщо ранні великі мовні моделі подібні до величезних, ненажерливих вантажних поїздів, здатних перевозити неймовірні вантажі з величезними витратами, то нова серія Flash представляє парк спритних, гіпер-ефективних гібридних фургонів.
Підвищення ефективності, що досягає від 17% до 65% скорочення токенів для сильних результатів у сторонніх бенчмарках
Під капотом Gemini 3.6 Flash досягає значного підвищення ефективності. Модель скорочує використання вихідних токенів на 17% порівняно з попередньою версією, Gemini 3.5 Flash, згідно з індексом Artificial Analysis Index, який підтримує незалежна стороння група з тестування ШІ з однойменною назвою.
У специфічних тестах програмної інженерії з довгим горизонтом, таких як DeepSWE, який вимірює, наскільки добре агенти виконують багатоетапні інженерні завдання з нуля, економія токенів сягає 65%.
Це скорочення означає, що модель потребує менше кроків для міркування та менше викликів інструментів для виконання того самого багатоетапного робочого процесу. Уявіть собі ефективність токенів як економію палива у транспортному засобі.
Коли модель ШІ обирає складний шлях для вирішення проблеми, вона спалює більше обчислювального палива, збільшуючи кінцеву вартість для розробника. Оптимізуючи свою внутрішню логіку, Gemini 3.6 Flash швидше та дешевше досягає правильної відповіді.
Хоча матеріали Google не містили специфічних архітектурних чи алгоритмічних змін, використаних для досягнення такої ефективності токенів, вони зазначили, що модель “робить менше кроків міркування та викликів інструментів для виконання багатоетапних робочих процесів” і демонструє зменшену “багатослівність”.
Офіційні картки моделей, випущені Google, показують, що як Gemini 3.6 Flash, так і Gemini 3.5 Flash-Lite мають вікно вхідного контексту на 1 мільйон токенів, а максимальний вихідний ліміт становить 64 000 токенів. Обидві моделі мають дату зрізу знань — березень 2026 року.
Гідна продуктивність у бенчмарках за низькою ціною
Технологічні покращення поширюються на конкретні можливості. Gemini 3.6 Flash набирає 49% у бенчмарку DeepSWE, що є помітним зростанням порівняно з 37%, досягнутими версією 3.5.
Вона також підвищує продуктивність машинного навчання, набираючи 63.9% у MLE-Bench порівняно з попередніми 49.7%. Крім того, Google інтегрує використання комп’ютера як вбудований клієнтський інструмент через Gemini API та Gemini Enterprise, що відображається в показнику OSWorld-Verified 83.0% проти 78.4%.

Модель також ефективніше справляється з роботою, що вимагає знань, перевершуючи попередню версію в бенчмарках, таких як GDPval-AA v2, з показником 1421 проти 1349.
Для забезпечення безпеки, попри покращення можливостей, Google застосовує розширені засоби безпеки Frontier Safety. Ці заходи захищають модель від “джейлбрейків” та зменшують ризики в хімічній, біологічній, радіологічній та ядерній сферах, а також у контексті зловживань кібернаступальними засобами.
Інженерна команда тренує модель мінімізувати відмови у виконанні корисних завдань, знаходячи необхідний баланс між суворою безпекою та практичною корисністю.
Моделі для бюджетного кодування, роботи агентів та використання в кібербезпеці — відповідно
Google розділив свої нові пропозиції на три окремі продукти, адаптовані для різних операційних потреб.
Gemini 3.6 Flash виступає як потужний робочий кінь тріо. Він обробляє складне кодування, витончену роботу зі знаннями та мультимодальну обробку з підвищеною точністю. Корпоративні клієнти використовують його для виконання вимогливих завдань, таких як складний парсинг документів, детальній аналіз діаграм і даних, а також підготовка довгих звітів.
Модель виконує складні міграції коду за допомогою оркестраційних фреймворків з кількома агентами з меншою затримкою та вищою якістю, ніж попередні версії. Крім того, 3.6 Flash допомагає розробляти екстрактори фотографічних текстур для 3D-робочих процесів за допомогою інтерфейсів на полотні.
Gemini 3.5 Flash-Lite призначений для середовищ, де висока пропускна здатність і абсолютна мінімальна затримка є обов’язковими. Google визначає її як найшвидшу модель у серії 3.5.
За даними Artificial Analysis, модель обробляє 350 вихідних токенів за секунду, що робить її надзвичайно ефективною для агентного пошуку та обробки величезних обсягів документів. Artificial Analysis зазначає, що це приблизно вдвічі швидше, ніж модель попереднього покоління Gemini 3.1 Flash-Lite.
Розробники можуть налаштувати 3.5 Flash-Lite для пріоритетного виконання з низькою затримкою для завдань з великим обсягом, використовуючи мінімальні рівні мислення, або задіяти вищі рівні мислення для обробки складних багатоетапних підзавдань агентів.
Попри позначку “lite”, вона перевершує стандартну Gemini 3 Flash у кількох ключових оцінках агентної роботи та кодування, включно зі SWE-Bench Pro, де вона набирає 54.2% порівняно з 49.6%, та OSWorld-Verified, набираючи 74.0% проти 65.1%.

Модель вилучає характеристики продукту з величезних наборів даних, генерує концепції інтерактивного веб-дизайну та безперебійно масштабує переклад чеків.
Третій продукт, Gemini 3.5 Flash Cyber, є високоспеціалізованим розгортанням. Google доналаштував цю модель спеціально для пошуку та виправлення вразливостей кібербезпеки. Вона інтегрується безпосередньо з агентом Google CodeMender.
На практиці кілька агентів 3.5 Flash Cyber працюють одночасно для створення одного комплексного звіту про вразливості, досягаючи конкурентної продуктивності на передових позиціях у бенчмарку CyberGym, навіть наближаючись до вельми розрекламованої моделі Anthropic Mythos.

Google не надав точної чисельної вартості для 3.5 Flash Cyber, зазначивши лише, що модель доналаштована “за нижчою ціною за токен, ніж у більших моделей”.
Лише комерційне ліцензування
Ліцензійна структура нових моделей Gemini має глибокі наслідки для розробників та корпоративних користувачів. Google розгортає Gemini 3.6 Flash і 3.5 Flash-Lite через комерційну, пропрієтарну модель API. На відміну від програмного забезпечення з відкритим кодом, що регулюється ліцензіями, такими як MIT License або GNU General Public License, розробники не отримують доступу до базових ваг моделі, даних для навчання чи вихідного коду.
Ліцензія MIT або GPL надає користувачам свободу завантажувати кодову базу, змінювати внутрішню архітектуру, самостійно розміщувати розгортання та незалежно розповсюджувати програмну інфраструктуру. Натомість, підхід Google API означає, що розробники фактично орендують доступ до інтелекту на суворо вимірюваній основі. Кожен запит і згенерована відповідь проходить через сервери Google, що керуються, incurring a cost based on the strict pricing structure of $1.50 per million input tokens for 3.6 Flash.
Це комерційне прив’язування обмежує гнучкість розгортання. Підприємства не можуть повністю ізолювати моделі на власному локальному захищеному обладнанні без встановлення спеціальних висококласних корпоративних угод з Google Cloud. Розробники залишаються зв’язаними політиками прийнятного використання Google, довільними обмеженнями швидкості та мережевими вимогами, створюючи постійну залежність від доступності інфраструктури Google та умов обслуговування.
Ліцензування Gemini 3.5 Flash Cyber виявляється ще більш обмежувальним. Визнаючи подвійне використання ШІ в галузі кібербезпеки — яке так само легко можуть використовувати зловмисники, як і захисники для виправлення систем — Google наразі робить модель доступною лише через пілотну програму з обмеженим доступом, подібну до тенденції, започаткованої моделлю Anthropic Mythos з її програмою Project Glasswing, і продовженої OpenAI з поступовим розгортанням GPT-5.6.
У цьому випадку Google робить 3.5 Flash Cyber ексклюзивно доступним для урядів та довірених партнерів. Таке суворе обмеження запобігає відкритому доступу, надаючи пріоритет системній безпеці над широким інноваційним розвитком розробниками.
Погляд у майбутнє
Google DeepMind продовжує швидко ітерувати, але прогалина в її лінійці продуктів залишається очевидною. Хоча серія Flash відзначається швидкістю та економічністю, індустрія з нетерпінням чекає на розгортання Gemini 3.5 Pro, щоб оцінити абсолютні передові можливості Google.
Водночас компанія підтверджує, що попереднє навчання Gemini 4 вже розпочалося.
До моменту появи наступного великого флагманського релізу розробники повинні оптимізувати свої системи, використовуючи високоефективну, але цілеспрямовано обмежену архітектуру Flash.
За даними порталу: venturebeat.com
