
Компанія SpaceXAI, раніше відома як xAI, випустила Grok 4.6 — свою найновішу передову модель штучного інтелекту, яка зосереджена на довготривалих агентах, програмуванні та роботі зі знаннями. Вона має цінову стратегію, розроблену для зниження вартості виконання таких завдань.
Модель отримала 61 бал в незалежному індексі Artificial Analysis Intelligence Index, випередивши популярну китайську модель від Moonshot, Kimi K3, та зрівнявшись з GPT-5.6 Sol Max від OpenAI. Це на п’ять балів краще, ніж у Grok 4.5 High. Перші два місця посідають Claude Opus 5 та Fable 5 від Anthropic.
Більш значущим для компаній, що оцінюють AI-агентів, є помітне покращення Grok 4.6 порівняно з попередником у тестах програмування, роботи з терміналом, знаннями та агентів. При цьому ціна API починається від $2 за мільйон вхідних токенів і $6 за мільйон вихідних токенів, що робить її моделлю середнього цінового сегменту серед передових рішень, як пропрієтарних, так і з відкритим кодом, за даними аналізу VentureBeat.
|
Модель |
Вхідні ($/1M) |
Вихідні ($/1M) |
Загалом ($/1M) |
Джерело |
|
Muse Spark 1.2 Contributor |
$0.10 |
$0.20 |
$0.30 |
Meta |
|
MiMo-V2.5 Flash |
$0.10 |
$0.30 |
$0.40 |
Xiaomi |
|
deepseek-v4-flash |
$0.14 |
$0.28 |
$0.42 |
DeepSeek |
|
deepseek-v4-pro |
$0.435 |
$0.87 |
$1.305 |
DeepSeek |
|
GPT-5.6 Luna |
$0.20 |
$1.20 |
$1.40 |
OpenAI |
|
MiniMax-M3 |
$0.30 |
$1.20 |
$1.50 |
MiniMax |
|
LongCat-2.0 — акційна пропозиція |
$0.30 |
$1.20 |
$1.50 |
LongCat |
|
MiMo-V2.5 |
$0.40 |
$2.00 |
$2.40 |
Xiaomi |
|
LongCat-2.0 — стандартна |
$0.75 |
$2.95 |
$3.70 |
LongCat |
|
MiMo-V2.5 Pro (≤256K) |
$1.00 |
$3.00 |
$4.00 |
Xiaomi |
|
Muse Spark 1.1 / 1.2 |
$1.25 |
$4.25 |
$5.50 |
Meta |
|
GLM-5.2 |
$1.40 |
$4.40 |
$5.80 |
Z.ai |
|
Grok 4.6 — <200K вхідних токенів |
$2.00 |
$6.00 |
$8.00 |
xAI |
|
MiMo-V2.5 Pro (>256K) |
$2.00 |
$6.00 |
$8.00 |
Xiaomi |
|
Qwen3.8-Max |
$2.00 |
$6.00 |
$8.00 |
QwenCloud |
|
Gemini 3.6 Flash |
$1.50 |
$7.50 |
$9.00 |
|
|
GPT-5.6 Terra |
$2.00 |
$12.00 |
$14.00 |
OpenAI |
|
Grok 4.6 — ≥200K вхідних токенів |
$4.00 |
$12.00 |
$16.00 |
xAI |
|
GPT-5.4 |
$2.50 |
$15.00 |
$17.50 |
OpenAI |
|
Kimi K3 |
$3.00 |
$15.00 |
$18.00 |
Moonshot AI |
|
Claude Opus 5 |
$5.00 |
$25.00 |
$30.00 |
Anthropic |
|
Sakana Fugu Ultra (≤272K) |
$5.00 |
$30.00 |
$35.00 |
Sakana AI |
|
GPT-5.6 Sol — Стандартний режим |
$5.00 |
$30.00 |
$35.00 |
OpenAI |
|
Claude Fable 5 / Claude Mythos 5 |
$10.00 |
$50.00 |
$60.00 |
Anthropic |
|
GPT-5.6 Sol — Швидкий режим |
$10.00 |
$60.00 |
$70.00 |
OpenAI |
Проте, це менше половини вартості GPT-5.6 Sol через API OpenAI у стандартному режимі.
SpaceXAI повідомляє, що Grok 4.6 доступний вже сьогодні в Grok Build — аналогу Claude Code від Anthropic та Codex від OpenAI. План SuperGrok коштує від $30 на місяць.
Також модель доступна у придбаному SpaceX стартапі Cursor, що спеціалізується на AI для програмування, а також у партнерів, серед яких OpenRouter, Vercel та Cloudflare.
SpaceXAI надає подвоєний обсяг включеного використання Grok 4.6 в Cursor та Grok Build протягом першого тижня.
Цей реліз виходить лише за кілька тижнів після Grok 4.5, запущеного в липні як модель для програмування, виконання завдань агентів та роботи зі знаннями. А також на день після запуску Grok Bot — нової системи для призначення AI-агентів для виконання завдань як віртуальних співробітників.
Головна зміна — поведінка агентів, а не лише черговий бал у бенчмарку
SpaceXAI описує Grok 4.6 як модель, створену спеціально для виконання завдань протягом тривалого часу, включаючи дослідження незнайомих тем, аналіз інформації, навігацію кодовими базами та перетворення ідей продуктів на робочі програми.
Компанія повідомляє, що модель пройшла довший додатковий етап тренування, ніж Grok 4.5, використовуючи куровані дані міркувань та технічні дані, згенеровані моделлю, разом з інженерними даними та змінами в оптимізаторі й рецепті навчання. Потім вона використовувала Grok 4.5 для регенерації траєкторій контрольованого тонкого налаштування в рівнях міркувань, агентних фреймворках, STEM, розробці програмного забезпечення та роботі зі знаннями, відфільтровуючи проблемні траєкторії за допомогою перевірок на основі моделі.
Навчання з підкріпленням також було спрямоване на агентні середовища, що охоплюють загальне програмування, роботу зі знаннями, оптимізацію ядра, веб-розробку та автоматизоване проектування.
Це важливо, оскільки корпоративні впровадження ШІ все більше виходять за рамки ізольованих взаємодій «запит-відповідь» на користь агентів, від яких очікується підтримка стану, використання інструментів, модифікація коду та відновлення після проблем протягом довших шляхів виконання.
SpaceXAI зазначає, що під час тестування Grok 4.6 демонстрував більше самотестування та верифікації на довших траєкторіях, перевіряючи власну роботу перед продовженням. Компанія також повідомляє про кращі перші спроби у інтерактивних та візуальних проектах порівняно з Grok 4.5. Це спостереження компанії, а не незалежні гарантії виробничої поведінки, але вони вказують на те, де SpaceXAI зосередила роботу моделі після тренування.
Grok 4.6 досягає передових позицій, але не домінує
Покращення Grok 4.6 порівняно з Grok 4.5 в нинішній конкуренції моделей ШІ неможливо переоцінити.
Згідно з Artificial Analysis, Grok 4.6 досяг Elo-оцінки (людські переваги у порівнянні результатів моделей віч-на-віч, адаптованої з шахів) 1753 на GDPVal-AA v2, бенчмарку, що вимірює продуктивність у реальних завданнях, таких як планування та створення діаграм. Для порівняння, Grok 4.5 отримав 1526, GPT-5.6 Sol Max — 1728, а Fable 5 Max — 1741.
Результати тестування кодування від SpaceXAI показують подібне поколіннєве покращення, але більшу конкуренцію на передовому рівні.

Grok 4.6 отримав 69.9% на CursorBench v3.2, що є покращенням порівняно з 66.7%, тоді як Fable 5 Max досяг 70.5%. На DeepSWE v1.1 Grok різко зріс з 54% до 65.9%, але GPT-5.6 Sol Max лідирує з 73%. FrontierCode v1.1 Extended показав зростання з 56.6% до 61.3%, порівняно з 60.6% для GPT-5.6 Sol Max та лідерськими 63.6% для Fable 5 Max.
Бенчмарки агентів показують схожу картину. Grok 4.6 досяг 57.5% на APEX-Agents, що на 10.4 пункти більше, ніж 47.1% у Grok 4.5, незначно випередивши GPT-5.6 Sol Max (56.7%), але поступаючись Fable 5 Max (59.2%). На APEX-SWE Grok 4.6 піднявся з 53.6% до 56.4%, тоді як Fable 5 Max отримав 58.8%.
Terminal-Bench v3.0 виявляє більший розрив. Grok 4.6 покращився з 15.7% до 26%, але GPT-5.6 Sol Max та Fable 5 Max показали результати 34.6% та 34.1% відповідно.
Два з найсильніших результатів Grok 4.6 отримав у довготривалих професійних завданнях. На AA-Briefcase він здобув Elo 1577, незначно випередивши Fable 5 Max (1574) та значно GPT-5.6 Sol Max (1502). На Harvey LAB Grok 4.6 досяг 15.8% проти 12.9% у Grok 4.5, 11.3% у Fable 5 Max та 2.5% у GPT-5.6 Sol Max.
SpaceXAI зазначає важливе методологічне застереження: сторонні оцінки в таблиці використовують найкращі власні або загальнодоступні результати. Тому порівняння не слід інтерпретувати як ідеально контрольовану оцінку чотирьох моделей.
Іншими словами, докази свідчать про суттєве оновлення порівняно з Grok 4.5, але не про тотальну перевагу над конкурентними передовими моделями. Grok 4.6 виграє кілька з представлених оцінок, тоді як GPT-5.6 Sol Max та Fable 5 Max зберігають значну перевагу в інших.
Вартість може бути важливішим корпоративним бенчмарком
Оцінка від Artificial Analysis додає ще один вимір: обсяг роботи, яку модель виконує за витрачені кошти.
Тестування розміщує Grok 4.6 на його Парето-фронті «Інтелект проти вартості за завдання» з показником $0.84 за завдання — що робить його менш вигідним, ніж попередник Grok 4.5, і менш економічним, ніж GPT-5.6 Luna від OpenAI, GLM-5.2 від z.ai та новий Muse Spark 1.2 від Meta, серед інших моделей.
Artificial Analysis також повідомляє, що Grok 4.6 виконав навантаження AA-Briefcase приблизно за 53 кроки та близько 0.5 мільярда вхідних токенів у середньому, порівняно з приблизно 103 кроками та 2 мільярдами вхідних токенів для Claude Opus 5 Max.
Ці вимірювання не доводять, що кожен виробничий агент використовуватиме менше токенів або завершить роботу вдвічі швидше. Вартість агентів значною мірою залежить від дизайну фреймворку, промптів, викликів інструментів, кешування, поведінки при повторних спробах та самого завдання. Але вони вказують на все більш важливий корпоративний показник: вартість завершення робочого процесу, а не просто вартість генерації одного мільйона токенів. Це розходження є центральним для позиціонування SpaceXAI.
Стандартний API Grok 4.6 починається від $2 за мільйон вхідних токенів та $6 за мільйон вихідних токенів, а SpaceXAI також пропонує швидший варіант за подвійну ціну.
Документація API додає важливе застереження для розгортання з довгим контекстом. Grok 4.6 підтримує вікно контексту 500 000 токенів, але запити менше 200 000 токенів тарифікуються за $2 за мільйон вхідних токенів, $0.50 за мільйон кешованих вхідних токенів і $6 за мільйон вихідних токенів. Як тільки запит досягає 200 000 токенів, ці ставки зростають до $4, $1 і $12 відповідно, причому вища ціна застосовується до всіх токенів у цьому запиті.
Це означає, що підприємства не повинні екстраполювати базову ціну $2/$6 на все вікно контексту моделі при оцінці загальної вартості володіння.
Artificial Analysis зазначає, що стандартні базові ставки залишаються більш ніж на 60% нижчими за ціни конкуруючих передових моделей, наведених для Claude Opus 5 і GPT-5.6 Sol. Практична економія залежатиме від того, скільки токенів кожна модель споживає для виконання одного й того ж завдання.
Назва Grok несе значний багаж та суперечки, окремо від загального скептицизму щодо ШІ
Продуктивність і ціна можуть бути не єдиними перешкодами, з якими стикається SpaceXAI на шляху до впровадження Grok 4.6 у корпоративному секторі. Бренд Grok має незвично помітну історію суперечок щодо безпеки та управління, включаючи екстремістські та антисемітські виходи, політично упереджені відповіді, перебільшену похвалу Ілона Маска, а нещодавно — використання можливостей генерації зображень Grok для створення сексуалізованих зображень без згоди. Для компаній зі строгими вимогами до відповідності, безпеки бренду або відповідального ШІ, ця історія може стати фактором при закупівлях, окремо від технічних можливостей самого Grok 4.6.
Найбільш відомий епізод генерації тексту стався в липні 2025 року, коли Grok публікував антисемітські пости, хвалив Адольфа Гітлера, а в деяких відповідях називав себе «MechaHitler». xAI, попередник SpaceXAI, згодом заявив, що видаляє неприйнятні пости і вживає заходів для запобігання публікації Grok мови ненависті.
Також влітку 2025 року Grok почав додавати посилання на так званий «білий геноцид» у Південній Африці у відповіді на непов’язані запитання. xAI заявив, що несанкціонована модифікація програмного забезпечення відповідей Grok спрямувала систему на генерацію певних відповідей на політичну тему, оминаючи звичайний процес перевірки. Компанія заявила, що зміна порушила її політику, і згодом зобов’язалася публікувати системні промпти Grok та встановити цілодобовий моніторинг проблемних відповідей. Уряд Південної Африки відкинув заяви про те, що відбувається геноцид проти білих південноафриканців.
Об’єктивність Grok знову опинилася під сумнівом у листопаді того ж року, коли чат-бот неодноразово надавав неймовірно схвальні оцінки Маску. Серед прикладів, про які повідомлялося на той час, були твердження, що ставлять Маска вище елітних спортсменів та історичних інтелектуалів. Маск заявив, що Grok був маніпульований через ворожі підказки, щоб робити «абсурдно позитивні» заяви про нього. Незалежно від основної причини, інцидент проілюстрував репутаційну проблему для корпоративної моделі, виходи якої можуть бути пов’язані з публічним образом керівника, найтісніше асоційованого з її розробником.
Найсерйозніші суперечки стосувалися генерації зображень. У січні 2026 року регулятор Великої Британії Ofcom розпочав офіційне розслідування щодо X після повідомлень про те, що обліковий запис Grok використовувався для створення та розповсюдження оголених зображень людей та сексуалізованих зображень дітей. Ofcom заявив, що матеріал, який розглядається, може становити зловживання інтимними зображеннями без згоди, порнографію та матеріали сексуального насильства над дітьми. X згодом заявив, що впровадив заходи, спрямовані на запобігання використанню облікового запису Grok для створення інтимних зображень людей, але Ofcom заявив, що його розслідування залишається відкритим.
Розслідування виходять за межі Ofcom. Управління комісара з питань інформації Великої Британії розслідує X та xAI щодо розробки та розгортання Grok, включаючи те, чи були персональні дані оброблені законно, та чи існували адекватні запобіжники для запобігання створенню шкідливих маніпульованих зображень. Тим часом Європейська комісія розпочала окреме офіційне розслідування відповідно до Закону про цифрові послуги, вивчаючи управління X системними ризиками, пов’язаними з Grok, зокрема поширення маніпульованих сексуально відвертих матеріалів.
Ці розслідування стосуються X та попередньої організації xAI, а не встановлення факту порушення законів новим Grok 4.6 API. Тим не менше, вони навряд чи допоможуть SpaceXAI продавати Grok бізнесу.
SpaceX придбала xAI у лютому 2026 року, і зараз AI-операція позиціонується як SpaceXAI, що означає, що найновіші моделі Grok знаходяться під іншою корпоративною структурою, але зберігають той самий бренд, орієнтований на споживача.
У наданих матеріалах немає доказів того, що сам Grok 4.6 повторює конкретні інциденти «MechaHitler», «білий геноцид», сексуальні зображення або лестощі Маску, пов’язані з попередніми розгортаннями Grok. Але корпоративні відділи закупівель рідко оцінюють модель ізольовано від її постачальника та історії продукту. Для SpaceXAI це означає, що Grok 4.6 може знадобитися продемонструвати не тільки те, що він дешевший або потужніший за конкурентні передові моделі, але й те, що контроль навколо нього є достатньо передбачуваним для організацій, які не можуть дозволити собі, щоб їхній постачальник ШІ став подією, що шкодить репутації бренду.
Ця спадкоємність створює потенційну проблему впровадження, яку таблиці бенчмарків не можуть виміряти. Розробники, що обирають модель для внутрішнього агента кодування, можуть бути зацікавлені переважно в ціні, затримці та виконанні завдань. Банк, державна установа, медичний заклад або споживчий бренд, що розгортає ту саму модель у клієнтських або регульованих робочих процесах, також можуть враховувати управління постачальником, засоби контролю безпеки контенту, аудиторську перевірку та репутаційні ризики.
Модель, створена для розгортання, а не лише для спілкування
Grok 4.6 підтримує текстові та зображені входи з текстовим виходом, виклик функцій, структуровані виходи та міркування, згідно зі специфікаціями API. Ці специфікації також перелічують обмеження швидкості в 150 запитів на секунду та 50 мільйонів токенів на хвилину, з доступністю API в us-east-1 та us-west-2.
У повідомленні про запуск Cursor так само характеризується Grok 4.6 як модель, розроблена для довготривалих агентів та амбітних інтерактивних і візуальних завдань, надаючи розробникам негайний доступ до моделі в рамках встановленого середовища агента кодування, а не вимагаючи від них спочатку створювати новий фреймворк навколо API.
Для корпоративних покупців такий спосіб розповсюдження може мати майже таке ж значення, як і черговий результат у рейтингу. Моделі все більше конкурують не тільки за показниками міркувань, але й за тим, чи можуть розробники інтегрувати їх у існуючі робочі процеси кодування, дослідження та операційні процеси без дестабілізації цих робочих процесів або різкого збільшення витрат на висновки, а також без негативних наслідків від асоціації з суперечливим брендом.
Grok 4.6 не встановлює незаперечну перевагу в продуктивності. Його запуск натомість представляє іншу пропозицію: передовий рівень інтелекту, значні покращення порівняно з попереднім поколінням, краща поведінка довготривалих агентів та відносно агресивна токен-економіка.
Наступним тестом буде те, чи пошириться ефективність, яку Artificial Analysis спостерігає у контрольованих агентних завданнях, на реальне використання. Якщо Grok 4.6 зможе послідовно виконувати довготривалі завдання кодування та роботи зі знаннями з меншою кількістю кроків і токенів, найважливішим бенчмарком моделі зрештою може стати рахунок за висновки для підприємства, а не лідерборд.
Джерело новини: venturebeat.com
