Qwen3.8-Max вражає: чи справді він перевершує GPT-5.6 Sol Max та Fable 5 у використанні агентів для комп’ютерних завдань?

Qwen3.8-Max вражає: чи справді він перевершує GPT-5.6 Sol Max та Fable 5 у використанні агентів для комп'ютерних завдань? 1

Китайський гігант електронної комерції та хмарних технологій Alibaba, а точніше його відома команда дослідників ШІ Qwen, минулого вечора представила Qwen3.8-Max. Це нова флагманська мультимодальна велика мовна модель (LLM) з 2,4 трильйонами параметрів, яка орієнтована на один із найконкурентніших сегментів передового ШІ-ринку: автономну розробку програмного забезпечення та довгострокові корпоративні завдання.

Якщо опубліковані компанією бенчмарки підтвердяться ширшими незалежними тестуваннями, Qwen3.8-Max не просто конкурує з провідними пропрієтарними моделями сьогоднішнього дня — вона перевершує кілька з них за деякими ключовими показниками в галузі агентних обчислень.

Найбільш помітно, що Qwen повідомляє, що Qwen3.8-Max демонструє результат 86.1 у бенчмарку OSWorld-Verified, який вимірює ефективність агентів у роботі з десктопним середовищем, випереджаючи GPT-5.6 Sol Max (83.2) та Fable 5 (85.0). Крім того, модель показує найвищий заявлений результат у PaperBench, а також лідирує або залишається висококонкурентною в тестах з розробки програмного забезпечення, відтворення досліджень, мультимодального міркування та візуальної веб-розробки.

Випуск також сигналізує про потенційно значний стратегічний зсув для Alibaba: компанія заявила, що відкриті ваги для Qwen3.8-Max будуть випущені наступного тижня, разом із Qwen3.8-27B.

Якщо це станеться під дозвільною ліцензією, це буде вперше, коли модель класу Max від Qwen стане доступною для самостійного розгортання. Це може суттєво змінити підходи до корпоративного впровадження.

Однак залишається важливий нюанс: Alibaba ще не розкрила умови ліцензування, залишаючи можливість, що випуск може використовувати більш обмежувальну кастомну ліцензію, як це було нещодавно з моделлю Kimi K3 від китайського конкурента Moonshot, а не широко дозвільну, як Apache 2.0.

Інше визначення «передового»

Протягом останнього року конкурентний ландшафт базових моделей стає все більш спеціалізованим.

OpenAI в основному зосередила свою серію GPT на загальних міркуваннях, мультимодальній взаємодії та корпоративній продуктивності.

Серія Claude від Anthropic робить акцент на кодуванні та надійних міркуваннях з довгим контекстом. Google продовжує просувати Gemini в бік мультимодальної продуктивності та веб-орієнтованих робочих процесів.

Kimi K3 від Moonshot AI нещодавно увійшла до обговорення, поєднуючи передову продуктивність з відкритим випуском ваг.

Qwen3.8-Max намагається поєднати багато з цих сильних сторін в одній моделі, націленій прямо на корпоративну автоматизацію.

Замість того, щоб наголошувати на розмовній інтелектуальності, Alibaba позиціонує модель як автономного співробітника, здатного виконувати проєкти, що тривають дні, а не хвилини.

За даними компанії, Qwen3.8-Max може автономно завершувати проєкти розробки програмного забезпечення тривалістю понад 10 днів, відтворювати наукові статті, що включають тисячі рядків коду, виконувати ітераційну оптимізацію дизайну мікросхем та постійно переглядати плани, використовуючи мультимодальні петлі зворотного зв’язку.

Ці демонстрації залишаються створеними компанією і ще не були широко відтворені незалежними оцінювачами. Тим не менш, вони ілюструють зростаючу тенденцію в галузі: передові моделі все частіше конкурують за своєю здатністю завершувати цілі робочі процеси, а не відповідати на окремі запити.

Бенчмарки все більше винагороджують автономне виконання

Набір бенчмарків, випущений разом з Qwen3.8-Max, відображає цей зсув.

Замість того, щоб зосереджуватися виключно на традиційних тестах міркування чи головоломках з кодування, багато з висвітлених оцінок вимірюють виконання завдань на довгих проміжках часу.

У OSWorld-Verified, який оцінює комп’ютерних агентів, що взаємодіють з десктопними середовищами, Qwen3.8-Max показує результат 86.1, випереджаючи GPT-5.6 Sol Max (83.2), Fable 5 (85.0) та Gemini 3.1 Pro (76.2).

Qwen3.8-Max вражає: чи справді він перевершує GPT-5.6 Sol Max та Fable 5 у використанні агентів для комп'ютерних завдань? 2

Модель також лідирує:

  • PaperBench: 93.0

  • TerminalBench 2.1: 86.6

  • Vision2Web: 69.0

  • LVBench: 81.8

  • ERQA: 77.8

В інших категоріях вона залишається конкурентоспроможною з провідними пропрієтарними моделями, хоча й відстає в деяких.

Наприклад, у бенчмарку професійної розробки програмного забезпечення SWE-Pro найвищий заявлений результат показує модель OpenAI, тоді як Opus 4.8 продовжує лідирувати в деяких оцінках розробки програмного забезпечення та в Agents’ Last Exam.

Замість домінування в кожному бенчмарку, Qwen пропонує один з найширших збалансованих профілів продуктивності, доступних на даний момент.

Цей баланс може виявитися важливішим для корпоративних покупців, ніж окремі перемоги в бенчмарках.

Багато організацій все частіше оцінюють моделі за їхньою надійністю у виконанні неоднорідних робочих процесів — написання коду, читання документів, навігація інтерфейсами, генерація звітів, аналіз зображень та координація кількох підзавдань — замість оптимізації під одну вузьку функцію.

Де Qwen3.8-Max виявляється найсильнішою

Якщо припустити, що опубліковані результати Alibaba будуть втілені у реальні розгортання, кілька корпоративних робочих навантажень виявляться особливо добре пристосованими для Qwen3.8-Max.

1. Довгострокова розробка програмного забезпечення

Основна демонстрація Alibaba включає автономну розробку програмного забезпечення, що триває понад десять днів.

Хоча підприємства повинні ставитися до цих демонстрацій як до заяв постачальника до незалежного відтворення, вони відповідають зростаючому інтересу до постійних агентів кодування, які працюють безперервно, а не інтерактивно.

Організації, що експериментують з автономними інженерними командами, автоматизацією CI/CD, підтримкою репозиторіїв, регресійним тестуванням або реалізацією функцій, можуть знайти Qwen особливо привабливою, якщо її агентська продуктивність виявиться стабільною поза лабораторними умовами.

2. Комп’ютерні агенти

Найсильнішою відмінністю, ймовірно, є використання комп’ютерів.

OSWorld швидко став одним із найбільш уважно спостережуваних бенчмарків у галузі, оскільки він вимірює здатність моделі взаємодіяти з операційними системами, а не просто генерувати текст.

Моделі, здатні надійно орієнтуватися в настільному програмному забезпеченні, можуть автоматизувати безліч повторюваних бізнес-процесів, включаючи обробку документів, інтеграцію корпоративного програмного забезпечення, внутрішні операції та застарілі робочі процеси, де API можуть бути відсутні.

Лідерство в OSWorld, таким чином, може призвести до реальних операційних переваг, якщо продуктивність у бенчмарках пошириться на виробничі середовища.

3. Автоматизація досліджень

Лідерство Qwen у PaperBench свідчить про значний потенціал для організацій, що займаються науковими обчисленнями, оглядом літератури, відтворенням експериментів та технічним аналізом.

Науково-дослідні установи, фармацевтичні компанії та команди промислових R&D все частіше використовують LLM не лише для узагальнення, але й для виконання відтворюваних обчислювальних робочих процесів. Моделі, здатні підтримувати контекст протягом розширених сесій, стають все більш цінними в таких середовищах.

4. Мультимодальні промислові робочі процеси

На відміну від попередніх мультимодальних систем, які переважно аналізували завантажені зображення, Qwen описує візуальне сприйняття як постійний механізм зворотного зв’язку, інтегрований у планування та виконання.

Така архітектура може бути особливо корисною у виробництві, логістиці, промисловому інспектуванні та огляді дизайну, де візуальні вхідні дані постійно інформують операційні рішення, а не служать ізольованими запитами.

Економіка може виявитися не менш важливою

Мабуть, найбільший конкурентний тиск створює не стільки оцінки в бенчмарках, скільки ціни через API QwenCloud (розташовану в Китаї):

Qwen3.8-Max коштує $2/$6 за мільйон вхідних/вихідних токенів. Це модель середнього цінового діапазону, але вона значно нижча за цінами провідних американських пропрієтарних пропозицій, з якими вона порівнюється. Вартість менша за 1/3 від загальної ціни (вхід + вихід) Claude Opus 5 і менша за 1/4 від ціни GPT-5.6 Sol Max.

Модель

Вхідні ($/1M)

Вихідні ($/1M)

Загалом ($/1M)

Джерело

MiMo-V2.5 Flash

$0.10

$0.30

$0.40

Xiaomi

deepseek-v4-flash

$0.14

$0.28

$0.42

DeepSeek

deepseek-v4-pro

$0.435

$0.87

$1.305

DeepSeek

GPT-5.6 Luna

$0.20

$1.20

$1.40

OpenAI

MiniMax-M3

$0.30

$1.20

$1.50

MiniMax

LongCat-2.0 — тимчасова акція

$0.30

$1.20

$1.50

LongCat

Gemini 3.1 Flash-Lite

$0.25

$1.50

$1.75

Google

Qwen3.7-Plus

$0.40

$1.60

$2.00

Alibaba Cloud

MiMo-V2.5

$0.40

$2.00

$2.40

Xiaomi

Gemini 3.5 Flash-Lite

$0.30

$2.50

$2.80

Google

LongCat-2.0 — стандарт

$0.75

$2.95

$3.70

LongCat

MiMo-V2.5 Pro (≤256K)

$1.00

$3.00

$4.00

Xiaomi

GLM-5.2

$1.40

$4.40

$5.80

Z.ai

Grok 4.5

$2.00

$6.00

$8.00

xAI

MiMo-V2.5 Pro (>256K)

$2.00

$6.00

$8.00

Xiaomi

Qwen3.8-Max

$2.00

$6.00

$8.00

QwenCloud

Gemini 3.6 Flash

$1.50

$7.50

$9.00

Google

Qwen3.7-Max

$2.50

$7.50

$10.00

Alibaba Cloud

Gemini 3.5 Flash

$1.50

$9.00

$10.50

Google

Gemini 3.1 Pro Preview (≤200K)

$2.00

$12.00

$14.00

Google

GPT-5.6 Terra

$2.00

$12.00

$14.00

OpenAI

GPT-5.4

$2.50

$15.00

$17.50

OpenAI

Kimi K3

$3.00

$15.00

$18.00

Moonshot AI

Gemini 3.1 Pro Preview (>200K)

$4.00

$18.00

$22.00

Google

Claude Opus 5

$5.00

$25.00

$30.00

Anthropic

GPT-5.5

$5.00

$30.00

$35.00

OpenAI

GPT-5.5 Instant (chat-latest)

$5.00

$30.00

$35.00

OpenAI

Sakana Fugu Ultra (≤272K)

$5.00

$30.00

$35.00

Sakana AI

GPT-5.6 Sol — Standard mode

$5.00

$30.00

$35.00

OpenAI

Claude Fable 5 / Claude Mythos 5

$10.00

$50.00

$60.00

Anthropic

GPT-5.6 Sol — Fast mode

$10.00

$60.00

$70.00

OpenAI

Нижчі витрати на інференс стають все важливішими, оскільки агентні системи споживають значно більше токенів, ніж звичайні чат-боти. Це, ймовірно, вплинуло на рішення OpenAI минулого тижня знизити ціни API своїх моделей GPT-5.6 середнього та нижнього рівня (Terra та Luna) на 20% та 80% відповідно.

Дійсно, як можуть підтвердити ті, хто використовує ці системи, автономні робочі процеси тривалістю в кілька годин, ітеративне планування та безперервне самокоригування можуть генерувати мільйони токенів під час одного завдання.

Для підприємств, що розгортають сотні або тисячі агентів одночасно, витрати на інференс часто стають одними з найбільших операційних витрат. Невеликі зниження ціни за токен, таким чином, швидко приносять значну економію.

Як вона порівнюється з американськими передовими моделями

Незважаючи на порівняння в заголовках бенчмарків, Qwen3.8-Max не обов’язково слід розглядати як повну заміну провідних американських моделей.

Натомість, її сильні сторони вказують на різні стратегії розгортання.

Сімейство GPT від OpenAI продовжує виділятися як універсальна платформа для корпоративних міркувань з розвиненими інструментами, інтеграцією екосистеми та широким комерційним впровадженням. Організації, вже інвестовані в екосистеми Microsoft або корпоративні пропозиції OpenAI, можуть продовжувати цінувати ці операційні переваги, навіть якщо Qwen лідирує в окремих агентських бенчмарках.

Claude Opus від Anthropic залишається широко визнаним як один із найсильніших помічників з кодування, особливо для ретельної розробки програмного забезпечення та міркувань з довгим контекстом. Деякі підприємства можуть все ще віддавати перевагу Claude для розробки з участю людини, де надійність та передбачувана поведінка переважають над чистою автономією.

Google Gemini продовжує відрізнятися глибокою інтеграцією з Workspace, мультимодальними можливостями та сервісами Google Cloud, що робить його привабливим для організацій, які вже стандартизовані на корпоративному стеку Google.

Qwen виявляється найбільш переконливою для підприємств, які надають пріоритет автономному виконанню, розширеним горизонтам планування та сприятливій економіці інференсу, не жертвуючи при цьому передовим рівнем продуктивності.

Питання відкритих ваг залишається невирішеним

Найбільша невідомість навколо Qwen3.8-Max мало пов’язана з бенчмарками.

Alibaba заявила, що відкриті ваги з’являться наступного тижня. Однак ані оголошення, ані надана документація не уточнюють ліцензію, яка буде регулювати ці ваги.

Ця відмінність може виявитися критичною.

Дозвільна ліцензія, як-от Apache 2.0, значно розширила б корпоративне впровадження, дозволивши організаціям самостійно розміщувати, доналаштовувати та інтегрувати модель у пропрієтарні продукти з відносно невеликими обмеженнями.

Кастомна ліцензія — подібна до підходів, що використовуються в кількох останніх передових релізах — може накладати обмеження на комерційне розгортання, перерозподіл, сферу використання або модифікацію моделі. Такі обмеження звузили б привабливість для підприємств, що шукають довгострокові інвестиції в інфраструктуру, незалежно від технічної продуктивності моделі.

Нещодавній випуск Kimi K3 від Moonshot AI ілюструє, чому ця відмінність має значення. Хоча Kimi K3 зробила свої ваги відкрито доступними для всіх, її ліцензійні умови включали конкретні положення, зокрема вимогу щодо розкриття інформації та комерційної ліцензії для тих, хто пропонує її як “Модель як послугу”.

Доки Alibaba не опублікує ліцензію Qwen3.8-Max, організації, які розглядають можливість самостійного розміщення, повинні ставитися до оголошення про відкриті ваги як до перспективного, але неповного.

Все більш насичений передовий ринок

Qwen3.8-Max з’являється під час одного з найшвидших періодів в історії базових моделей.

Протягом кількох тижнів розробники бачили великі релізи від Moonshot AI, OpenAI, Anthropic та інших, кожен з яких наголошував на різних сильних сторонах: міркування, кодування, мультимодальність, автономні агенти або економіка.

Внесок Alibaba є примітним, оскільки він поєднує конкурентну продуктивність у бенчмарках, агресивне ціноутворення, вікно контексту в один мільйон токенів та заявлену прихильність до випуску ваг для своєї флагманської моделі.

Чи стане вона бажаною платформою для корпоративних автономних агентів, зрештою залежатиме не стільки від позицій у таблицях лідерів, скільки від ширшої незалежної валідації, надійності в роботі та умов ліцензування, що супроводжуватимуть майбутній випуск ваг.

Ці фактори, а не лише діаграми бенчмарків, визначатимуть, чи стане Qwen3.8-Max справжньою альтернативою провідним американським пропрієтарним моделям, чи просто ще одним вражаючим учасником все більш насиченої гонки передового ШІ.

Джерело новини: venturebeat.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *