Qwen3.8-27B: локальні потужні кодові агенти та міркування без хмари

Qwen3.8-27B: локальні потужні кодові агенти та міркування без хмари 1

Найбільший реліз моделі ШІ за останні кілька днів, принаймні серед розробників та користувачів ШІ-інструментів у соціальних мережах, — це не передова хмарна модель від OpenAI, Anthropic чи Google.

Це 27-мільярдна модель від Alibaba: Qwen3.8-27B з’явилася на Hugging Face у п’ятницю під ліцензією Apache 2.0 з відкритим кодом, дружньою до підприємств. Вона надає розробникам завантажувані ваги для щільної мультимодальної моделі.

Однак Qwen3.8-27B — це не звичайна невелика локальна модель: вона включає нативне розуміння зображень і відео, вікно контексту на 262 144 токени, налаштовувану логіку та підтримку робочих процесів для кодування та агентських систем — це «компактна, зручна для розгортання» версія можливостей, розроблених для її покоління Qwen3.8.

Такий незвичайно невеликий розмір обладнання є значною частиною привабливості Qwen3.8-27B. Запуск моделі з повною 16-бітною точністю вимагає приблизно 56 ГБ відеопам’яті GPU, тоді як версія FP8 потребує близько 28 ГБ. Але 4-бітна квантизація зменшує саму модель приблизно до 17 ГБ, що робить її доступною для високопродуктивних споживчих машин, таких як потужний ігровий настільний комп’ютер або добре обладнаний ноутбук.

Оптимальне поєднання можливостей і розміру

Надзвичайна реакція серед розробників зумовлена динамічним поєднанням її можливостей та розміру.

Власні тестові показники Alibaba одразу ж викликали першу хвилю зацікавлення. Компанія повідомила 61.7 на SWE-bench Pro, 90.3 на LiveCodeBench v6, 70.7 на своєму бенчмарку для офісної роботи CoWorkBench та 84.3 на OSWorld-Verified.

У опублікованій Alibaba таблиці порівнянь 27B модель навіть перевершує заявлений результат Claude Opus 4.6 Max на SWE-bench Pro та LiveCodeBench, хоча Opus залишається попереду на Terminal-Bench, GPQA Diamond та Humanity’s Last Exam.

Деякі з оцінок Alibaba є внутрішніми, а середовища для бенчмаркінгу не є ідентичними для кожного порівняння, що робить ці цифри поганою основою для оголошення універсального переможця.

Сторонні результати демонструють потужну локальну модель з продуктивністю, еквівалентною пропрієтарним моделям місячної давності

Розмова змінилася в понеділок, коли почали надходити сторонні результати.

Стороннє агентство з бенчмаркінгу ШІ Artificial Analysis надало Qwen3.8-27B оцінку 52 за їхнім Індексом Інтелекту, що є сукупністю дев’яти оцінок, які охоплюють кодування, наукові дослідження, логіку та професійні завдання. Це збігається з тією ж оцінкою, яку Artificial Analysis наразі присвоює низькорівневій моделі OpenAI GPT-5.6 Luna з її максимальним налаштуванням логіки — пропрієтарній пропозиції, доступній лише через хмару.

Як зазначив розробник кодувального агента Cline на X: «Це перший раз, коли локальна модель досягла можливостей передової моделі. Ми не очікували такого швидкого прогресу локальних моделей».

Тим часом, в Індексі агентських систем Artificial Analysis, який вимірює продуктивність моделі в агентських завданнях, Qwen3.8-27B отримала 51 бал, випередивши Claude Opus 4.8 з максимальним зусиллям логіки — передову модель, випущену Anthropic менше ніж три місяці тому.

Це не означає, що ці моделі еквівалентні, але це допомагає пояснити, чому розробники та досвідчені користувачі ШІ звернули увагу. Як написав розробник та автор подкастів/YouTube-каналів про ШІ Sero (@0xSero на X, справжнє ім’я Шеріф Черф) на X: «Модель, яка працює на обладнанні вартістю 3 тис. доларів, перевершує все, що було 4 місяці тому. Включно з Opus. Постійна низька продуктивність скасована».

Розробник Джошуа «Xenova» Лохнер, відомий тим, що впроваджує моделі машинного навчання в веб-браузери, висвітлив цей результат у понеділок на X разом з експериментом запуску Qwen3.8-27B з кастомними ядрами WebGPU. Його реакція — «Який чудовий час жити!» — відображає загальний настрій: модель, яка отримує оцінки, близькі до пропрієтарних передових систем, можна завантажити, модифікувати та запустити локально, замість доступу лише через API постачальника.

Привабливість стає більш очевидною, коли модель стискається. Розробник та автор статей про ШІ Саймон Віллісон тестував квантизовану версію Q4_K_M обсягом приблизно 17 ГБ на MacBook Pro M5 Max та Nvidia DGX Spark.

Він виявив, що вона може писати код, інтерпретувати зображення та працювати в циклі кодувального агента через фреймворк Pi agent. В одному експерименті модель навігувала кодовою базою, щоб пояснити, як працює автентифікація; в іншому — написала та протестувала Python-утиліту, яка була потрібна Віллісону для конвертації транскрипції агента з JSONL у Markdown.

«Той факт, що файл обсягом 17 ГБ може робити все це на моїх домашніх машинах, — це диво», — написав Віллісон. Його загальний висновок резонує з досвідченими користувачами: можливості, які нещодавно здавалися невід’ємними від дорогих хостингових моделей, тепер вміщуються у файли, достатньо малі, щоб зберігати їх на робочій станції.

Ця реакція також відображається у використанні. Cybernews повідомив у понеділок, що Qwen3.8-27B перевищила 3 мільйони завантажень на Hugging Face за перші три дні, тоді як квантизовані версії швидко з’явилися для локальних інструментів інференсу.

Спільнота LocalLLaMA на Reddit створила окрему мегатему випуску просто для того, щоб консолідувати потік бенчмарків, квантизацій, порад щодо конфігурації та порівнянь. Один користувач, демонструючи локально створену гру, описав модель як «іншого звіра».

Надмірне обмірковування — це проблема

Ця метушня супроводжується важливим застереженням: Qwen3.8-27B, схоже, купує частину своєї якості, багато думаючи.

Artificial Analysis стверджує, що модель згенерувала 160 мільйонів вихідних токенів під час тестування Індексу Інтелекту, порівняно із середнім показником 43 мільйони для порівнянних моделей з відкритими вагами.

Віллісон зіткнувся з екстремальною версією тієї ж поведінки, оскільки Qwen за замовчуванням використовує високе налаштування логіки. Запит на генерацію SVG пелікана, який їде на велосипеді, зайняв 21 хвилину і спожив понад 22 000 токенів логіки перед тим, як видати відповідь. Він рекомендує починати з низької або відсутньої логіки для звичайного локального використання.

Інвестор і розробник Томаш Тунгуз виявив подібний компроміс у невеликому тесті з дев’яти завдань проти DeepSeek V4 Flash: з увімкненою логікою Qwen випередила за якістю у його агентському стеку, але він повідомив, що вона була приблизно в 30 разів повільнішою та в 4.5 рази дорожчою. Він прямо застеріг, що дев’яти завдань було недостатньо для остаточного висновку.

Програмне забезпечення для інференсу може скоротити цей розрив. Qwen3.8-27B включає Multi-Token Prediction (багатотокенове прогнозування), і Віллісон повідомив про приблизно 72% покращення продуктивності на своєму DGX Spark після активації MTP через llama.cpp порівняно з його стандартною конфігурацією LM Studio.

Навіть тоді його звичайні запуски LM Studio генерували лише приблизно від 15 до 30 токенів на секунду — значно нижче швидкості відгуку багатьох хостингових моделей.

Саме ця напруженість робить Qwen3.8-27B важливішою, ніж чергове місце в таблиці лідерів.

Що підприємствам слід винести з Qwen3.8-27B

Для підприємств відповідне порівняння полягає не просто в тому, чи 27B модель «перевершує» Claude чи GPT на бенчмарку. Важливо, чи модель, достатньо мала, щоб працювати в межах власної інфраструктури організації, тепер може виконувати достатньо завдань з кодування, аналізу документів, візуалізації та агентської роботи, щоб замінити виклики API для значних класів завдань.

Ця пропозиція змінює розрахунки приватності, розгортання та витрат. Ваги Apache 2.0 можуть бути перевірені, модифіковані та розміщені під власним контролем компанії, тоді як Alibaba вже документує сумісність з фреймворками обслуговування, включаючи vLLM, SGLang та TokenSpeed. Alibaba стверджує, що пізніше з’явиться керована версія Qwen Cloud з контекстним вікном за замовчуванням на 1 мільйон токенів та вбудованими інструментами.

Малий розмір та доступні вимоги до обладнання означають, що підприємства, незалежні розробники та навіть допитливі споживачі можуть легко розгорнути модель локально, не турбуючись про те, що їхні дані залишать їхню машину — забезпечуючи більшу приватність, безпеку інформації, управління та контроль.

Є ширша причина, чому досвідчені користувачі звертають увагу. Дані Hugging Face, опубліковані Business Insider цього тижня, показують, що фактичне використання моделей значно зміщується в бік менших моделей, навіть коли величезні передові релізи домінують у заголовках; моделі з понад 70 мільярдами параметрів становили лише невелику частку завантажень у 2026 році.

Стратегія Alibaba з публікації моделей Qwen у різних практичних розмірах допомогла зробити сімейство моделей постійною частиною робочих процесів локального розгортання розробників.

Qwen3.8-27B розширює цю логіку. Її результати бенчмарків все ще потребують додаткової незалежної перевірки, її стандартна поведінка логіки може бути болісно неефективною, і жодна окрема таблиця лідерів не встановлює паритету з передовими моделями.

Але через три дні після випуску розробники вже не реагують в основному на таблицю бенчмарків Alibaba. Вони реагують на досвід розміщення відносно невеликого файлу на обладнанні, яке вони контролюють, і спостереження за тим, як він виконує завдання, які ще не так давно здавалися ексклюзивними для найбільших пропрієтарних систем.

Для певних розробників, досвідчених користувачів ШІ — і так, навіть для корпоративних розгортань — це найважливіший бенчмарк.

За матеріалами: venturebeat.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *