Meta повертається до open source з AI-моделлю Muse Glimmer обсягом 30B

Meta повертається до open source з AI-моделлю Muse Glimmer обсягом 30B 1

Компанія Meta випустила Muse Glimmer, модель з 30 мільярдами параметрів з відкритими ваговими коефіцієнтами, призначену для запуску автономних ШІ-агентів безпосередньо на споживчому обладнанні. Це дозволяє переносити обчислювальні навантаження агентів, які зазвичай залежать від хмарної інфраструктури, на потужні Mac і ПК.

Не менш важливим є ліцензування моделі. Glimmer випускається під дозвільною, промислово стандартною ліцензією відкритого програмного забезпечення Apache 2.0 — це перший повністю відкритий реліз компанії після того, як у квітні вона представила пропрієтарну Muse Spark, що прийшла на зміну відкритій родині Llama.

Muse Glimmer випускається з ліцензією, яка є більш дозвільною, ніж та, що мала Llama. Спеціальна ліцензія Llama спільноти роками зазнавала критики через обмеження, як-от відсікання за 700 мільйонами користувачів на місяць; Apache 2.0 не має таких обмежень, дозволяючи необмежене комерційне використання, модифікацію та розповсюдження.

Вагові коефіцієнти вже доступні на Hugging Face. Підтримка моделі розгортається цього тижня через Ollama, LM Studio, vLLM, SGLang, Together AI, Fireworks AI та OpenRouter, а оптимізовані інтеграції llama.cpp, MLX та ExecuTorch з’являться найближчими днями. У блозі Meta також згадується Unsloth як партнер для локальних середовищ виконання та PyTorch TorchTitan для донавчання. Компанія працює з AMD, Arm, Dell, Intel та Nvidia над оптимізацією продуктивності на різних пристроях і опублікувала документацію для розробників, що охоплює шаблони кастомних агентів.

“Сьогодні ми також відкриваємо вагові коефіцієнти для Muse Glimmer, чудової щільної моделі з 30 мільярдами параметрів, яка може працювати локально”, — написав співзасновник і генеральний директор Meta Марк Цукерберг у дописі на X (під своїм давнім ніком @finkd). “Невдовзі ми також випустимо вагові коефіцієнти для Muse Spark 1.2, нашої новітньої базової моделі. Meta є активним прихильником відкритого програмного забезпечення, і я пишаюся цими релізами”.

Для розробників та підприємств практичні переваги локального виведення виходять за межі місця обчислень. Агент, що працює з файлами, знімками екрана, середовищами розробки та іншим чутливим контекстом, може виконувати ці робочі процеси, не надсилаючи постійно цю інформацію до віддаленого сервісу виведення. Локальне розгортання також усуває залежність від мережевої доступності та оплату за кожен токен API — хоча організації все одно несуть витрати на обладнання, електроенергію, розгортання та управління.

30B модель, побудована навколо циклу роботи агента

Замість того, щоб позиціонувати Glimmer насамперед як загальний чат-бот, Meta тренувала її навколо послідовності операцій, які виконує автономний агент: формування плану, виклик інструментів, інтерпретація результатів, продовження роботи та відновлення у разі виникнення помилок.

“Так само, як і набагато більші моделі, Muse Glimmer може функціонувати як повноцінний агент завдяки плануванню, викликам інструментів, перевірці власних результатів та відновленню після збоїв”, — написав Олександер Ванг, керівник відділу ШІ в Meta, у своєму дописі в X, анонсуючи реліз, додавши, що модель “може працювати з 24 ГБ відеопам’яті без втрати надійності роботи агента”.

Згідно з карткою моделі на Hugging Face, Glimmer — це щільний причинний трансформер приблизно з 29,6 мільярдами загальних параметрів у 52 шарах, що включає спеціалізований кодер сприйняття ViT-G/14 об’ємом ~1,8 млрд параметрів. Вона приймає чергування тексту та зображень, генерує текст, підтримує понад 100 мов і має заявлену довжину контексту 131 072 токени або більше, з відсіканням знань від 4 січня 2026 року.

Ця комбінація покликана дозволити агенту інтерпретувати знімки екрана, діаграми та документи, одночасно аналізуючи текст і викликаючи зовнішні інструменти. Glimmer пропонує низькі, середні, високі та екстрависокі налаштування міркувань — встановлюються через системний промпт — тому додатки можуть регулювати зусилля міркувань вгору або вниз для кожного завдання. Meta стверджує, що вона працює в рамках агентських каркасів, включаючи OpenClaw та Hermes Agent.

Модель є дистиляцією флагманської моделі Meta: згідно з технічним блогом компанії, Glimmer була попередньо навчена на виходах Muse Spark за допомогою дистиляції логітів, проміжно навчена на даних з довшим контекстом, орієнтованих на агентів, з детальнішими слідами міркувань, а потім донавчена за допомогою контрольованого донавчання, дистиляції за політикою та навчання з підкріпленням у загальних, міркувальних, кодувальних та агентських доменах.

Meta продемонструвала результат за допомогою локального робочого процесу Home Assistant: у демонстраційному відео Glimmer автономно виявляє екземпляр Home Assistant у мережі через виклики інструментів, запитує API пристроїв, створює з нуля адаптивний дашборд на HTML/CSS/JavaScript та розгортає локальний сервер для перевірки своєї роботи. Це ближче до операційної реальності корпоративних розгортань агентів, ніж самостійний тест на запитання-відповіді — модель повинна підтримувати план під час взаємодії із зовнішніми системами, а потім перевіряти, чи її дії дали очікуваний результат.

Стиснення агента до 24 ГБ

Історія з обладнанням є ключовою для цього релізу.

При повній точності Meta стверджує, що модель з 30 мільярдами параметрів потребує понад 55 ГБ пам’яті — це більше, ніж може запропонувати будь-який окремий споживчий GPU.

Тому компанія розробила приблизно 4-бітні квантовані версії, які зменшують розмір вагових коефіцієнтів мовної моделі до менш ніж 20 ГБ, залишаючи запас для компонентів, необхідних для роботи агента: KV-кеш, кодер сприйняття та супутня модель спекулятивного декодування, які всі вміщуються в діапазон 24 ГБ або 32 ГБ.

На практиці це означає, що квантовані збірки працюють на споживчих машинах — хоча й на найвищому рівні. Конфігурація K-Quant-17GB, розрахована на 24 ГБ, вміщується на один високопродуктивний споживчий графічний процесор, такий як Nvidia RTX 3090 або RTX 4090 (обидва з 24 ГБ відеопам’яті), тоді як версія K-Quant-Dynamic, розрахована на 32 ГБ, відповідає 32 ГБ новішої RTX 5090. На стороні Mac уніфікована пам’ять Apple Silicon відіграє роль відеопам’яті, тому MacBook Pro або Mac Studio з 32 ГБ або більше пам’яті можуть вмістити весь стек — Meta проводила власні тести швидкості на M4 Max та M5 Max MacBook Pro. Однак типовий ноутбук з 8 ГБ або 16 ГБ залишається недосяжним, а випуск повний точності BF16 — який Meta оцінює в 64 ГБ — залишається в сфері дата-центрових GPU та конфігурацій Mac Studio найвищого класу.

Meta повідомляє про середню деградацію точності лише на 0,2% за 15 бенчмарками для версії K-Quant-Dynamic, розрахованої на 32 ГБ обладнання, та на 1% для конфігурації K-Quant-17GB, розрахованої на 24 ГБ обладнання. Ці цифри є власними вимірюваннями Meta, а не незалежними оцінками.

Meta також використовує спекулятивне декодування DFlash для вирішення іншої великої проблеми локальних агентів: затримки. Замість того, щоб генерувати кожен токен послідовно, менша модель “кресляра” DFlash пропонує блоки з 16 токенів, які основна модель перевіряє паралельно, генеруючи ідентичний вивід швидше.

Meta повідомляє, що це збільшує середню швидкість генерації на Nvidia RTX 5090 з 74,9 токенів на секунду до 233,4 — зростання в 3,1 рази. На Apple M5 Max показник зростає з 26,6 до 50,2 токенів на секунду (1,8 рази), а на M4 Max — з 23,7 до 37,8 (1,5 рази). Тести використовували розмір пакету один і жадібне декодування, причому системи Apple вимірювалися за допомогою ExecuTorch, а RTX 5090 — за допомогою llama.cpp.

Для програм-агентів ці множники мають більше значення, ніж для чату: один запит користувача може викликати багато обертів моделі, викликів інструментів та кроків перевірки, а затримка, що накопичується на кожному етапі, може швидко зробити інакше здатного агента непрактичним.

Glimmer виходить на ринок локальних моделей, що швидко розвивається

Meta не виходить на порожнє поле. Розробники вже мають потужні відкриті моделі в цьому класі розміру, найвизначнішими з яких є сімейство Gemma 4 від Google та Qwen3.6-27B від Alibaba — обидві позиціонуються навколо міркувань, мультимодального розуміння та агентських завдань. Таблиця бенчмарків Meta порівнює їх безпосередньо.

Meta повертається до open source з AI-моделлю Muse Glimmer обсягом 30B 2

Glimmer лідирує в цьому порівнянні трьох моделей за кількома агентськими тестами, включаючи MCP Atlas (75,5), DeepSearch QA (74,6), τ³-Banking (23,5), WildClawBench (47,6) та GAIA2 (43,3). Вона показує 51,2 бала на SWE-Bench Pro, тоді як Gemma4-31B — 36,9, а Qwen3.6-27B — 50,2 за оцінкою Meta.

Проте Glimmer не перемагає у всіх категоріях. Qwen випереджає Meta у власному порівнянні за OSWorld-Verified (75,6 проти 65,9 у Glimmer), TerminalBench 2.1 (60,7 проти 51,7), SkillsBench, GDPval-AA (1141 проти 953) та більшості мультимодальних бенчмарків. На SWE-Bench Verified показник Glimmer 76,0 трохи поступається 77,2 у Qwen. Gemma лідирує за GPQA Diamond та Humanity’s Last Exam.

Чесно кажучи, ці цифри роблять Glimmer більш цікавою як спеціалізовану модель для локальних агентів, ніж як доказ універсального лідерства за продуктивністю. Для корпоративних розробників практичне питання полягає в тому, чи її поєднання надійності роботи агента, якості квантування, сумісності з інструментами та швидкості декодування перекладається з бенчмарків на стабільні реальні робочі процеси.

Модель

Розробник / походження

Оцінка AA

Параметри / контекст

Найнижча відстежена ціна API

Доступ

Ліцензія

Найсильніші сценарії використання

Kimi K3

Moonshot AI; Китай

60

2,8 трлн загалом / 104 млрд активних; 1 млн

3,00 дол. США за ввід / 15,00 дол. США за вивід через Kimi, Fireworks або Modal (ціни)

Вагові коефіцієнти

Kimi API

Спеціальна ліцензія Kimi K3. Оператори великих моделей як сервісу з доходом понад 20 млн дол. США за 12 місяців потребують окремої угоди

Великі продукти можуть вимагати відображення “Kimi K3”.

Передовий довготривалий код

Мультимодальні дослідження та складні агенти, керовані інструментами

GLM-5.2

Z.ai / Zhipu AI; Китай

53

753 млрд / 40 млрд активних; 1 млн

0,75 дол. США / 2,40 дол. США через DeepInfra FP4 (ціни)

Вагові коефіцієнти

Z.ai API

MIT

Довготривалий код та агенти

Аналіз мільйона токенів з регульованими міркуваннями

DeepSeek V4 Flash 0731

DeepSeek; Китай

52

284 млрд / 13 млрд активних; 1 млн

0,09 дол. США / 0,18 дол. США через DeepInfra (ціни)

Вагові коефіцієнти

DeepSeek API

MIT

• Надзвичайно економічні міркування• Агенти для кодування, робота в терміналі та використання інструментів

MiniMax-M3

MiniMax; Китай

45

428 млрд / 23 млрд активних; 1 млн

0,23 дол. США / 0,96 дол. США через CoreWeave (ціни)

Вагові коефіцієнти

;

MiniMax API

Ліцензія спільноти MiniMax. Потрібне комерційне зазначення; компанії з річним доходом понад 20 млн дол. США потребують дозволу. Включає умови забороненого використання.

• Нативна робота з текстом, зображеннями та відео• Довгоконтекстний код та агенти “співпраці”

MiMo-V2.5-Pro

Xiaomi; Китай

43

1,02 трлн / 42 млрд активних; 1 млн

0,35 дол. США / 0,70 дол. США через GMI (ціни)

Вагові коефіцієнти

Xiaomi API

MIT

Складне програмне інженерство

Агенти, що виконують тисячі викликів інструментів

Inkling

Thinking Machines Lab; США

42

975 млрд / 41 млрд активних; 1 млн у вагах

0,95 дол. США / 4,05 дол. США через DeepInfra FP8 (ціни)

Вагові коефіцієнти

Tinker

Apache 2.0

Настроювана база для тексту, зображень та аудіо

Системи для кодування, RAG та використання інструментів після донавчання

Nemotron 3 Ultra 550B A55B

NVIDIA; США

38

550 млрд / 55 млрд активних; до 1 млн у вагах

0,37 дол. США / 1,08 дол. США через Blackbox AI (ціни)

Вагові коефіцієнти

OpenMDW-1.1; дозвільні комерційні права та права на похідні моделі

Складні агенти та довгоконтекстні міркування

Високоточні RAG, код, математика та наука

Mistral Medium 3.5

Mistral AI; Франція

30

128 млрд щільних; 256 тис.

1,50 дол. США / 7,50 дол. США через Mistral (ціни)

Вагові коефіцієнти

Mistral API

Модифікований MIT. Компанії з консолідованим щомісячним доходом понад 20 млн дол. США повинні отримати комерційну ліцензію або використовувати сервіс Mistral.

Агенти для кодування та виклики функцій

Мультимодальне виконання інструкцій

Gemma 4 31B

Google DeepMind; США

30

30,7 млрд щільних; 256 тис.

Безкоштовно на обмеженому рівні Google AI Studio; платно від 0,10 дол. США / 0,34 дол. США через CoreWeave (ціни)

Вагові коефіцієнти

Google AI Studio

Apache 2.0

Компактні мультимодальні міркування та кодування

Керовані локальні або приватні серверні розгортання

gpt-oss-120b

OpenAI; США

24

117 млрд / 5,1 млрд активних; 131 тис.

0,03 дол. США / 0,17 дол. США через CoreWeave (ціни)

Вагові коефіцієнти

Численні сторонні API

Apache 2.0

Міркування

структурований вивід та інструменти

Донавчання та розгортання на одному GPU 80 ГБ

Command A+

Cohere; Канада

23

218 млрд / 25 млрд активних; 128 тис. вводу

Безкоштовно на відстежуваному кінцевому точці Cohere (ціни)

Вагові коефіцієнти

Cohere

Apache 2.0

Корпоративні RAG та обґрунтовані цитати • Багатомовні агенти та обробка документів

Muse Glimmer 30B

Meta; США

Ще не оцінено

29,6 млрд щільних, включаючи візуальний кодер; 131 тис.+

Публічна ціна за використання на момент запуску не виявлена

Вагові коефіцієнти

Сторінка моделі Meta

Apache 2.0 для вагових коефіцієнтів повної точності, квантованих версій, кресляра та кодера сприйняття

Постійно працюючі локальні агенти на системах 24–32 ГБ

Використання інструментів, відновлення, кодування та розуміння екрана/документів

Meta Glimmer доповнює невеликий список справді відкритих моделей передового класу від американських компаній.

Протягом останніх двох років китайські компанії задавали темп у сфері відкритого програмного забезпечення ШІ, при цьому DeepSeek, команда Qwen від Alibaba, Kimi від Moonshot AI, GLM від Zhipu та MiniMax випускали відкриті моделі передового класу під ліцензіями MIT та Apache 2.0 з такою частотою, яку західні лабораторії не могли зрівняти.

Дані використання це відображають: до травня 2026 року китайські моделі з відкритими ваговими коефіцієнтами становили приблизно 61% усіх токенів, спожитих на OpenRouter, причому чотири з п’яти найпопулярніших моделей походили з китайських лабораторій — тоді як Llama від Meta, попередній лідер у сфері відкритих вагових коефіцієнтів, повністю випала з рейтингів.

Американські винятки все ще можна перерахувати на пальцях однієї руки: gpt-oss-120b та gpt-oss-20b від OpenAI, випущені під Apache 2.0 у серпні 2025 року як перші відкриті вагові коефіцієнти компанії після GPT-2; сімейство Gemma від Google, яке є відкритим за ваговими коефіцієнтами, але постачається під власною, більш обмежувальною власною ліцензією Google, а не під схваленою OSI; та Inkling від Thinking Machines.

Glimmer запрошує до найпрямішого порівняння з gpt-oss: обидві використовують Apache 2.0, обидві пропонують регульовану складність міркувань і обидві орієнтовані на самостійне розгортання.

Однак моделі gpt-oss є текстовими, розрідженими архітектурами “суміші експертів”, створеними в основному для міркувань та використання інструментів — gpt-oss-20b вміщується приблизно в 16 ГБ пам’яті, тоді як gpt-oss-120b націлена на один GPU для дата-центрів об’ємом 80 ГБ.

Glimmer займає іншу нішу: щільна модель з нативним введенням зображень, навчена наскрізно навколо циклу роботи агента, що поставляється з власними квантованими варіантами та спекулятивно-декодувальним креслярем, налаштованим для споживчих машин з 24 ГБ.

І якщо Цукерберг виконає свою обіцянку відкрити вагові коефіцієнти Muse Spark 1.2, Meta випустить справжню американську флагманську модель передового класу у відкритий доступ — щось, чого жодна американська лабораторія не робила на цьому рівні.

Безпека залишається частиною архітектури розгортання

Надання локальній моделі доступу до інструментів створює іншу проблему безпеки, ніж розгортання локального чат-бота — і власні показники безпеки Meta показують, що Glimmer не є однозначно сильнішою за своїх конкурентів.

На CI Memories, бенчмарку конфіденційності, де нижчі показники порушень кращі, Glimmer має 26,4 проти 12,1 у Gemma та 53,4 у Qwen. На Siren AgentDojo, тесті на впровадження промптів, Glimmer демонструє 28,4% успішних атак проти 25,6% у Gemma та 40,3% у Qwen — при цьому показуючи найвищий показник корисності серед трьох — 94,2.

Meta стверджує, що оцінила Glimmer відповідно до своєї “Розширеної рамки масштабування ШІ” та визначила, що модель не відповідає визначенню “Frontier AI” рамки, оскільки вона загалом менш потужна, ніж Muse Spark. Її команда підготовки оцінила Glimmer як помірний або нижчий ризик у категоріях хімічних/біологічних загроз, кіберзагроз та втрати контролю — останні два випливають з того, що Glimmer загалом слабша за Muse Spark 1.0, яка отримала ті самі позначки.

Незважаючи на це, компанія рекомендує розгортати Glimmer як частину ширшої системи з запобіжними заходами, включаючи людський контроль для незворотних дій. Це застереження особливо важливе для локальних агентів: зберігання даних на пристрої зменшує ризик взаємодії з хмарною інфраструктурою, але локальне виконання само по собі не вирішує проблеми впровадження промптів, надмірних дозволів або ненавмисних дій агента.

Вагові коефіцієнти Apache 2.0 та швидкозростаюча екосистема середовищ виконання

Meta випускає вагові коефіцієнти повної точності BF16, обидва 4-бітні квантовані варіанти, креслителя DFlash та кодер сприйняття — все під ліцензією Apache 2.0. Ціна за завантажену модель через API Meta відсутня, тому загальна вартість залежить від локального обладнання або будь-якого стороннього хостингу, який оберуть розробники. Важливий нюанс для закупівельних команд: як і з більшістю релізів моделей “відкритого програмного забезпечення”, відкритими є саме вагові коефіцієнти — Meta не випустила навчальні дані чи код.

Ширше значення полягає в тому, що Meta розглядає робочу станцію розробника як реалістичну ціль для розгортання автономних агентів, а не просто місце для експериментів з меншими мовними моделями. Розмір Glimmer у 30 мільярдів параметрів та цільовий показник 24 ГБ роблять це рішення доступним для високопродуктивного споживчого обладнання, тоді як ліцензія Apache 2.0 надає розробникам — і їхнім юридичним відділам — незвичайну свободу для модифікації та розгортання.

Наступним випробуванням буде те, чи її переваги в бенчмарках витримають більш складні умови реальних сховищ програмного забезпечення, корпоративних інструментів та тривалих сесій роботи агентів. Якщо так, то найважливішою частиною Glimmer може стати не новий набір показників бенчмарків — це може бути те, що клас агентів, який раніше очікувався за хмарним API, все частіше зможе жити та працювати на машині, що стоїть під столом розробника.

Оригінал статті: venturebeat.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *