
Цього тижня стартап у сфері ШІ Liquid, заснований у 2023 році колишніми комп’ютерними вченими MIT, представив LFM2.5-2.6B – нову мовну модель з відкритими вагами, розроблену спеціально для агентських завдань (agentic workloads).
У своїх прес-матеріалах та нещодавньому інтерв’ю VentureBeat дослідники Liquid заявили, що LFM2.5-2.6B може працювати повністю на локальному обладнанні – від смартфонів і ноутбуків до Raspberry Pi – без необхідності використання хмарних обчислень або GPU. Це відкриває можливості для розгортання ШІ на пристроях (edge AI) та надає більше опцій для підприємств, що працюють у регульованих галузях або з конфіденційною інформацією, яку вони не бажають передавати в хмару.
Модель найкраще підходить для високооб’ємних, чітко визначених агентських завдань, які виконуються локально – таких як виклик інструментів, управління документами, автоматизація календаря та робочих процесів, а також постійних фонових процесів. Вона також ефективна в середовищах з обмеженим підключенням, як-от транспортні засоби та роботизовані системи. Однак для завдань, що вимагають інтенсивного кодування, краще використовувати більші моделі.
Навіть для тих компаній, які не мають таких обмежень, привабливість виконання ефективних, специфічних для завдань агентів за вартістю, фактично еквівалентною електроенергії, може зробити нову модель доволі привабливою.
Однак ліцензія на власні відкриті ваги, як і у випадку з попередньою великою моделлю Kimi K3 від Moonshot, опублікованою минулого місяця, потребує уважного вивчення юридичними відділами підприємств.
Основи
LFM2.5-2.6B містить 2.6 мільярда параметрів, підтримує контекстне вікно до 128 000 токенів і має вбудовану функцію виклику інструментів (tool calling). Досить складна назва пояснюється версією моделі (2.5) у поєднанні з кількістю параметрів (2.6B).
Як дотренована модель, так і базовий чекпоінт (LFM2.5-2.6B-Base) для розробників, які бажають її доналаштувати, доступні на Hugging Face. Вони мають підтримку основних стеків для інференсу з першого дня, включаючи llama.cpp, MLX, vLLM, SGLang та ONNX – що позиціонує модель для розгортання на споживчому обладнанні, корпоративній інфраструктурі та вбудованих системах.
Liquid також пропонує фреймворк для доналаштування з відкритим кодом LEAP.
Замість того, щоб позиціонувати LFM2.5-2.6B як конкурента найбільшим передовим моделям, компанія висуває інший аргумент: достатньо потужна мала модель може відкрити категорії корпоративних застосунків, де затримка, конфіденційність, гнучкість розгортання або витрати на інференс мають більше значення, ніж абсолютне лідерство у бенчмарках.
“Я також вважаю, що найкращі моделі будуть у хмарі, і в цьому немає проблем”, — сказав Максім Лабонн, керівник напрямку пост-тренінгу Liquid AI, в інтерв’ю VentureBeat після запуску. “Ми хочемо створювати моделі для іншого типу користувачів, і найкращий спосіб описати це: ви повинні використовувати [edge AI], коли не можете використовувати хмарну модель.”
Досить мала для Raspberry Pi
На запитання про мінімально прийнятне обладнання, Лабонн відповів, що модель “дуже, дуже добре” працює на CPU – і що архітектура LFM, яка лежить в основі моделі, була спеціально розроблена з урахуванням реальної продуктивності CPU, а не бенчмарків GPU.
“Думаю, найкращий приклад – це Raspberry Pi”, — сказав він. “У нас є багато демонстрацій, які показують, що вона працює досить швидко на Raspberry Pi.”
Вимірювання, надані компанією, вказують на пропускну здатність декодування приблизно 220 токенів на секунду на Apple M5 Max та 113 токенів на секунду на AMD Ryzen AI Max+ 395, при цьому споживаючи менше 2.5 ГБ пам’яті – і близько 30 токенів на секунду на смартфоні. Користувачі можуть спробувати моделі на своїх телефонах через Apollo, мобільний додаток Liquid AI.
На іншому кінці спектру розгортання, Liquid AI повідомляє, що модель досягає майже 15 000 вихідних токенів на секунду на одному Nvidia H100 GPU під тривалим одночасним навантаженням – приблизно 1.3 мільярда токенів на день на одній карті. Ці цифри є бенчмарками постачальника і не були незалежно перевірені.
Для Лабонна використання пам’яті та швидкість – це не зручності, а жорсткі обмеження, які визначають, що взагалі може бути розгорнуто.
“Ми хочемо показати, що це дійсно хороший компроміс, тому що ви отримуєте рівень якості, який мають значно більші моделі, але в крихітному, крихітному форм-факторі”, — сказав він. “Ви можете розгорнути її на цільових пристроях, де ви зовсім не можете розгорнути інші.”
Навчена для агентів, а не чат-ботів
Liquid AI стверджує, що LFM2.5-2.6B розроблялася на основі припущення, що мовні моделі все частіше використовуються через агентські фреймворки, а не традиційні розмовні інтерфейси.
“Моделі більше не використовуються в чат-ботах. Вони реально використовуються через агентські оболонки, такі як OpenClaw, Hermes Agent”, — сказав Лабонн. “Ми хотіли переконатися, що ця модель не просто хороша в математиці чи коді, а й добре використовує інструменти.”
Модель попередньо навчена приблизно на 34 трильйонах токенів, зі словником, подвоєним до 128K для кращої підтримки нелатинських скриптів, і спеціальною фазою до середини навчання для розширення контекстного вікна до 128K токенів для довготривалих агентських робочих процесів.
Пост-тренінг проходить за чотириступеневим конвеєром: кероване доналаштування, спеціалізація вчителя (навчання окремих експертних моделей для таких доменів, як виконання інструкцій, математика, код та використання інструментів), багатодоменне дистиляція на основі політики (MOPD) для об’єднання можливостей цих експертів назад в одну студентську модель, і, нарешті, навчання з підкріпленням для агентських завдань.
Під час цієї останньої стадії модель навчалася безпосередньо в операційних агентських фреймворках, включаючи Hermes Agent та OpenClaw, на реалістичних продуктивних завданнях, що включають дослідження, кодування, управління документами, виклик інструментів та автоматизацію робочих процесів, надаючи їй доступ до реальних інструментів, системних підказок та патернів взаємодії цих фреймворків.
Лабонн описав переробку конвеєра як “щасливу випадковість”: здобутки, які вийшли далеко за межі агентських цілей.
“Завдяки цим новим технікам навчання ми також стали набагато кращими у всьому. Ми стали кращими в математиці, у виконанні інструкцій. Ми ніколи не були хорошими в коді, насправді – а з цим ми стали навіть дуже хорошими в коді”, — сказав він.
Створення моделі – та її оболонки
Примітно, що Liquid AI також створила власну агентську оболонку, замість того, щоб покладатися виключно на існуючі фреймворки, і продемонструвала роботу моделі в ній на телефоні, планування та виклик інструментів повністю на пристрої.
“Це оболонка, що працює на телефоні, і я не знаю, чи є ще якась інша оболонка, що працює на телефоні”, — сказав Лабонн.
Компанія мала дві причини, пояснив він. Перша – необхідність: жодної нативної телефонної оболонки не існувало. Друга – інша модель взаємодії: сучасні оболонки чекають на підказку, а Liquid AI хоче помічників, які діють самостійно.
“Ми хочемо проактивних агентів. Ми хочемо агентів, які працюють у фоновому режимі, перевіряють, що ви робите, перевіряють ваш календар, і на основі цього контексту виконують завдання”, — сказав він. “Сьогодні цього насправді не існує.”
Спільне проєктування оболонки та моделі також дозволяє програмному забезпеченню компенсувати слабкі сторони моделі. “У всьому, в чому модель погана, оболонка повинна допомогти моделі – надати якомога більше допомоги, щоб зробити її більш надійною”, — сказав Лабонн. “Кінцеві користувачі не дбають про те, це модель чи оболонка. Вони хочуть, щоб завдання було виконано в кінці дня.”
Тим не менш, модель працює “з коробки” зі встановленими оболонками, включаючи Hermes Agent, OpenClaw та Pi, обслуговуючись через будь-який сумісний з OpenAI кінцевий пункт.
Змінюйте оболонку, а не модель
Для корпоративного розгортання Лабонн стверджував, що реліз означає зміну того, для чого можуть використовуватися малі моделі. До цього часу, сказав він, локальні моделі мали економічний сенс переважно як вузькоспеціалізовані – навчені робити одну річ на рівні якості хмарних моделей, але набагато швидше та дешевше. Агентська функціональність змінює цей розрахунок, оскільки ту саму модель можна перепрофілювати, змінюючи навколо неї інструменти, а не саму модель.
“Ви можете мати помічника календаря, а потім перепрофілювати ту саму модель і зробити помічника для зустрічей, який записуватиме все, що говорили, і узагальнюватиме – трохи схоже на Granola, наприклад”, — сказав він. “Ви не змінюєте модель; ви просто змінюєте оболонку. Ви просто змінюєте інструменти навколо неї. Це дає набагато більшу універсальність, і це набагато легше зробити, і набагато дешевше.”
Він все ще рекомендує доналаштування для продакшн-розгортань, коли це можливо: “Якщо ви не доналаштуєте її, ви втрачаєте частину якості. Якщо ви добре її доналаштуєте, вона зрівняється з продуктивністю GPT та Claude – дійсно, якщо ваше завдання не є найскладнішим завданням у світі”, — сказав він, додавши, що бар’єр для входу впав: “Бар’єр для можливості доналаштування зараз надзвичайно низький. Це дуже доступно для всіх.”
Порівняння з DeepSeek-V4-Flash, Gemma від Google та Qwen від Alibaba
Liquid AI опублікувала власні діаграми порівняння бенчмарків, що зіставляють LFM2.5-2.6B з моделями, які підприємства найчастіше розглядають для подібних периферичних розгортань: Gemma 4 E2B (5.1B параметрів) та E4B (8B) від Google, а також Qwen3.5-4B (4.7B) та Qwen3.5-9B (9.7B) від Alibaba.
Окреме тестування від клієнтської платформи локального ШІ Atomic Chat виявило, що LFM2.5-2.6B виконала 35 викликів інструментів для завершення трьох завдань (перевірка погоди та місцевого часу в шести містах, конвертація одного бюджету в шість валют, перевірка чотирьох готелів та бронювання на певну дату) у 3.7 рази швидше, ніж DeepSeek-V4-Flash (величезні 284B параметрів), модель, яка стрімко злетіла на вершину OpenRouter з моменту свого запуску минулого тижня.
Малі моделі Gemma 4 є мультимодальними універсалами, приймаючи зображення та аудіо ввід поряд з текстом, і використовують дизайн Per-Layer Embeddings, який активує лише частину їхніх ваг на токен – саме тому Google продає їх за “ефективним” розміром (2.3B та 4.5B), незважаючи на загальний обсяг 5.1B та 8B. Мала серія Qwen3.5 від Alibaba, випущена в березні, є нативно мультимодальною від 4B і покладається на масштабоване навчання з підкріпленням для досягнення рівня міркувань, характерного для передових моделей – Alibaba рекламує 9B модель як таку, що відповідає або перевершує значно більшу gpt-oss-120B від OpenAI на бенчмарках міркувань.
LFM2.5-2.6B йде вужчим шляхом: вона виключно текстова, щільна та спеціалізована для агентської роботи. Liquid AI випускає окремі варіанти LFM з підтримкою відео та аудіо, замість того, щоб об’єднувати все в один чекпоінт.
Тоді як пост-тренінгове навчання з підкріпленням Qwen спрямоване на міркування, Liquid фокусується на використанні інструментів у реальних агентських оболонках.
Результатом, згідно з опублікованими компанією даними, є те, що найменша модель у порівнянні лідирує у всіх бенчмарках виконання інструкцій (IFBench, Multi-IF, IFStruct) та майже у всіх бенчмарках використання інструментів – 77.83 на ToolSandbox проти 76.44 для Qwen3.5-9B, моделі майже в чотири рази більшої. Вона поступається лише цій 9B моделі на BFCLv4.

На агентських оцінках вона перевершує обидві моделі Gemma та майже зрівнюється з Qwen: 26.89 на BrowseComp+ проти 27.23 для Qwen3.5-9B. Вона також демонструє найкращий результат на AA Omniscience, бенчмарку знань, який штрафує галюцинації.
Моделі Qwen зберігають перевагу в тих сферах, на яких зосереджене їхнє навчання: математика (Qwen3.5-9B лідирує в AIME25) та кодування, де більші моделі зберігають перевагу на LiveCodeBench – хоча Лабонн зазначив, що розрив менший, ніж можна було б очікувати, виходячи з кількості параметрів.
“З LiveCodeBench v6 ми, можливо, не найкращі серед цих моделей, але ми також є найменшими. Те, що ми конкуруємо з ними, для мене вже велика перемога”, — сказав він.
Один фактор відрізняється: ліцензування. Gemma 4 та Qwen3.5 поставляються під дозвільною ліцензією Apache 2.0 – зміна, яку Google зробила спеціально для залучення підприємств. DeepSeek-V4-Flash поставляється під подібною дозвільною ліцензією MIT.
Тим часом, ліцензія Liquid AI, яка залежить від доходу (детальніше нижче), вимагає від великих компаній укладати комерційну угоду. Підприємства, що перевищують поріг, фактично обмінюють труднощі з ліцензуванням на зменшення обсягу та високу продуктивність у використанні інструментів.
Ліцензування відображає комерційний компроміс
LFM2.5-2.6B розповсюджується за ліцензією LFM Open License v1.0, яка дозволяє використання, модифікацію та розповсюдження – включаючи комерційне використання – для організацій з річним доходом менше 10 мільйонів доларів. Комерційне використання великими компаніями не покривається цією ліцензією і вимагає окремої домовленості з Liquid AI; кваліфіковані некомерційні організації звільняються від цього порогу для некомерційного використання та дослідницьких цілей.
Лабонн пояснив цю структуру як спосіб підтримки розробки моделей – “моделі – це справжні рови, тому ми повинні бути розумними в тому, як ми їх ліцензуємо; інакше ми не зможемо заробляти гроші, отже, не зможемо створювати більше моделей” – водночас характеризуючи поріг як практично несуттєвий механізм.
На запитання, як компанія дізнається, якщо велике підприємство тихо розгорне відкриті ваги, він був відвертий: “Я думаю, це питання до нашої юридичної команди, але особисто я не знаю. І навіть якщо ви перевищуєте 10 мільйонів доларів, єдине, що ми просимо, це зв’язатися з нами.”
Компанія доповнює свої релізи ліцензованих моделей вільно опублікованими дослідженнями, додав він, включаючи нові оцінки структурованого виведення та техніку навчання, яка зменшує петлі повторень, поширені в малих моделях – режим збою, який, як він зазначив, “певною мірою винен” моделям Qwen.
Мала модель, великі наслідки для бізнесу
Запуск збігся з анонсом MacPaw, української компанії-розробника програмного забезпечення, що стоїть за CleanMyMac та Setapp, про довгострокове стратегічне партнерство з Liquid AI для створення локального ШІ-стеку для Mac.
Liquid AI розроблятиме та доналаштовуватиме базові моделі для Eney, macOS-асистента MacPaw, які працюватимуть локально на Apple Silicon через інференс-рушій Elix та шар пам’яті Mnemos від MacPaw. Результати очікуються пізніше цього року.
Лабонн вказав на цю угоду як на конкретне підтвердження аргументу щодо розміру: “Одна з причин, чому вони обрали нас, полягає також у тому, що модель досить мала, і у них немає достатнього обсягу пам’яті для запуску інших моделей.”
Реліз з’являється в той час, коли виробники обладнання, розробники операційних систем та компанії-розробники корпоративного програмного забезпечення все більше інвестують у локальне виконання ШІ – і коли агентські оболонки поширюються по всій галузі. Ставка Liquid AI полягає в тому, що економіка розгортання, а не сирий масштаб, визначатиме важливий сегмент цього ринку: агенти, що працюють безперервно, скрізь, з нульовою граничною вартістю токена.
Чи стануть малі, високо оптимізовані агентські моделі значним сегментом корпоративного ШІ, зрештою, залежатиме менше від оцінок бенчмарків, ніж від операційної надійності. Але останній реліз Liquid AI свідчить про те, що наступний конкурентний рубіж – це вже не просто створення більших моделей, а створення моделей, достатньо малих і достатньо потужних, щоб працювати там, де вже існують корпоративні робочі процеси.
Оригінал статті: venturebeat.com
