
Лише через два тижні після випуску Thinking Machines своєї першої відкритої мовної моделі зі штучним інтелектом Inkling, стартап, добре фінансований колишнім технічним директором OpenAI Мірою Мураті, сьогодні представив Inkling-Small, не жертвуючи значною продуктивністю. Більше того, нова модель перевершує свого більшого попередника за кількома показниками.
Inkling Small — це багатогранна модель міркування з 276 мільярдами параметрів і дозвільною ліцензією Apache 2.0, яка в незалежному рейтингу Artificial Analysis Intelligence Index поступається лише на один бал своєму старшому брату, хоча оригінальний Inkling мав 975 мільярдів параметрів (внутрішні налаштування моделі). Вона приймає текстові, зображення та аудіовходи, генерує текст і підтримує контекстне вікно до одного мільйона токенів.
Inkling Small використовує 12 мільярдів активних параметрів на токен, порівняно з 41 мільярдом активних параметрів Inkling, зберігаючи при цьому значну частину продуктивності флагманської моделі в кодуванні, міркуванні та мультимодальності.
Для підприємств привабливість полягає не лише в меншому розмірі Inkling-Small. Вона полягає в тому, що розробники, схоже, втрачають відносно мало функціональності, зменшуючи при цьому обчислювальні вимоги моделі, витрати на виведення та розмір розгортання.
Модель залишається занадто великою для ноутбука чи звичайного робочого місця, але вона суттєво простіша в експлуатації, ніж її в 3,5 рази більший флагман, що робить її чудовим вибором для підприємств, які мають певний, але не надмірний парк власних графічних процесорів (GPU).
Thinking Machines випустила повні вагові коефіцієнти на Hugging Face та додала підтримку доналаштування через API їхньої програми навчання моделей Tinker.
На момент запуску компанія пропонує обмежену за часом знижку 50%, знижуючи ціни API для стандартної моделі Inkling-Small з контекстом 64K до $0.58 за мільйон токенів попереднього завантаження (введення), $1.44 за мільйон згенерованих (вихідних) токенів і $1.73 за мільйон навчальних токенів, із кешованими запитами попереднього завантаження за ціною $0.116 за мільйон токенів. Варіант з контекстом 256K також доступний за вищими ставками.
Майже така ж продуктивність при чверті розміру
Artificial Analysis присвоїла Inkling-Small оцінку 40 за Індексом Інтелекту, порівняно з 41 для Inkling.
Цей результат є примітним, оскільки Inkling-Small має 276 мільярдів загальних параметрів і 12 мільярдів активних параметрів, тоді як Inkling має 975 мільярдів загальних параметрів і 41 мільярд активних параметрів.
Artificial Analysis також повідомила, що жодна модель з відкритими вагами такого ж розміру або меншого, як Inkling-Small, не отримала вищої оцінки в індексі.
Модель не просто наближається до загального показника флагмана. За кількома оцінками, вона перевершує Inkling.
Thinking Machines повідомляє, що Inkling-Small набрала 80,2% у SWE-bench Verified, порівняно з 77,6% у Inkling, і 64,7% у Terminal Bench 2.1, порівняно з 63,8% у більшої моделі. Вона також перевершує попередника в SciCode, Humanity’s Last Exam, GPQA Diamond та CritPt.
Переваги не є універсальними. Inkling зберігає чітку перевагу у фактичних знаннях та деяких агентських завданнях. Inkling-Small набрала 15,5% у τ³-Banking, порівняно з 23,7% у Inkling, а її оцінка AA Omniscience є негативною, що відображає слабше покриття фактичних даних, хоча її заявлений рівень галюцинацій трохи нижчий.
Цей компроміс є важливим для підприємств. Inkling-Small може бути привабливою для помічників з кодування, систем використання інструментів, генерації, доповненої пошуком, аналізу документів та мультимодальних робочих процесів, але організації, які використовують її для критично важливих фактичних завдань, все одно потребуватимуть пошуку, перевірки та людського контролю.
Як 276-мільярдна модель використовує лише 12 мільярдів параметрів за раз
Inkling-Small — це розріджена модель Mixture-of-Experts. Згідно з картою моделі, опублікованою Thinking Machines, її 42-шаровий декодер спрямовує кожен токен до шести з 256 спеціалізованих експертів, а також до двох спільних експертів, які залишаються активними для кожного токена.
Ця архітектура допомагає пояснити різницю між 276 мільярдами загальних параметрів моделі та її 12 мільярдами активних параметрів. Система зберігає великий пул вивченої потужності, але активує лише його частину під час кожного кроку виведення.
Вона також є нативно мультимодальною. Зображення, аудіо та текст проектуються у спільне представлення і обробляються спільно декодером, а не через повністю окремі зовнішні системи. Thinking Machines перераховує помічників з кодування, агентські програми, чат-боти, системи RAG та інші мультимодальні програми серед своїх цільових використань.
Компанія також підтримує змінне зусилля для міркування, дозволяючи розробникам збільшувати або зменшувати обчислювальні ресурси моделі під час тестування залежно від складності завдання. Це дає інженерним командам прямий спосіб збалансувати якість, затримку та вартість для різних робочих навантажень.
На жаль, «маленька» не означає, що вона працюватиме на ноутбуці
Незважаючи на свою назву, Inkling-Small не є моделлю споживчого масштабу.
За даними Thinking Machines, стандартний контрольний пункт BF16 вимагає щонайменше 600 ГБ сукупної пам’яті GPU. Компанія перераховує дві підтримувані конфігурації: 4x NVIDIA B300 GPU або 8x NVIDIA H200 GPU.
Квантований контрольний пункт NVFP4 знижує вимоги приблизно до 180 ГБ сукупної VRAM. Thinking Machines стверджує, що ця версія може працювати в режимі W4A4 на одному NVIDIA B300 або в режимі W4A16 на двох H200 GPU.
Це виключає звичайні ноутбуки, MacBook, настільні ігрові ПК та більшість робочих станцій розробників. Навіть локальні системи з потужною конфігурацією, як правило, значно поступаються необхідним обсягом пам’яті.
Практичні цілі розгортання — це корпоративні GPU-сервери, хмарні кластери та спеціалізовані постачальники послуг виведення. Тому етикетка “Small” є відносною до Inkling, а не до ширшого кола локальних моделей.
Проте, зменшення є значущим. Модель, яка наближається до продуктивності Inkling, потребуючи значно менше сукупної пам’яті, може знизити витрати на хостинг, полегшити планування потужностей і розширити коло організацій, здатних розміщувати її самостійно.
Для компаній, які прагнуть контролювати дані, поведінку моделі та доналаштування, цей менший обсяг може бути важливішим, ніж прагнення до найвищого можливого показника в бенчмарках.
І, звичайно, оскільки вона є відкритою, вона, без сумніву, буде швидко квантована (зменшена точність, але вимагає менше обчислень) і, ймовірно, буде змішана з іншими моделями, щоб зробити її ще меншою для обладнання споживчого класу.
Apache 2.0 — це золотий стандарт для корпоративних моделей з відкритим кодом
Ліцензування може бути таким же важливим, як і показники.
Inkling-Small випущена під ліцензією Apache 2.0, однією з найвідоміших дозвільних ліцензій у програмній індустрії. Вона, як правило, дозволяє організаціям використовувати, модифікувати, доналаштовувати, розповсюджувати та комерціалізувати модель, в тому числі всередині пропрієтарних продуктів, за умови дотримання вимог ліцензії щодо сповіщень та атрибуції.
Це надає підприємствам значно більше юридичної гнучкості, ніж багато кастомних “відкритих” ліцензій на ШІ, які можуть включати порогові значення доходу, зобов’язання щодо брендингу, обмеження використання або окремі умови для великомасштабного комерційного розгортання.
Це розходження стає все більш актуальним, оскільки все більше компаній, що займаються ШІ, публікують вагові коефіцієнти моделей, не використовуючи при цьому звичайну ліцензію з відкритим кодом.
Наприклад, китайська зірка ШІ Moonshot минулого тижня зробила вагові коефіцієнти своєї передової моделі Kimi K3 доступними за спеціальною “відкритою” ліцензією, яка включає додаткові комерційні умови, а не порівняно прості умови Apache 2.0.
Для юридичних, закупівельних та платформових команд ця відмінність може суттєво спростити впровадження. Apache 2.0 не усуває необхідності переглядати політики прийнятного використання, походження даних, регуляторні ризики або зобов’язання щодо подальшої безпеки. Але це дає організаціям чіткішу відправну точку для створення внутрішніх систем, випуску комерційних продуктів та підтримки модифікованих версій моделі.
Більш повторюваний конвеєр розробки моделей
Inkling-Small також демонструє, наскільки швидко Thinking Machines перетворила свій перший великий реліз моделі на повторюваний інженерний процес.
Дослідник Thinking Machines Горас Хе порівняв два запуски в дописі на X:
«Якщо мені здавалося, що для випуску Inkling потрібне ціле село, то Inkling-Small здалася набагато більш звичайною 😆 Ми просто взяли конвеєр, який використовувався для Inkling, передали йому меншу модель, і готово — нова модель! Inkling Small отримала чималу вигоду порівняно з Inkling від деяких незначних покращень, але в резервуарі ще залишилося багато…»
Цей коментар свідчить про те, що компанія більше не розглядає кожну модель як одноразовий дослідницький проєкт. Натомість вона створює повторно використовуваний конвеєр для попереднього навчання, після навчання, навчання з підкріпленням, оцінки та випуску.
Thinking Machines зазначає, що Inkling-Small отримала переваги від покращеного набору навчальних даних, змін у рецепту машинного навчання та дистиляції на основі політики з Inkling як вчителем. Потім команда два тижні продовжувала навчання з підкріпленням для кодування агентами.
Міра Мураті наголосила на тому ж самому в своєму дописі, описуючи Inkling-Small як порівнянну з Inkling при чверті розміру та підкреслюючи, що вагові коефіцієнти були відкритими і доступними для доналаштування на Tinker негайно.
Як підприємствам та розробникам ШІ слід думати про Inkling Small
Компанія також розповсюджує повні контрольні точки BF16 та NVFP4 і підтримує розгортання через SGLang, vLLM, TokenSpeed, Unsloth та інструменти Hugging Face.
Ця комбінація дає розробникам кілька шляхів розгортання: використання API, доналаштування через Tinker, звернення до стороннього постачальника послуг виведення або експлуатація моделі на приватній інфраструктурі.
Inkling-Small — це не модель, яку більшість людей завантажуватимуть та запускатимуть локально. Але для бізнесів, які обирають між дуже великим флагманом та більш керованою системою з відкритими вагами, вона пропонує переконливий компроміс: майже такий самий виміряний інтелект, кращі результати у кількох завданнях кодування та міркування, нижча ціна за токен, менший апаратний слід та ліцензія, що дозволяє широку комерційну розробку.
Більш загальний сигнал може бути ще важливішим. Thinking Machines показує, що Inkling не була одноразовим випуском. Компанія вже стискає своє сімейство моделей, вдосконалює конвеєр навчання та рухається до ритму, за якого відкриті мультимодальні системи можуть вироблятися, покращуватися та розгортатися більш рутинно.
Інформація підготовлена на основі матеріалів: venturebeat.com
