Moonshot AI випустила ваги Kimi-K3: майже не поступається лідерам, але значно простіша у використанні

Китайська компанія Moonshot виконала свою обіцянку і безкоштовно опублікувала вагові коефіцієнти революційної моделі штучного інтелекту Kimi-K3. Тепер будь-хто, хто має достатньо потужні обчислювальні ресурси, може запустити її на своєму обладнанні.

 Джерело зображень: kimi.com

Джерело зображень: kimi.com

На практиці було підтверджено, що Kimi-K3 значно перевершує моделі OpenAI GPT та Anthropic Claude попередніх поколінь і лише трохи поступається передовим Sol та Fable. При цьому експлуатація китайської моделі коштує в 2-3 рази дешевше за американські аналоги, а якщо запит потрапляє до кешу, то й у 10 разів. За введення даних на своїх ресурсах Moonshot AI стягує $3 за 1 млн токенів; для порівняння, Anthropic Fable коштує $10, а OpenAI GPT-5.6 Sol — $5. І це для некешованих вхідних даних; а механізми кешування Kimi-K3 забезпечують 90% потрапляння для завдань на написання коду, і $3 перетворюються на $0,30 за той самий 1 млн токенів. Аналогічна ситуація і з вихідними токенами.

Найімовірніше, такої ефективності розробники досягли за рахунок комбінації формату чисел MXFP4 для зберігання вагових коефіцієнтів та MXFP8 для активації вхідних даних — в обох випадках точність відносно низька, що допомагає економити пам’ять. З 2,8 трлн параметрів Kimi-K3 одночасно активні лише 104,2 млрд. Цікаво, що в описі згадується робота моделі лише на відносно скромних прискорювачах Nvidia H20, які не мають вбудованої підтримки MX з плаваючою комою на відміну від чипів сімейства Blackwell, які не постачаються до Китаю. Це означає, що Kimi-K3 оптимізована для роботи на менш потужному обладнанні, а запуск на передових Nvidia Blackwell або інших прискорювачах з підтримкою MXFP може зробити її більш економічною, але офіційними даними це поки що не підтверджено.

Крім того, Kimi-K3 не користується сховищем key-value (KV), замість якого пропонується обробник станів фіксованого розміру Kimi Delta Attention, що в теорії обіцяє економити відеопам’ять і скорочувати час виконання. Алгоритм MoE (Mixture-of-Experts) передбачає запуск лише 16 з 896 «експертів», що додатково сприяє зниженню витрат на виведення. Варто, однак, зазначити, що відкриті вагові коефіцієнти не означають відкритого вихідного коду: процес навчання та набір даних Moonshot тримає в секреті.

Подробиці можна знайти на сайті: 3dnews.ru

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *