Kog поглиблює роботу з GPU для підвищення ефективності інференсу

Kog поглиблює роботу з GPU для підвищення ефективності інференсу 1
CEO Kog Gaël Delalleau

Змагання за швидшу інтерпретацію (inference) штучного інтелекту триває. На початку травня ринки тепло зустріли Cerebras та її спеціалізовані чипи під час дебюту на IPO. Однак французький стартап Kog робить ставку на те, що з традиційних GPU можна витиснути значно більше потужності.

У травні стартап потрапив на першу сторінку Hacker News з технічним попереднім переглядом, мета якого — довести, що «надзвичайно швидке декодування для одного запиту можливе на стандартних датацентрових GPU, які вже є у розпорядженні підприємств», як-от AMD MI300X та Nvidia H100, що використовувалися для його демонстрації.

Дехто висловив розчарування, що це не стосується GPU в ноутбуках, але інші побачили потенціал. Оскільки швидкість інтерпретації та вартість стали критичним вузьким місцем, обіцянка Kog розкрити нові можливості на наявному обладнанні за допомогою оптимізації програмного забезпечення привернула увагу не лише спостерігачів. «Ми отримали 200 відчутних бізнес-пропозицій», — повідомив TechCrunch генеральний директор Gaël Delalleau.

На основі ранніх відгуків, самотній засновник очікує, що першим випадком використання стане розробка програмного забезпечення. Досвідчені користувачі Claude Code добре знають, що іноді їм доводиться чекати годинами, щоб отримати результати. Anthropic також розуміє, що швидкість коштує грошей, і вимагає багаторазову оплату за Fast Mode у Claude.

Kog сподівається залучити клієнтів, яких відштовхують такі затримки, зазвичай тому, що вони покладаються на робочі процеси зі штучним інтелектом для професійних завдань. Але стартап також має партнерів з розробки, які дозволяють користувачам генерувати ігри та додатки за допомогою підказок, і для яких швидший результат завдяки Kog Inference Engine (KIE) означатиме більший дохід, зазначив Delalleau.

Компанія усвідомлює, що цей ринок ще не є зрілим. Спостерігаючи за попитом, Kog дізнався, що його потенційні клієнти не готові до тонкого налаштування невеликих моделей. «І саме тому з моменту запуску ми повністю зосередилися на прискоренні розробки більших моделей, щоб задовольнити побачений нами попит».

Це ставить Kog перед величезним викликом, щоб виконати свою обіцянку «30-кратного прискорення інтерпретації LLM». Його демонстрація показала вражаючі 3000 токенів за запит на секунду (TPS), але з використанням спеціалізованої невеликої моделі лише з приблизно 2 мільярдами параметрів — тепер відкритого вихідного коду Laneformer 2B.

Всупереч скептикам, Delalleau впевнений, що такий самий підхід може так само добре працювати з LLM, розмір яких може бути викликом для чіпів інтерпретації. «GPU мають світле майбутнє», — сказав він. Для генерального директора Kog ідея про те, що вони не підходять для декодування, стала хибним уявленням; новіші GPU мають все більшу пропускну здатність пам’яті, яку лише потрібно розкрити.

Kog не самотній у думці, що оптимізація програмного забезпечення може допомогти GPU робити більше, ніж заявлено. ZML, також з Франції, випустив апаратний незалежний програмний забезпеч, який обходить Nvidia CUDA для підтримки швидкої інтерпретації на конкуруючих чіпах. Але Delalleau сказав, що Kog більше схожий на лабораторію Hazy Research Стенфордського університету, з ще глибшим фокусом на прискорення GPU.

Сам Delalleau не є дослідником, і його перший стартап, Stribe, учасник TechCrunch50 2009, не має нічого спільного з його новим, окрім його колишнього співзасновника, який став венчурним капіталістом, Kamel Zeroual, чия фірма Varsity VC спільно очолила початковий раунд фінансування Kog. Але глибокий фокус стартапу походить від його унікального досвіду.

Вивчивши фізику твердого тіла у французькій École Polytechnique, він згодом працював у сфері наступальної кібербезпеки, також відомої як “білий хакінг”. За словами Delalleau, це сформувало мислення, яке він зараз заохочує дотримуватися своєї команди. З наукової точки зору, «існує такий спосіб мислення, як розуміння законів фізики та законів GPU, щоб отримати від них максимальну користь».

Щодо хакінгу, чотириразовий фіналіст турніру CTF DEFCON сказав, що це навчило його «реверс-інжинірингу речей на дуже низькому рівні — аж до мови асемблера та бінарного коду — щоб зрозуміти, як це працює, і спробувати використати це для досягнення мети, для якої воно не обов’язково було розроблене».

Недоліком цього підходу є те, що він дуже трудомісткий і займає багато часу. «Для кожного нового GPU ми будемо присвячувати кілька тижнів або навіть місяців, щоб дійсно заглибитися в деталі та провести дослідження GPU-інжинірингу на цьому обладнанні». З командою з 11 осіб це обмежує кількість чіпів, з якими Kog може працювати, принаймні в осяжному майбутньому.

У довгостроковій перспективі Kog сподівається інтегрувати свою методологію в агентно-орієнтовані конвеєри, які дозволять йому підтримувати більше чіпів та моделей. Оскільки Європа прагне створити власні можливості в цих двох напрямках, це може надати стартапу переваг суверенітету, який вже підтримується Scaleway та отримав фінансування від Bpifrance (Франція) та програми French Tech 2030.

Однак наразі Kog повинен довести світу, що його підхід працює з LLM. Це також буде ключовим для залучення додаткового фінансування. «Як тільки ми реалізуємо нашу першу велику модель з 10-кратним прискоренням, що, на мою думку, станеться у вересні, ми зможемо почати демонструвати залученість клієнтів і звідти починати раунд А», — сказав Delalleau.

Коли ви здійснюєте покупку за посиланнями в наших статтях, ми можемо отримувати невелику комісію. Це не впливає на нашу редакційну незалежність.

Дізнатися більше на: techcrunch.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *