ШІ-моделі працюють усюди: ентузіаст запустив LLM на мікроконтролері за $10

У 2026 році великі мовні моделі можна буде запускати локально на ноутбуках і навіть смартфонах. Ентузіаст під псевдонімом SlvDev запустив невелику мовну модель локально на мікроконтролері ESP32-S3 за $10 і досяг швидкості роботи майже 10 токенів за секунду.

 Джерело зображення: Igor Omilaev / unsplash.com

Джерело зображення: Igor Omilaev / unsplash.com

Мікроконтролер ESP32-S3 має 520 КБ SRAM і 8 МБ псевдо-SRAM (PSRAM). Він призначений для керування віддаленими датчиками пристроїв інтернету речей та іншим обладнанням — модель класу DeepSeek V4 Flash на ньому запустити не вдасться. Натомість ентузіаст обрав систему, яка в 10 000 разів компактніша — розроблену Microsoft Research модель TinyStories з 28,9 млн параметрів.

У вихідному вигляді і вона виявилася занадто об’ємною для ESP32-S3: при 16-бітній точності їй потрібно близько 60 МБ простору, якого на мікроконтролері просто немає. Тому на початковому етапі автор проєкту провів квантування — стиснув ваги моделі з 16 до 8, а потім і до 4 бітів. В результаті модель стала займати 14,9 МБ, і для її встановлення довелося придбати варіант мікроконтролера з флеш-пам’яттю на 16 МБ.

Далі ентузіаст провів ще одну операцію — реалізував механізм пошарового вбудовування (Per-layer embedding — PLE), який використовується в архітектурі відкритих моделей Google Gemma. В результаті значну частину ваг моделі, або 25 млн параметрів розміром 12 МБ, він переніс у флеш-пам’ять, звернення до якої будуть відбуватися відносно нечасто, а в оперативну пам’ять контролера помістив лише 2 МБ даних. В результаті вхідні заголовки та кеш ключ-значення (KV) опинилися в PSRAM, а для активації вистачило 520 КБ на SRAM. Завдяки цим заходам вдалося отримати генерацію зі швидкістю 9,88 токенів за секунду — швидше, ніж може читати середньостатистична людина.

Модель Tiny Stories стала чудовим прикладом для демонстрації концепції, але вона лише генерує короткі історії, і цього недостатньо навіть для запуску чат-бота. Існує також модель Barista схожого розміру, яка вже вміє відповідати на запитання, причому генерує токени вдвічі швидше, але тільки на теми, пов’язані з еспресо. Обидві моделі занадто малі, щоб робити щось ще, але сам факт їх роботи на ESP32 вже вражає.

Джерело новини: 3dnews.ru

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *