ByteDance тренує модель ШІ, яка може наблизитися до розміру найсучаснішої системи Mythos від Anthropic, оскільки китайські компанії продовжують скорочувати розрив із провідними американськими лабораторіями.
Китайський технологічний гігант перебуває на ранній стадії тренування моделі з кількістю параметрів до 10 трильйонів — це втричі більше, ніж Kimi K3 від Moonshot, найбільша китайська модель, випущена дотепер, повідомляє три обізнані особи.
Модель ByteDance проходить попереднє тренування — етап, який зазвичай триває від трьох до шести місяців — перед тим, як буде доопрацьована та випущена, якщо все піде добре, зазначила одна з осіб. Точний розмір моделі буде визначено на пізнішому етапі.
Anthropic не розкриває розмір своїх моделей, але, за оцінками галузі, її найсучасніша Mythos 5 має близько 8 трильйонів параметрів, а Fable 5 — близько 5 трильйонів. Хоча кількість параметрів визначає фундаментальну потужність або межі пам’яті для моделей зі зберігання інформації, фактичні можливості також залежать від інших факторів, таких як якість даних та методи тренування.
Зусилля ByteDance з тренування однієї з найбільших у світі моделей ШІ демонструють амбіції китайських лабораторій не тільки наздогнати, але й перевершити своїх американських колег у найсучасніших напрямках ШІ.
Лише за останні тижні китайські моделі від Moonshot та Alibaba демонструють високу продуктивність за тестами, відстаючи лише від Fable 5 від Anthropic у певних аспектах. Mythos 5, найсучасніша модель Anthropic, доступна лише для схвалених організацій після тимчасової заборони у червні через проблеми з безпекою.
Інсайдери галузі зазначають, що кілька китайських лабораторій тренують моделі розміром з Fable 5, тоді як ByteDance наразі є найамбітнішою у прагненні створити найбільшу модель.
ByteDance, материнська компанія популярної відеоплатформи TikTok, зберігає низький профіль у розробці ШІ, оскільки її моделі переважно закриті, на відміну від багатьох китайських конкурентів. Її остання модель SeeDance посідає одне з найвищих місць у світі за генерацією відео, а флагманська модель для споживачів Doubao є найпопулярнішою в Китаї з 324 мільйонами активних користувачів на місяць.
За останні три роки ByteDance інвестувала в ШІ агресивніше, ніж будь-хто з інших китайських технологічних гігантів, розширюючи свою мережу дата-центрів та наймаючи дослідників. Компанія посилила свою хмарну одиницю Volcano Engine, яка продає ШІ-рішення підприємствам. ByteDance також має наміри розробляти власні ШІ-чіпи.
Seed, команда розробки моделей під керівництвом колишнього науковця Google DeepMind Ву Юнхуея, налічує близько 2000 членів у Китаї та за кордоном. Команда включає ключових дослідників, інженерів інфраструктури, команду розмітки даних та перекладачів.
Розробка моделей також реалізує більш незалежний підхід, який не передбачає «дистиляції» існуючих моделей від інших лабораторій, за словами однієї з осіб. Цей підхід застосовується понад рік, що, на думку деяких, призвело до повільнішого розвитку порівняно з конкурентами.
Дистиляція моделі — це процес стиснення великої, складної ШІ-моделі в меншу, швидшу, шляхом навчання меншої моделі копіювати знання та результати роботи більшої моделі-«вчителя».
Керівництво ByteDance, очолюване засновником Чжан Їмінгом, вважає, що лише самостійна розробка може призвести до створення моделі, яка перевершить конкурентів.
Чжан підтвердив свою позицію на внутрішній нараді два тижні тому, де він доручив команді Seed націлюватися на «світові можливості моделей» у довгостроковій перспективі, не надто турбуючись про відставання в найближчому майбутньому, за словами співрозмовника.
Китайські медіа Latepost та The Information першими повідомили про коментарі Чжана з нещодавньої внутрішньої наради.
ByteDance не відповіла на запит про коментар.
Дізнатися більше на: arstechnica.com
