Microsoft представила на загальне тестування дві нові моделі штучного інтелекту власної розробки. MAI-Image-2.5-Pro є флагманським генератором зображень у лінійці компанії; MAI-Voice-2-Flash призначена для розпізнавання мовлення в умовах великих корпоративних навантажень.

Джерело зображень: microsoft.ai
Софтверний гігант навів дані щодо продуктивності обох моделей як найпереконливіший аргумент на користь того, що він може використовувати власні продукти, не покладаючись на розробки OpenAI. Зараз ШІ-моделі Microsoft працюють у великій кількості продуктів компанії: Bing, PowerPoint, OneDrive, Dynamics 365, Excel, GitHub Copilot та Azure — це вже не дослідницькі проєкти, а робоча інфраструктура, що обслуговує мільйони клієнтів. «Кожне з цих поліпшень — крок до однієї й тієї ж мети: продукти Microsoft, що працюють на основі моделей Microsoft», — підкреслили в компанії.
У кривій «якість-швидкість-вартість» дві нові моделі займають протилежні позиції, і це навмисно. MAI-Image-2.5-Pro виступає розробкою преміум-класу: вона генерує зображення високої якості, забезпечує детальне їх редагування та точне відтворення тексту. При доступі через API робота з моделлю обійдеться у 5 доларів за 1 мільйон текстових токенів на вході, 8 доларів за 1 мільйон токенів зображень на вході та 106 доларів за мільйон токенів зображень на виході. Базова MAI-Image-2.5 нещодавно посіла друге місце в рейтингу моделей для редагування зображень на платформі Arena.

MAI-Voice-2-Flash має прямо протилежне позиціонування. Вона працює вдвічі швидше, ніж базова MAI-Voice-2-Flash, і коштує на 32 % дешевше — 15 доларів за 1 мільйон знаків. Модель розроблена для ринку високопродуктивного голосового зв’язку: кол-центрів, голосових агентів та додатків для обробки мовлення в реальному часі, де важлива низька затримка. Творча студія, яка прагне до максимальної точності, має абсолютно інші потреби, ніж служба підтримки клієнтів, що обробляє мільйони дзвінків на день.
Microsoft також розповіла про успіхи у впровадженні власних моделей. Сервіс Bing Image Creator повністю переведено на MAI-Image-2.5; у PowerPoint ця модель допомогла знизити витрати на ресурси графічного процесора на 84 % порівняно з OpenAI GPT-Image-2; вона допомогла оптимізувати обробку завдань у хмарному сховищі OneDrive. Нову MAI-Voice-2-Flash розгорнули на платформі Dynamics 365 Contact Center, знизивши витрати на ресурси графічних процесорів на величину до 89%; її також інтегрували в сервіс Azure Voice Live для розробників. Сервіс Microsoft Dragon Copilot, яким користуються 170 000 медичних закладів і який за I квартал обробив 28 мільйонів звернень пацієнтів, переведено на модель MAI-Transcribe-1.5 з підтримкою 58 мов.
Полегшена модель MAI-Code-1-Flash для написання коду в червні почала працювати на платформі GitHub Copilot — порівняно з OpenAI GPT-5.4 Mini та Anthropic Claude Haiku 4.5 вона забезпечує на 10 % вище прийняття коду зі зниженим на 10 % медіанним споживанням токенів. Користувачі на 6 % частіше знову обирають її, ніж GPT-5.4 Mini, і на 11 % частіше, ніж Claude Haiku 4.5. Microsoft додатково навчила її роботі в Excel, і в більшості найпоширеніших завдань вона стала виступати на рівні GPT-5.6, хоча вона досить мала, щоб працювати на застарілих прискорювачах Nvidia H100 і навіть A100.
Інформація підготовлена на основі матеріалів: 3dnews.ru
