Google представила SL2T: модель ШІ, яка розуміє мову жестів

Підрозділ Google DeepMind оголосив про намір зробити революцію у сфері штучного інтелекту доступною для 70 мільйонів людей у всьому світі, які спілкуються мовами жестів. Нова модель SL2T перетворює ці мови на текст.

Джерело зображення: deepmind.google

Google SL2T — це багатомовна модель-перекладач, яка дебютує на смартфонах Pixel 11, дозволяючи перетворювати мову жестів на текст через додатки Gboard та Live Transcribe. На початковому етапі її застосування обмежується американською мовою жестів та її перекладом на англійську. Здатність ШІ обробляти людську мову значно просунулася за останні роки — зараз можна просто диктувати текст на смартфон, планшет або ПК. Але до цього моменту це не стосувалося тих, хто користується однією з понад 200 існуючих мов жестів.

Модель SL2T дозволяє людям із вадами слуху взаємодіяти зі смартфоном, використовуючи звичну мову і не вводячи текст вручну. У такому форматі тепер можна надсилати пошукові запити, складати електронні листи та повідомлення для месенджерів, редагувати документи та виконувати інші завдання, зокрема надсилати запити та інструкції для ШІ-помічника Gemini. Модель доступна в Google Live Transcribe, тобто переклад з мови жестів можна здійснювати в реальному часі під час відеодзвінків.

Google навчала SL2T на понад 100 тисячах годин даних 50 жестових мов, чверть із цього набору припадає на американську. Первісний варіант підтримує лише американську, але Google проводила навчання і на прикладах інших, щоб модель могла вивчити загальні закономірності. Щоб розвіяти побоювання щодо конфіденційності, в Google уточнили, що в SL2T використовується вбудована модель комп’ютерного зору MediaPipe Holistic, яка відстежує геометрію положень обличчя, рук, тулуба та тіла людини — на хмарний сервер надсилаються для розшифровки тільки їхні координати, а не відеозапис.

Модель здійснює перетворення безпосередньо на текст, оминаючи проміжні текстові анотації. Це дозволяє SL2T ефективніше інтерпретувати невербальні вирази та просторові граматичні структури, характерні для американської мови жестів. Google також вжила заходів для скорочення затримки, запобігання “галюцинацій” (невірних інтерпретацій), передбачила підтримку лівшів та правшів, а також користувачів, які “говорять” лише однією рукою — щоб другою можна було тримати смартфон. Важливою відмінністю SL2T від попередніх моделей аналогічного призначення є її здатність відстежувати не тільки руки, але й рух голови, обличчя та тулуба, які також допомагають передавати зміст. У перспективі Google має намір охопити інші мови жестів, а також розробити моделі для генерації контенту безпосередньо цими мовами.

За матеріалами: 3dnews.ru

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *