OpenAI та Google вкладають значні кошти у голосові системи, які прагнуть зробити основним способом взаємодії людини з агентами штучного інтелекту нового покоління, пише Financial Times.

Джерело зображення: Marwan Ahmed / unsplash.com
OpenAI та Google доклали значних зусиль, щоб ШІ звучав не як робот, що читає з екрана, а як колега, здатний розуміти запити та контекст. Нові функції користуються попитом у споживачів та бізнесу — їх реалізація допомогла здійснити прорив порівняно з традиційними голосовими помічниками, які перетворювали мову на текст, генерували текстову відповідь, а потім зачитували її вголос. Нові моделі обробляють і відтворюють мову безпосередньо, затримки скорочуються, тон звучить природно, контекст розмови не втрачається.
Розробники роблять ставку на те, що в міру переходу систем ШІ від відповідей на запитання до виконання тривалих завдань, спілкування з ними ставатиме природнішим, ніж введення запитів у вікно чат-бота. Позначаються й слабкі місця нового формату: затримки, фоновий шум і психологічний дискомфорт під час спілкування з машиною в громадських місцях. Користувачі ШІ-сервісів Google з початку року стали вдвічі частіше користуватися голосовим інтерфейсом, і розмови тривають у середньому вп’ятеро довше, ніж текстові переписки. У OpenAI ChatGPT голосовим форматом щотижня користуються понад 150 млн осіб. І навіть інженери Microsoft стали використовувати голосовий інтерфейс для керування завданнями програмування з ШІ на GitHub.
Про зручність голосового інтерфейсу у вирішенні завдань програмування говорять і в OpenAI. «Коли я друкую, то часто відразу переходжу до вирішення завдання голосом. Коли я говорю, я більш схильний пояснювати, чого хочу досягти насправді, якими є мої наміри, які обмеження мають значення, в чому я не впевнений, і як виглядатиме добрий результат», — розповів співробітник OpenAI Сандро Джанелла (Sandro Gianella).
Тенденцію вже підхопили стартапи Кремнієвої долини. Вони почали інвестувати в нові моделі мікрофонів і рішення в галузі звукоізоляції офісів, щоб захистити ШІ від фонового шуму. З’являються пристрої нового покоління, і навіть OpenAI готує гаджет з голосовим помічником — він матиме камеру, мікрофон і динамік. У Нью-Йорку стартап Sandbar розробив розумне кільце, яке дозволяє віддавати команди або ставити завдання ШІ, і реагує воно лише на голос власника.
Інформація підготовлена на основі матеріалів: 3dnews.ru
