
Ринок моделей голосу, згенерованих ШІ, величезний. Творчі сценарії використання потребують більш виразних моделей голосу зі штучним інтелектом, тоді як підприємства, які прагнуть автоматизувати підтримку клієнтів та операцій з продажу, потребують більш керованих.
Компанія Fish Audio з Пало-Альто прагне задовольнити всі ці сценарії використання завдяки своїй бібліотеці з понад 15 000 елементів керування природною мовою. З моменту запуску минулого року стартап вже має понад 8 мільйонів користувачів відкритих або хостингових версій своїх моделей і генерує річний регулярний дохід у розмірі 21 мільйона доларів.
Щоб продовжувати розвивати цей успіх, стартап оголосив про залучення 50 мільйонів доларів у рамках початкового раунду фінансування, який очолили Coreline Ventures та Capital Today. У фінансуванні також взяли участь 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners та HF0.
Fish Audio розпочала свою діяльність як невеликий проєкт колишнього дослідника NVIDIA Шіцзя Ляо. Розчарований не виразними синтетичними голосами, доступними на ринку, він навчив модель генерації голосу на одному GPU, яку він виклав у відкритий доступ. Репозиторій Fish Speech на GitHub зараз має понад 31 000 зірок і використовується незалежними розробниками, дизайнерами відеоігор та творцями контенту.
За останній рік компанія випустила п’ять моделей: чотири моделі генерації мовлення та одну модель перетворення мовлення в текст. Вона випустила у відкритий доступ три свої моделі генерації мовлення, але її найновіша модель S2.1 Pro доступна лише через платний API.
Fish Audio пропонує платні місячні плани, що підходять для творців та команд, які надають доступ до певної кількості хвилин генерації, а також функцій клонування голосу. Компанія також пропонує корпоративну версію своїх API та платформи, і стверджує, що її вже використовують такі організації, як HeyGen, Sanas та Plaud.
«Кожне підприємство має різні сценарії використання та різні переваги. Наприклад, компанії, як-от HeyGen, які використовують наші голоси для живлення аватарів зі штучним інтелектом, потребують реалістичних голосів; ігровій студії потрібен виразний голос для їхніх персонажів; а компанії-розробники голосових агентів, як-от LiveKit, хочуть більш природних та низьколатентних голосів, які є достатньо виразними для дзвінків», — сказав Цао.
Одним зі способів, яким стартап побудував свою бібліотеку голосів, є прохання до користувачів надсилати власні голоси для навчання своїх моделей та компенсація їм, якщо їхні голоси будуть використані. Однак це призвело до деяких проблем кілька місяців тому, коли деякі творці стверджували, що їхні голоси були завантажені до Fish Audio без їхньої згоди. Стартап мав процес видалення контенту відповідно до DMCA для вирішення таких проблем, але саме видалення займало багато часу.
Генеральний директор та співзасновник Fish Audio Рісса Цао повідомила TechCrunch, що компанія тепер автоматизувала процес видалення. Творці можуть легко надати коротку голосову вибірку або договір, щоб довести, що завантажений голос належить їм, і їхній голос буде видалено з платформи стартапу менш ніж за 3 хвилини, сказала вона.
Проте це не заважає будь-кому завантажувати голос артиста без його відома. І доки артист не дізнається, його голос продовжуватиме використовуватися на платформі, доки він не подасть запит на його видалення.
Оскюе Хонда, партнер Coreline Ventures, зазначив, що модель, керована спільнотою, працює лише тоді, коли творці довіряють платформі.
«Підхід, орієнтований на спільноту, може стати стійкою перевагою лише тоді, коли творці довіряють платформі. Це означає, що згода, прозорість та зазначення авторства мають бути вбудовані в продукт, а не розглядатися як другорядні. Я вважаю, що галузь повинна рухатися до перевіреного володіння голосом, чітких умов ліцензування, простих процесів звітності та видалення, і, зрештою, до моделей розподілу доходу, де творці отримують фінансову вигоду, коли їхні голоси ліцензуються або використовуються комерційно», — сказав він.
Цао зазначила, що коли стартап пропонував свій продукт лише як відкритий проєкт із планами для творців, він працював ефективно і не потребував грошей. Але компанія хотіла розробляти більш досконалі моделі, а також задовольнити потреби підприємств, оскільки інтерес інвесторів зростав, що змусило її шукати капітал.
Дивлячись у майбутнє, Fish Audio планує випустити цього року модель розуміння аудіо. Компанія також створює модель перетворення мовлення в мовлення.
Ринок генерації мовлення є конкурентним, з такими компаніями, як ElevenLabs, WellSaid, Cartesia, Speechify, Async (раніше Podcastle) та Krisp, які конкурують за гаманці творців та підприємств.
За словами Ріко Маллоцці, партнера 359 Capital, деталізовані елементи керування для розробників та ефективне навчання моделей допоможуть Fish Audio краще конкурувати з великими AI-лабораторіями.
«Я думаю, що те, що їм вдалося побудувати, — це найсучасніші моделі, з командою, яку вони мають, порівняно з деякими з цих інших добре фінансованих AI-лабораторій чи компаній, — це неймовірно. Це свідчить про їхню технічну майстерність у скороченні розриву між штучно звучачими та схожими на людські голосами», — сказав Маллоцці TechCrunch під час телефонної розмови.
Коли ви купуєте за посиланнями в наших статтях, ми можемо отримати невелику комісію. Це не впливає на нашу редакційну незалежність.
Джерело новини: techcrunch.com
