20 минути с изпълнителния директор на ElevenLabs, чиято оценка според съобщенията вече е 22 млрд. долара
ElevenLabs изгражда гласовия слой на изкуствения интелект — моделите, които превръщат текста в реч, звучаща като човешка. Повечето хора се сблъскват с него, когато разговарят със служители за обслужване на клиенти — често без да го осъзнават. Например Klarna използва технологията за първа линия телефонна поддръжка на 35 милиона клиенти в САЩ. Същото правят Deutsche Telekom, Cisco, Adobe и все по-голям брой правителства. ElevenLabs продава и на създатели на съдържание, които използват платформата му за аудиокниги, дублаж и музика.
Компанията не е единствената, която прави това. Всъщност тя все по-често се сблъсква с клиенти, сред които е Decagon — платформа за разговорен изкуствен интелект, която е обучила гласовия си продукт с ElevenLabs и сега се конкурира с нея. Инвеститорите ѝ обаче изглежда не са особено притеснени. Компанията, която твърди, че се движи към 600 милиона долара годишни периодични приходи, сега според съобщенията е оценена от подкрепящите я инвеститори на 22 милиарда долара, въпреки че е едва на четири години.
За да науча повече, интервюирах съоснователя и главен изпълнителен директор на ElevenLabs Мати Станишевски в Nrth в Торонто — местна конференция за предприемачество, известна преди като Elevate. За кратко време обсъдихме редица теми, включително дали компаниите трябва да казват на клиентите, когато разговарят с изкуствен интелект (той смята, че трябва), както и дали може да говори за брутните маржове на компанията. Не е изненадващо, че Станишевски каза, че не може да ги обсъжда подробно, но беше категоричен, че няма нищо против те да се свият още повече, ако това означава разширяване на пазарния дял на компанията.
Следва разговорът ни, съкратен и леко редактиран. Можете да видите пълния разговор тук.
Миналата година се присъединихте към нас на TechCrunch Disrupt, където казахте, че аудиомоделите ще бъдат превърнати в стока в рамките на няколко години. Как бихте оценили тази прогноза сега?
Все още има много работа за вършене, а разликата в качеството, която можете да постигнете само на ниво модел, все още е значителна. Ако мислим в по-дългосрочен план, вероятно след три или пет години тези разлики ще са по-малки. Това, което бихме искали да направим — и да сме първите, които го правят — е да издържим теста на Тюринг за разговорен изкуствен интелект. Трябва да съчетаете интелигентност, но също така и емоционална интелигентност. Трябва да разбирате емоциите на отсрещната страна, за да можете да забавите темпото или да говорите по-силно. Това все още не е постигнато.
Какъв процент от бизнеса ви вече е корпоративен?
Сега имаме 600 милиона долара годишни периодични приходи. Над 55% са класически корпоративни клиенти, а голяма част от останалите 45% са малки и средни предприятия, разработчици, създатели и строители.
Както всички останали в сферата на изкуствения интелект, вие все повече се конкурирате със собствените си клиенти. Decagon е обучила гласовия си продукт с вас, а сега обработва заявките чрез собствените си модели.
Границите стават все по-размити. Когато мислим за компании за модели, платформени компании и компании за приложения, в миналото разделението е било много ясно — къде започва едното и свършва другото. Днес тази граница е много по-размита. В случая с Anthropic това, което беше компания за модели, определено е платформа и все повече се превръща в широк набор от приложения. Смятам, че тази тенденция ще продължи.
Вашите клиенти могат да избират „слоя за разсъждение“ от меню с опции в ElevenLabs. Какво наблюдавате по отношение на използването на модели от водещи лаборатории спрямо модели с отворени тегла?
Това не е толкова двоичен избор. При обслужването на клиенти, ако се обаждате и въпросът е само информационен — не извършвате никакви действия — можете да използвате много от моделите с отворен код, защото именно базата ви от знания определя как изглежда доброто обслужване. Но ако става дума за финансови услуги, искате да бъдете удостоверени, искате информация за транзакция, може би за възстановяване на сума. Няма място за грешки. В такива случаи водещите модели все още имат предимство.
Някои от тези модели с отворени тегла са китайски. Правителството на САЩ е клиент. Европейски правителства са клиенти. Как протичат тези разговори?
Различно. При всяко внедряване моделите и гласовете, които използваме, зависят от конкретния случай. Ако работим с полското или бразилското правителство, те имат свой набор от изисквания. Може да става дума за модел с отворени тегла, модел със затворен код или собствен, допълнително обучен модел. [В Полша] става въпрос за здравеопазване. Пациенти записват часове в системата на общественото здравеопазване, но 18% никога не се явяват. Внедреното решение представлява агенти, които се обаждат и ви напомнят. Те разполагаха с набор от модели, оптимизирани спрямо техните знания, а ние се интегрираме, като същевременно запазваме локализацията на данните.
Трябва ли компаниите да разкриват, когато човек разговаря с агент, а не с човек?
Смятам, че на този етап трябва да има такова разкриване. В момента хората не са свикнали с това, а обичайният модел е, че не искате да се чувствате измамени по време на разговора. Но след пет години, когато всеки ще има собствен агент, който ще действа от негово име, ще се обаждате и ще очаквате агент. Тогава смятам, че като общество ще променим нагласата си. Има добри начини това да се направи — ако чакането за човек е 30 минути, предложете на клиента избор. В почти всички случаи той избира агента, а след това е изненадан колко добро е преживяването.
Какви са брутните ви маржове предвид сумите, които плащате за модели и инференция?
Ще дам уклончив отговор. Тъй като имаме изследователски елемент, можем да дообучаваме и ограничаваме моделите по изключително интелигентни начини. Но ако можем да прехвърлим спестяванията към клиента, го правим. Най-важното все още е да докажем стойността и да бъдем до клиента. Така че, ако можем да инвестираме и да докажем тази стойност, нямаме нищо против маржовете да се понижат, за да извлечем реална обща полза с разгръщането на стойността през следващите пет години.
Разполагате с милиони часове разговори за обслужване на клиенти. Обучавате ли моделите си с тях? Каква част от тренировъчните ви данни е синтетична?
При някои компании създадохме моделите заедно. Те искаха конкретен модел за своята употреба. Иначе голямата част от обучението не беше толкова свързана с обема на данните, колкото с анотирането им. Имаме хиляди хора, работещи на договор, които ни помагат да анотираме не само какво е било казано, но и кога са говорили хората, как са го казали и какви емоции са били използвани. Наложи се да привлечем вокални треньори, за да можем да разпознаваме акцентите точно.
Съобщава се, че разглеждате 2028 г. като момент за първично публично предлагане. Можете ли да потвърдите това?
Бихме искали да създадем компания, която да издържи изпитанието на времето. Подготвяме основите, за да можем да го направим през следващите години. Но дали ще го направим, ще зависи от времето и мястото.
„Години“ е много неясно.
[Смее се.]
Зад кулисите: Какво е мнението ви по въпроса дали водещите лаборатории трябва да забавят темпото?
Всички са единни, че трябва да работят заедно, за да намерят начин да регулират темпото. Дали трябва да говорят публично за това и доколко то трябва да бъде част от медийния разговор или регулацията — това е друга тема. Но да, всички трябва да вземем необходимите предпазни мерки, докато внедряваме технологията. Ние не обучаваме текстовите модели и моделите за интелигентност — основния елемент в този дебат.
Възможно ли е ElevenLabs да се окаже уязвима по начина, по който беше Hugging Face?
Ние сме една стъпка напред, защото не внедряваме самовъзпроизвеждащи се или рекурентни компоненти на интелигентността на агентите. Технологията ни не позволява на агентите да създават други агенти. Всеки клиент преминава през KYC. Рискът за киберсигурността определено е риск за света като цяло, но сме въвели добър набор от предпазни мерки.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.