20 хвилин із генеральним директором ElevenLabs, яку, за повідомленнями, тепер оцінюють у $22 млрд
ElevenLabs створює голосовий рівень ШІ — моделі, які перетворюють текст на мовлення, що звучить по-людськи. Більшість людей стикаються з ним, коли спілкуються зі службою підтримки, часто навіть не усвідомлюючи цього. Наприклад, Klarna використовує його для роботи телефонної підтримки першої лінії для 35 мільйонів клієнтів у США. Так само роблять Deutsche Telekom, Cisco, Adobe та дедалі більше урядів. ElevenLabs також продає свої рішення творцям контенту, які використовують її платформу для аудіокниг, дубляжу та музики.
Компанія не єдина, що працює в цій сфері. Ба більше, вона дедалі частіше стикається зі своїми клієнтами, зокрема з Decagon — платформою розмовного ШІ, яка навчила свій голосовий продукт на основі ElevenLabs, а тепер конкурує з нею. Але, схоже, інвесторів це не надто непокоїть. Компанія заявляє, що рухається до $600 мільйонів щорічного регулярного доходу, а тепер, за повідомленнями, її інвестори оцінюють $22 мільярди, хоча їй лише чотири роки.
Щоб дізнатися більше, я поговорив зі співзасновником і генеральним директором ElevenLabs Маті Станішевським на Nrth у Торонто — місцевій конференції для підприємців, яка раніше називалася Elevate. За короткий час ми обговорили цілу низку тем, зокрема те, чи повинні компанії повідомляти клієнтам, що ті розмовляють із ШІ (він вважає, що повинні), а також те, чи може він розповісти про валову маржу компанії. Не дивно, що Станішевський сказав, що не може обговорювати її детально, але чітко дав зрозуміти: він не проти подальшого скорочення маржі, якщо це означатиме розширення частки компанії на ринку.
Нижче наведено нашу розмову в скороченому й дещо відредагованому вигляді. Повний запис розмови можна переглянути тут.
Минулого року ви приєдналися до нас на TechCrunch Disrupt, де сказали, що аудіомоделі стануть стандартизованим товаром протягом кількох років. Як би ви оцінили цей прогноз зараз?
Попереду ще багато роботи, і різниця в якості, якої можна досягти лише на рівні моделі, усе ще значна. Якщо дивитися на довшу перспективу — ймовірно, через три-п’ять років — ці відмінності будуть меншими. Ми хотіли б, і хотіли б бути першими, хто це зробить, пройти тест Тюрінга для розмовного ШІ. Потрібно поєднати інтелект, але також необхідний емоційний інтелект. Потрібно розуміти емоції співрозмовника, уміти сповільнитися або говорити голосніше. Цього ще ніхто не зробив.
Яку частку бізнесу тепер становлять корпоративні клієнти?
Тепер наш ARR становить $600 мільйонів. Понад 55% — це класичний корпоративний сегмент, а значну частину решти 45% становлять малі та середні підприємства, розробники, творці продуктів і контенту.
Як і всі інші в галузі ШІ, ви дедалі більше конкуруєте зі своїми клієнтами. Decagon навчила свій голосовий продукт на ваших даних, а тепер обробляє запити через власні моделі.
Межі стають дедалі розмитішими. Якщо говорити про компанії, що створюють моделі, платформи та застосунки, раніше між ними існувало чітке розмежування: де одна починається і де закінчується. Сьогодні ця межа набагато менш чітка. У випадку Anthropic те, що колись було компанією, яка створює моделі, безперечно стало платформою й дедалі більше перетворюється на широкий набір застосунків. Думаю, ця тенденція триватиме.
Ваші клієнти можуть обирати «рівень міркування» з меню варіантів у ElevenLabs. Що ви спостерігаєте щодо використання моделей передових лабораторій порівняно з моделями з відкритими вагами?
Це не зовсім бінарний вибір. У сфері клієнтського досвіду, якщо ви телефонуєте лише для отримання інформації й не виконуєте жодних дій, можна використовувати багато моделей із відкритим кодом, адже саме ваша база знань визначає, яким має бути якісний досвід. Але якщо йдеться про фінансові послуги, потрібно пройти автентифікацію, отримати інформацію про транзакцію або, можливо, оформити повернення коштів. Тут немає місця для помилок. У таких випадках передові моделі все ще лідирують.
Деякі з цих моделей із відкритими вагами є китайськими. Клієнтом є уряд США. Клієнтами є європейські уряди. Якими є ці розмови?
Вони різні. У кожному випадку розгортання моделі й голоси, які ми використовуємо, залежать від конкретного завдання. Якщо ми працюємо з урядом Польщі або урядом Бразилії, у них є власний набір вимог. Це може бути модель із відкритими вагами, модель із закритим кодом або їхня власна донавчена модель. [У Польщі] йдеться про медичний кейс. Пацієнти записуються на прийом у державній системі охорони здоров’я, але 18% із них ніколи не приходять. Розгорнуте рішення — це агенти, які телефонують і нагадують про запис. У них був набір моделей, оптимізованих під їхню базу знань, а ми інтегруємося з ними, зберігаючи локалізацію даних.
Чи повинні компанії повідомляти, коли людина розмовляє з агентом, а не з людиною?
Я вважаю, що зараз про це потрібно повідомляти. Наразі люди до цього не звикли, і поширена практика полягає в тому, що ви не хочете відчувати себе обманутим під час такого дзвінка. Але через п’ять років, коли кожен матиме власного агента, який працюватиме від його імені, ви телефонуватимете й очікуватимете, що вам відповість агент. Тоді, думаю, суспільство змінить своє ставлення. Є хороші способи це зробити: якщо на людину потрібно чекати 30 хвилин, запропонуйте клієнту вибір. Майже в усіх випадках вони обирають агента, а потім дивуються, наскільки якісним є цей досвід.
Яка у вас валова маржа, зважаючи на витрати на моделі та інференс?
Я дам розпливчасту відповідь. Оскільки в нас є дослідницька складова, ми можемо дуже розумно донавчати й обмежувати моделі. Але якщо ми можемо передати клієнту будь-яку економію, ми це робимо. Найважливіше — і далі доводити цінність і бути поруч із клієнтом. Тож якщо ми можемо інвестувати й довести цю цінність, ми не проти зниження маржі, аби разом отримувати вигоду в міру створення цінності протягом наступних п’яти років.
У вас є мільйони годин записів дзвінків до служб підтримки. Ви навчаєтеся на них? Яка частка ваших навчальних даних є синтетичною?
У випадку з деякими компаніями ми створювали моделі разом. Їм була потрібна конкретна модель для їхнього сценарію використання. В інших випадках основна частина навчання залежала не стільки від обсягу даних, скільки від їхнього анотування. У нас тисячі людей працюють за контрактом і допомагають анотувати не лише те, що було сказано, а й те, коли люди говорили, як саме вони це говорили та які емоції використовували. Нам довелося залучити викладачів техніки мовлення, щоб точно розпізнавати акценти.
Повідомлялося, що ви розглядаєте 2028 рік для IPO. Можете це підтвердити?
Ми хотіли б створити компанію, яка витримає випробування часом. Ми готуємо фундамент, щоб мати змогу зробити це в найближчі роки. Але чи проведемо ми IPO, залежатиме від часу й обставин.
«Роки» — це дуже розпливчасто.
[Сміється.]
За лаштунками: Яка ваша позиція щодо того, чи повинні передові лабораторії сповільнити роботу?
Усі погоджуються, що потрібно спільно знайти спосіб регулювати темп. Чи повинні вони публічно про це говорити, і наскільки це має стосуватися обговорень у медіа або регулювання — це вже інше питання. Але так, під час розгортання технології ми всі повинні вживати належних запобіжних заходів. Ми не навчаємо текстові моделі та інтелектуальну складову моделей, яка є ключовою частиною цієї дискусії.
Чи може ElevenLabs опинитися в такій самій ситуації, як Hugging Face?
Ми перебуваємо на крок далі, оскільки не розгортаємо самовідтворювані або рекурентні компоненти інтелекту агентів. Наша технологія не дає змоги агентам створювати інших агентів. Кожен клієнт проходить процедуру KYC. Ризик кібербезпеки безумовно становить загрозу для всього світу, але ми запровадили хороший набір запобіжних заходів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.