Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

20 минут с генеральным директором ElevenLabs, которую, как сообщается, теперь оценивают в $22 млрд

ElevenLabs создает голосовой слой ИИ — модели, которые превращают текст в речь, звучащую по-человечески. Большинство людей сталкиваются с этой технологией, разговаривая со службой поддержки, часто даже не понимая этого. Например, Klarna использует ее для работы первой линии телефонной поддержки 35 миллионов клиентов в США. То же делают Deutsche Telekom, Cisco, Adobe и постоянно растущий список правительств. ElevenLabs также продает свои решения создателям контента, которые используют платформу для аудиокниг, дубляжа и музыки.

Компания не единственная в этой сфере. Более того, она все чаще сталкивается с собственными клиентами, включая Decagon — платформу разговорного ИИ, которая обучила свой голосовой продукт на основе ElevenLabs, а теперь конкурирует с ней. Однако инвесторов, похоже, это не слишком беспокоит. Компания заявляет, что ее годовой регулярный доход достигнет $600 миллионов, а теперь, по сообщениям, ее инвесторы оценивают ElevenLabs в $22 миллиарда, несмотря на то, что компании всего четыре года.

Чтобы узнать больше, я поговорил с сооснователем и генеральным директором ElevenLabs Мати Станишевским на конференции Nrth в Торонто — местном мероприятии для предпринимателей, ранее известном как Elevate. За короткое время мы обсудили широкий круг тем, в том числе вопрос о том, должны ли компании сообщать клиентам, что те разговаривают с ИИ (он считает, что должны), а также вопрос о валовой марже компании. Неудивительно, что Станишевский сказал, что не может подробно обсуждать этот показатель, однако ясно дал понять: он не возражает против дальнейшего снижения маржи, если это поможет компании расширить долю рынка.

Ниже приводится наша беседа в сокращенном и слегка отредактированном виде. Полную версию разговора можно посмотреть здесь.

В прошлом году вы выступали у нас на TechCrunch Disrupt и сказали, что аудиомодели станут стандартизированным товаром в течение пары лет. Как бы вы оценили этот прогноз сейчас?

Нам еще многое предстоит сделать, и разница в качестве, которой можно добиться только на уровне модели, по-прежнему значительна. Если смотреть на более долгосрочную перспективу — вероятно, через три или пять лет, — эти различия станут меньше. Мы хотели бы сделать то, чего пока никто не делал, и первыми пройти тест Тьюринга для разговорного ИИ. Нужно объединить интеллект, но также необходим эмоциональный интеллект. Нужно понимать эмоции собеседника, уметь замедлить темп речи или, наоборот, говорить громче. Пока этого не удалось достичь.

Какую долю бизнеса сейчас занимает корпоративный сегмент?

Сейчас наш годовой регулярный доход составляет $600 миллионов. Более 55% приходится на классический корпоративный сегмент, а значительная часть оставшихся 45% — на малый и средний бизнес, разработчиков, создателей продуктов и контента.

Как и все остальные компании в сфере ИИ, вы все чаще конкурируете со своими клиентами. Decagon обучила свой голосовой продукт на ваших данных, а теперь направляет запросы через собственные модели.

Границы становятся все более размытыми. Если подумать о компаниях, создающих модели, платформах и приложениях, раньше между ними существовало четкое разделение: где начинается одно и заканчивается другое. Сегодня эта граница гораздо менее определенная. В случае Anthropic компания, которая была разработчиком моделей, определенно стала платформой и все чаще создает широкий спектр приложений. Думаю, эта тенденция продолжится.

Ваши клиенты могут выбирать «уровень рассуждений» из меню вариантов в ElevenLabs. Что вы видите с точки зрения использования моделей передовых лабораторий по сравнению с моделями с открытыми весами?

Это не столько бинарный выбор. В сфере клиентского опыта, если вы звоните по чисто информационному вопросу и никакие действия не выполняются, можно использовать множество моделей с открытым исходным кодом, поскольку именно ваша база знаний определяет, каким должен быть качественный сервис. Но если речь идет о финансовых услугах, необходимо пройти аутентификацию, получить информацию о транзакции или, возможно, оформить возврат. Здесь нет права на ошибку. В таких случаях передовые модели по-прежнему будут лидировать.

Некоторые из этих моделей с открытыми весами — китайские. Клиентом является правительство США. Клиентами являются и европейские правительства. Как проходят такие переговоры?

По-разному. В каждом случае используемые нами модели и голоса зависят от конкретной задачи. Если мы работаем с правительством Польши или Бразилии, у них есть собственный набор требований. Это может быть модель с открытыми весами, модель с закрытым исходным кодом или их собственная дообученная модель. [В Польше] речь идет о здравоохранении. Пациенты записываются на приемы в государственной системе здравоохранения, и 18% из них не приходят. В рамках решения агенты звонят пациентам и напоминают о записи. У заказчика был набор моделей, оптимизированных под его базу знаний, а мы интегрируемся с ним, сохраняя локализацию данных.

Должны ли компании сообщать, что человек разговаривает с агентом, а не с человеком?

Думаю, сейчас об этом следует сообщать. Люди еще не привыкли к такой практике, и обычно никто не хочет чувствовать себя обманутым во время звонка. Но через пять лет, когда у каждого будет собственный агент, действующий от его имени, люди будут звонить и ожидать, что ответит агент. Тогда, думаю, общественное отношение изменится. Есть хорошие способы это организовать: если до разговора с человеком нужно ждать 30 минут, можно предложить клиенту выбор. Почти во всех случаях люди выбирают агента, а затем удивляются тому, насколько хорошим оказывается такой опыт.

Какова ваша валовая маржа с учетом расходов на модели и инференс?

Я дам расплывчатый ответ. Поскольку у нас есть исследовательская составляющая, мы умеем очень умными способами дообучать модели и ограничивать их возможности. Но если мы можем передать клиенту какую-либо экономию, мы это делаем. Самое важное по-прежнему — доказать ценность продукта и быть рядом с клиентом. Поэтому, если мы можем инвестировать и доказать эту ценность, нас не беспокоит дальнейшее снижение маржи: это позволит нам вместе получать выгоду по мере создания ценности в ближайшие пять лет.

У вас есть миллионы часов разговоров со службой поддержки. Вы обучаете модели на этих данных? Какую долю обучающих данных составляют синтетические данные?

В некоторых компаниях мы создавали модели совместно с ними. Им была нужна конкретная модель для их сценария использования. В остальном ключевым фактором обучения был не столько объем данных, сколько их разметка. У нас внутри компании на контрактной основе работают тысячи людей, которые помогают размечать не только сказанное, но и то, когда люди говорили, как именно они это произносили и какие эмоции выражали. Нам пришлось привлечь специалистов по постановке голоса, чтобы точно распознавать акценты.

Сообщалось, что вы рассматриваете возможность IPO в 2028 году. Можете это подтвердить?

Мы хотели бы создать компанию, которая выдержит испытание временем. Мы готовим фундамент, который позволит сделать это в ближайшие годы. Но решение о выходе на биржу будет зависеть от времени и обстоятельств.

«Ближайшие годы» — очень расплывчато.

[Смеется.]

За кулисами: Как вы относитесь к вопросу о том, должны ли передовые лаборатории замедлить темпы?

Все согласны с тем, что нужно совместно найти способ регулировать темп развития. Должны ли они публично говорить об этом и насколько это должно быть связано с обсуждением в СМИ или регулированием — это уже другой вопрос. Но да, при внедрении технологий мы все должны принимать необходимые меры предосторожности. Мы не обучаем текстовые модели и не занимаемся интеллектуальной составляющей моделей, которая является центральной частью этих дискуссий.

Может ли ElevenLabs оказаться в таком же положении, как Hugging Face?

Мы на шаг впереди, поскольку не внедряем самовоспроизводящиеся или рекуррентные компоненты интеллекта агентов. Наша технология не позволяет агентам создавать новых агентов. Каждый клиент проходит процедуру KYC. Риск кибербезопасности, безусловно, представляет угрозу для всего мира, но у нас предусмотрен хороший набор мер предосторожности.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием TechCrunch

Читать оригинал на TechCrunch ↗

Текст и изображения принадлежат TechCrunch и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости