Новият речеви модел v4 на ElevenLabs прави AI гласовете по-изразителни и последователни
Основни моменти
- Elevenlabs пусна Eleven v4 — гласов модел, който следва по-точно указанията и запазва последователността на гласовете в дълги продукции.
- Новата версия поддържа над 90 езика, подобрява клонирането на гласове и обработва до 10 000 знака на заявка.
- Eleven v4 Turbo е насочен към гласови агенти и отговаря за 150 милисекунди, което според Elevenlabs е по-бързо от конкурентните модели.
Elevenlabs пуска Eleven v4 — нов гласов модел, който следва по-точно указанията и запазва последователността на гласовете в дълги продукции. Нова архитектура на модела захранва и варианта Turbo за гласови агенти в реално време.
Eleven v4 генерира по-надеждно смях, шепот и звуци като тряскане на врата в сравнение с предшественика си. Вариантът Turbo за гласови агенти започва да произвежда реч за около 150 милисекунди. Eleven v3, пуснат преди малко повече от година, вече поддържаше тези аудио тагове, но ги следваше по-неточно.

По-голяма последователност
Elevenlabs казва, че v4 използва нова архитектура, която анализира тона, темпото и контекста на сценария. Потребителите могат да дават указания чрез тагове или обикновени изречения и да използват фонетичен правопис, за да задават произношението на имена и технически термини. Компанията твърди, че контролите за произношение вече работят по-надеждно. Гласовете на разказвачите и персонажите би трябвало да звучат последователно в цялата продукция, дори когато потребителите генерират отделни реплики по няколко пъти.
Eleven v4 обработва до 10 000 знака на заявка — приблизително десет минути аудио. По-дългите произведения, като аудиокниги, използват множество сегменти, като се очаква темпото и изпълнението да останат последователни при преходите. В диалозите говорещите на ИИ реагират на контекста на цялата сцена, вместо да изпълняват всяка реплика изолирано.
Новата версия поддържа над 90 езика, спрямо около 70 при v3. Клонираните гласове би трябвало да говорят други езици с естествени акценти, без с течение на времето да се връщат към оригиналните си акценти. Професионалните клонирания на гласове отново работят, след като не се поддържаха във v3, а за „моментално клониране на глас“ са нужни само десет секунди аудио.
Turbo цели да направи изразителните гласови агенти по-бързи
Elevenlabs пуска и по-бърз вариант v4 за употреби в реално време, като разговори с обслужването на клиенти или персонажи в игри. Компанията твърди, че досега разработчиците на гласови агенти е трябвало да избират между скорост и изразителност, а v4 Turbo има за цел да предложи и двете.
В тестовете на Elevenlabs Turbo започва да произвежда чуваема реч за 150 милисекунди, в сравнение с 262 милисекунди за Cartesia Sonic 3.6. GPT-4o mini TTS на OpenAI се нуждае от 814 милисекунди. Elevenlabs е оптимизирала Turbo съвместно със своята платформа ElevenAgents.

Eleven v4 се класира пред Cartesia Sonic 3.6 и Gemini 3.8 Flash TTS на Google в класацията Provider Voice Arena на Artificial Analysis. Той постига 91,7 процента в бенчмарка за произношение, спрямо 85,6 процента при v3. В слепите тестове на Elevenlabs около три четвърти от слушателите предпочитат v4 пред моделите на Cartesia, Inworld и Google.

По-качествените клонирания на гласове правят v4 полезен за дублаж, като Elevenlabs насърчава възможността да се използва гласът на актьор на всички поддържани езици. Компанията лицензира гласове от хората, които стоят зад тях. Гласовите актьори могат да предложат в библиотеката на Elevenlabs подробно обучено клонирано копие на гласа си и да печелят пари, когато платени потребители го използват. Elevenlabs вече предлага достъп до гласове на знаменитости като този на Майкъл Кейн чрез специален пазар.
И двата модела стартират с временно намалени цени
Стандартната цена на API на Elevenlabs е 80 долара на милион знака за v4 и 40 долара за Turbo. До 12 октомври тези цени спадат съответно до 22 и 11 долара. Според Elevenlabs потребителите с месечен план Creator за 22 долара или по-висок могат да използват v4 в ElevenCreative без допълнително заплащане в продължение на две седмици. Използването е ограничено до два пъти размера на месечните им кредити. Artificial Analysis посочва цена от 49 долара на милион знака за Sonic 3.6 и 16,49 долара за Gemini 3.8 Flash TTS.
И двата модела вече са налични в ElevenAgents, ElevenCreative и чрез API. По подразбиране Elevenlabs съхранява данните на клиентите в САЩ, според своята документация. Клиентите от корпоративния сегмент могат да съхраняват данни в изолирани среди в ЕС, Индия или Сингапур, макар че част от обработката може да се извършва извън избрания регион. В ЕС клиентите могат да запазят обработката на API в региона, като използват режим, който не съхранява данни.
Elevenlabs пусна и своя модел Music 2.5 в средата на септември, създаден да произвежда по-плътни песни с по-естествено звучене.
Новини за ИИ без сензации – подбрани от хора
Абонирайте се за THE DECODER, за да четете без реклами, да получавате седмичен информационен бюлетин за ИИ, нашия ексклузивен водещ доклад „AI Radar“ шест пъти годишно, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.