Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Новият речеви модел v4 на ElevenLabs прави AI гласовете по-изразителни и последователни

ElevenLabs' новият гласов модел v4 прави гласовете на ИИ по-изразителни и последователни
Jonathan Kemper
29 септември 2026 г.
Elevenlabs

Основни моменти

  • Elevenlabs пусна Eleven v4 — гласов модел, който следва по-точно указанията и запазва последователността на гласовете в дълги продукции.
  • Новата версия поддържа над 90 езика, подобрява клонирането на гласове и обработва до 10 000 знака на заявка.
  • Eleven v4 Turbo е насочен към гласови агенти и отговаря за 150 милисекунди, което според Elevenlabs е по-бързо от конкурентните модели.

Elevenlabs пуска Eleven v4 — нов гласов модел, който следва по-точно указанията и запазва последователността на гласовете в дълги продукции. Нова архитектура на модела захранва и варианта Turbo за гласови агенти в реално време.

Eleven v4 генерира по-надеждно смях, шепот и звуци като тряскане на врата в сравнение с предшественика си. Вариантът Turbo за гласови агенти започва да произвежда реч за около 150 милисекунди. Eleven v3, пуснат преди малко повече от година, вече поддържаше тези аудио тагове, но ги следваше по-неточно.

Интерфейсът на Elevenlabs показва диалогов сценарий за двама говорители с оцветени в оранжево тагове като топъл, дълга пауза, звуци от гонг и нервен смях в текста, както и настройки за глас, модел Eleven v4, стабилност и сходство.
Таговете в сценария позволяват на потребителите да задават емоции, паузи и звукови ефекти за всеки ред. | Изображение: Elevenlabs

По-голяма последователност

Elevenlabs казва, че v4 използва нова архитектура, която анализира тона, темпото и контекста на сценария. Потребителите могат да дават указания чрез тагове или обикновени изречения и да използват фонетичен правопис, за да задават произношението на имена и технически термини. Компанията твърди, че контролите за произношение вече работят по-надеждно. Гласовете на разказвачите и персонажите би трябвало да звучат последователно в цялата продукция, дори когато потребителите генерират отделни реплики по няколко пъти.

Eleven v4 обработва до 10 000 знака на заявка — приблизително десет минути аудио. По-дългите произведения, като аудиокниги, използват множество сегменти, като се очаква темпото и изпълнението да останат последователни при преходите. В диалозите говорещите на ИИ реагират на контекста на цялата сцена, вместо да изпълняват всяка реплика изолирано.

Новата версия поддържа над 90 езика, спрямо около 70 при v3. Клонираните гласове би трябвало да говорят други езици с естествени акценти, без с течение на времето да се връщат към оригиналните си акценти. Професионалните клонирания на гласове отново работят, след като не се поддържаха във v3, а за „моментално клониране на глас“ са нужни само десет секунди аудио.

Turbo цели да направи изразителните гласови агенти по-бързи

Elevenlabs пуска и по-бърз вариант v4 за употреби в реално време, като разговори с обслужването на клиенти или персонажи в игри. Компанията твърди, че досега разработчиците на гласови агенти е трябвало да избират между скорост и изразителност, а v4 Turbo има за цел да предложи и двете.

В тестовете на Elevenlabs Turbo започва да произвежда чуваема реч за 150 милисекунди, в сравнение с 262 милисекунди за Cartesia Sonic 3.6. GPT-4o mini TTS на OpenAI се нуждае от 814 милисекунди. Elevenlabs е оптимизирала Turbo съвместно със своята платформа ElevenAgents.

Стълбовидна диаграма, показваща медианното време до първата чуваема реч, като Eleven v4 Turbo е начело със 150 мс пред Cartesia Sonic 3.6 с 262 мс, xAI TTS с 362 мс, Gemini 3.8 Flash-Lite TTS с 685 мс и OpenAI GPT-4o mini TTS с 814 мс.
В бенчмарковете на Elevenlabs Eleven v4 Turbo започва да произвежда реч значително по-бързо от тестваните конкурентни модели. | Изображение: Elevenlabs

Eleven v4 се класира пред Cartesia Sonic 3.6 и Gemini 3.8 Flash TTS на Google в класацията Provider Voice Arena на Artificial Analysis. Той постига 91,7 процента в бенчмарка за произношение, спрямо 85,6 процента при v3. В слепите тестове на Elevenlabs около три четвърти от слушателите предпочитат v4 пред моделите на Cartesia, Inworld и Google.

Стълбовидна диаграма, показваща дела на спечелените от Eleven v4 слепи директни сравнения, с 81 процента срещу Cartesia Sonic 3.6 и Inworld TTS-2, 72 процента срещу Gemini 3.8 Flash-Lite TTS и 65 процента срещу Gemini 3.8 Flash TTS.
В слепите тестове на компанията слушателите оценяват Eleven v4 като по-изразителен в 65 до 81 процента от сравненията в зависимост от конкурента. | Изображение: Elevenlabs

По-качествените клонирания на гласове правят v4 полезен за дублаж, като Elevenlabs насърчава възможността да се използва гласът на актьор на всички поддържани езици. Компанията лицензира гласове от хората, които стоят зад тях. Гласовите актьори могат да предложат в библиотеката на Elevenlabs подробно обучено клонирано копие на гласа си и да печелят пари, когато платени потребители го използват. Elevenlabs вече предлага достъп до гласове на знаменитости като този на Майкъл Кейн чрез специален пазар.

И двата модела стартират с временно намалени цени

Стандартната цена на API на Elevenlabs е 80 долара на милион знака за v4 и 40 долара за Turbo. До 12 октомври тези цени спадат съответно до 22 и 11 долара. Според Elevenlabs потребителите с месечен план Creator за 22 долара или по-висок могат да използват v4 в ElevenCreative без допълнително заплащане в продължение на две седмици. Използването е ограничено до два пъти размера на месечните им кредити. Artificial Analysis посочва цена от 49 долара на милион знака за Sonic 3.6 и 16,49 долара за Gemini 3.8 Flash TTS.

И двата модела вече са налични в ElevenAgents, ElevenCreative и чрез API. По подразбиране Elevenlabs съхранява данните на клиентите в САЩ, според своята документация. Клиентите от корпоративния сегмент могат да съхраняват данни в изолирани среди в ЕС, Индия или Сингапур, макар че част от обработката може да се извършва извън избрания регион. В ЕС клиентите могат да запазят обработката на API в региона, като използват режим, който не съхранява данни.

Elevenlabs пусна и своя модел Music 2.5 в средата на септември, създаден да произвежда по-плътни песни с по-естествено звучене.

Новини за ИИ без сензации – подбрани от хора

Абонирайте се за THE DECODER, за да четете без реклами, да получавате седмичен информационен бюлетин за ИИ, нашия ексклузивен водещ доклад „AI Radar“ шест пъти годишно, пълен достъп до архива и достъп до секцията за коментари.

Източник: Elevenlabs

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от The Decoder на

Прочетете оригинала в The Decoder ↗

Текстът и изображенията са собственост на The Decoder и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини