Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Новая речевая модель v4 от ElevenLabs делает ИИ-голоса более выразительными и стабильными

Новая речевая модель v4 от ElevenLabs делает голоса ИИ более выразительными и последовательными
Джонатан Кемпер
29 сен. 2026
ElevenLabs

Ключевые моменты

  • ElevenLabs выпустила Eleven v4 — речевую модель, которая точнее следует указаниям и сохраняет согласованность голосов в длинных проектах.
  • Новая версия поддерживает более 90 языков, улучшает клонирование голосов и обрабатывает до 10 000 символов за запрос.
  • Eleven v4 Turbo предназначена для голосовых агентов и отвечает за 150 миллисекунд, что, по словам ElevenLabs, быстрее конкурирующих моделей.

ElevenLabs выпускает Eleven v4 — новую речевую модель, которая точнее следует указаниям и сохраняет согласованность голосов в длинных проектах. Новая архитектура модели также лежит в основе варианта Turbo для голосовых агентов, работающих в реальном времени.

Eleven v4 надёжнее предыдущей версии генерирует смех, шёпот и звуки вроде хлопающих дверей. Вариант Turbo для голосовых агентов начинает генерировать речь примерно за 150 миллисекунд. Eleven v3, выпущенная чуть более года назад, уже поддерживала эти аудиотеги, но следовала им менее точно.

Интерфейс ElevenLabs с диалоговым сценарием для двух говорящих, где в тексте оранжевым выделены такие теги, как «тёплый», «длинная пауза», «звуки гонга» и «нервный смех», а также показаны настройки голоса, модели Eleven v4, стабильности и сходства.
Теги в сценарии позволяют задавать эмоции, паузы и звуковые эффекты для каждой реплики. | Изображение: ElevenLabs

Больше согласованности

По словам ElevenLabs, v4 использует новую архитектуру, которая анализирует тон, темп и контекст сценария. Пользователи могут задавать указания с помощью тегов или обычных предложений, а также использовать фонетическое написание для настройки произношения имён и технических терминов. Компания утверждает, что теперь элементы управления произношением работают надёжнее. Голоса рассказчиков и персонажей должны оставаться согласованными на протяжении всего проекта, даже если пользователи несколько раз регенерируют отдельные реплики.

Eleven v4 обрабатывает до 10 000 символов за запрос — примерно десять минут аудио. Более длинные произведения, такие как аудиокниги, используют несколько сегментов, при этом темп и подача, как ожидается, сохраняют согласованность на стыках. В диалогах говорящие с ИИ реагируют на контекст всей сцены, а не произносят каждую реплику изолированно.

Новая версия поддерживает более 90 языков по сравнению примерно с 70 в v3. Клонированные голоса должны говорить на других языках с естественными акцентами, не возвращаясь со временем к исходному акценту. Профессиональные клоны голосов снова работают после отсутствия поддержки в v3, а для «мгновенного клона голоса» требуется всего десять секунд аудио.

Turbo призвана ускорить выразительных голосовых агентов

ElevenLabs также выпускает более быстрый вариант v4 для работы в реальном времени, например обработки звонков в службу поддержки или игровых персонажей. Компания утверждает, что раньше разработчикам голосовых агентов приходилось выбирать между скоростью и выразительностью, а v4 Turbo призвана обеспечить и то и другое.

В тестах ElevenLabs Turbo начинает воспроизводить слышимую речь за 150 миллисекунд по сравнению с 262 миллисекундами у Cartesia Sonic 3.6. GPT-4o mini TTS от OpenAI требуется 814 миллисекунд. ElevenLabs оптимизировала Turbo совместно с платформой ElevenAgents.

Столбчатая диаграмма показывает медианное время до первой слышимой речи: Eleven v4 Turbo — 150 мс, опережает Cartesia Sonic 3.6 — 262 мс, xAI TTS — 362 мс, Gemini 3.8 Flash-Lite TTS — 685 мс и OpenAI GPT-4o mini TTS — 814 мс.
В тестах ElevenLabs Eleven v4 Turbo начинает генерировать речь значительно быстрее протестированных конкурирующих моделей. | Изображение: ElevenLabs

Eleven v4 опережает Cartesia Sonic 3.6 и Gemini 3.8 Flash TTS от Google в рейтинге Provider Voice Arena от Artificial Analysis. В тесте на произношение она набирает 91,7 процента по сравнению с 85,6 процента у v3. В слепых тестах ElevenLabs около трёх четвертей слушателей предпочли v4 моделям Cartesia, Inworld и Google.

Столбчатая диаграмма показывает долю побед Eleven v4 в слепых попарных сравнениях: 81 процент против Cartesia Sonic 3.6 и Inworld TTS-2, 72 процента против Gemini 3.8 Flash-Lite TTS и 65 процентов против Gemini 3.8 Flash TTS.
В слепых тестах компании слушатели оценили Eleven v4 как более выразительную в 65–81 процентах сравнений в зависимости от конкурента. | Изображение: ElevenLabs

Клоны голосов более высокого качества делают v4 полезной для дубляжа: ElevenLabs продвигает возможность использовать голос актёра на всех поддерживаемых языках. Компания лицензирует голоса у их владельцев. Актёры озвучки могут предложить в библиотеке ElevenLabs тщательно обученный клон своего голоса и зарабатывать деньги, когда его используют платные пользователи. ElevenLabs уже предоставляет доступ к голосам знаменитостей, например Майкла Кейна, через специализированный маркетплейс.

Обе модели запускаются с временным снижением цен

Стандартная стоимость API ElevenLabs составляет 80 долларов за миллион символов для v4 и 40 долларов для Turbo. До 12 октября эти тарифы снижаются до 22 и 11 долларов. По данным ElevenLabs, пользователи с тарифом Creator за 22 доллара в месяц или более дорогим могут бесплатно использовать v4 в ElevenCreative в течение двух недель. Объём использования ограничен удвоенным количеством их ежемесячных кредитов. Artificial Analysis указывает цену Sonic 3.6 в размере 49 долларов за миллион символов, а Gemini 3.8 Flash TTS — 16,49 доллара.

Обе модели уже доступны в ElevenAgents, ElevenCreative и через API. Согласно документации, ElevenLabs по умолчанию хранит данные клиентов в США. Корпоративные клиенты могут хранить данные в изолированных средах в ЕС, Индии или Сингапуре, хотя часть обработки может осуществляться за пределами выбранного региона. В ЕС клиенты могут сохранять обработку API в пределах региона, используя режим, в котором данные не сохраняются.

В середине сентября ElevenLabs также выпустила свою модель Music 2.5, предназначенную для создания более насыщенных и естественно звучащих песен.

Новости ИИ без шумихи — отобраны людьми

Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный обзор передовых разработок «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.

Источник: ElevenLabs

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием The Decoder

Читать оригинал на The Decoder ↗

Текст и изображения принадлежат The Decoder и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости