Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Нова мовна модель v4 від ElevenLabs робить ШІ-голоси виразнішими й послідовнішими

ElevenLabs' нова мовна модель v4 робить голоси ШІ виразнішими та послідовнішими
Джонатан Кемпер
29 вересня 2026 року
Elevenlabs

Ключові моменти

  • Elevenlabs випустила Eleven v4 — мовну модель, яка точніше реагує на вказівки та зберігає послідовність голосів у тривалих проєктах.
  • Нова версія підтримує понад 90 мов, покращує клонування голосів і обробляє до 10 000 символів за один запит.
  • Eleven v4 Turbo призначена для голосових агентів і відповідає за 150 мілісекунд, що, за словами Elevenlabs, швидше за конкуруючі моделі.

Elevenlabs випускає Eleven v4 — нову мовну модель, яка точніше реагує на вказівки та зберігає послідовність голосів у тривалих проєктах. Нова архітектура моделі також лежить в основі варіанта Turbo для голосових агентів у реальному часі.

Eleven v4 надійніше генерує сміх, шепіт і звуки на кшталт грюкання дверима, ніж її попередниця. Варіант Turbo для голосових агентів починає генерувати мовлення приблизно за 150 мілісекунд. Eleven v3, випущена трохи більше року тому, уже підтримувала ці аудіотеги, але реагувала на них менш точно.

Інтерфейс Elevenlabs із діалоговим сценарієм для двох мовців, де в тексті помаранчевим виділено такі теги, як теплий тон, довга пауза, звуки гонга та нервовий сміх, а також показано налаштування голосу, моделі Eleven v4, стабільності й подібності.
Теги у сценарії дають змогу користувачам задавати емоції, паузи та звукові ефекти для кожної репліки. | Зображення: Elevenlabs

Більша послідовність

Elevenlabs стверджує, що v4 використовує нову архітектуру, яка аналізує тон, темп і контекст сценарію. Користувачі можуть задавати вказівки за допомогою тегів або звичайних речень і використовувати фонетичний запис, щоб встановити вимову імен і технічних термінів. Компанія заявляє, що засоби керування вимовою тепер працюють надійніше. Голоси оповідачів і персонажів мають залишатися послідовними протягом усього проєкту, навіть якщо користувачі кілька разів повторно генерують окремі репліки.

Eleven v4 обробляє до 10 000 символів за один запит — приблизно десять хвилин аудіо. Для довших творів, як-от аудіокниг, використовуються кілька сегментів, причому темп і манера подачі мають залишатися послідовними під час переходів. У діалогах мовці ШІ реагують на контекст усієї сцени, а не промовляють кожну репліку ізольовано.

Нова версія підтримує понад 90 мов — порівняно приблизно із 70 у v3. Клоновані голоси мають розмовляти іншими мовами з автентичними акцентами, не повертаючись із часом до початкових акцентів. Professional Voice Clones знову працюють після того, як не підтримувалися у v3, а для "Instant Voice Clone" потрібно лише десять секунд аудіо.

Turbo має пришвидшити виразних голосових агентів

Elevenlabs також випускає швидший варіант v4 для застосувань у реальному часі, як-от обслуговування клієнтів телефоном або персонажів у відеоіграх. Компанія стверджує, що раніше розробникам голосових агентів доводилося обирати між швидкістю та виразністю, а v4 Turbo має забезпечити і те, і інше.

У тестах Elevenlabs Turbo починає генерувати чутне мовлення за 150 мілісекунд, тоді як Cartesia Sonic 3.6 — за 262 мілісекунди. GPT-4o mini TTS від OpenAI потребує 814 мілісекунд. Elevenlabs оптимізувала Turbo спільно зі своєю платформою ElevenAgents.

Стовпчикова діаграма із медіанним часом до першого чутного мовлення: Eleven v4 Turbo — 150 мс, попереду Cartesia Sonic 3.6 — 262 мс, xAI TTS — 362 мс, Gemini 3.8 Flash-Lite TTS — 685 мс і OpenAI GPT-4o mini TTS — 814 мс.
У тестах Elevenlabs Eleven v4 Turbo починає генерувати мовлення значно швидше за перевірені конкуруючі моделі. | Зображення: Elevenlabs

Eleven v4 посідає вище місце за Cartesia Sonic 3.6 і Gemini 3.8 Flash TTS від Google у рейтингу Provider Voice Arena від Artificial Analysis. Вона набирає 91,7 відсотка в тесті вимови — проти 85,6 відсотка у v3. У сліпих тестах Elevenlabs приблизно три чверті слухачів віддали перевагу v4 моделям від Cartesia, Inworld і Google.

Стовпчикова діаграма частки перемог Eleven v4 у сліпих очних порівняннях: 81 відсоток проти Cartesia Sonic 3.6 та Inworld TTS-2, 72 відсотки проти Gemini 3.8 Flash-Lite TTS і 65 відсотків проти Gemini 3.8 Flash TTS.
У сліпих тестах компанії слухачі оцінювали Eleven v4 як виразнішу у 65–81 відсотку порівнянь, залежно від конкурента. | Зображення: Elevenlabs

Клони голосів вищої якості роблять v4 корисною для дубляжу, а Elevenlabs рекламує можливість використовувати голос актора всіма підтримуваними мовами. Компанія ліцензує голоси людей, яким вони належать. Актори озвучування можуть запропонувати у бібліотеці Elevenlabs ретельно натренований клон свого голосу й заробляти гроші, коли його використовують платні користувачі. Elevenlabs уже пропонує доступ до голосів знаменитостей, зокрема Майкла Кейна, через спеціальний маркетплейс.

Обидві моделі запускаються з тимчасово зниженими цінами

Стандартна ціна API Elevenlabs становить 80 доларів за мільйон символів для v4 і 40 доларів для Turbo. До 12 жовтня ці ставки знижено до 22 і 11 доларів відповідно. За даними Elevenlabs, користувачі з місячним планом Creator за 22 долари або дорожчим можуть протягом двох тижнів користуватися v4 у ElevenCreative без додаткової плати. Використання обмежене подвійним обсягом їхніх щомісячних кредитів. Artificial Analysis вказує ціну Sonic 3.6 на рівні 49 доларів за мільйон символів, а Gemini 3.8 Flash TTS — 16,49 долара.

Обидві моделі вже доступні в ElevenAgents, ElevenCreative і через API. За замовчуванням Elevenlabs зберігає дані клієнтів у США, згідно з її документацією. Корпоративні клієнти можуть зберігати дані в ізольованих середовищах у ЄС, Індії або Сінгапурі, хоча деяка обробка може відбуватися за межами обраного регіону. У ЄС клієнти можуть залишати обробку API в межах регіону, використовуючи режим, який не зберігає дані.

У середині вересня Elevenlabs також випустила свою модель Music 2.5, призначену для створення щільніших і природніших пісень.

Новини ШІ без хайпу — відібрані людьми

Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний прикордонний звіт "AI Radar" шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.

Джерело: Elevenlabs

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням The Decoder

Читати оригінал на The Decoder ↗

Текст і зображення належать The Decoder і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини