Нова мовна модель v4 від ElevenLabs робить ШІ-голоси виразнішими й послідовнішими
Ключові моменти
- Elevenlabs випустила Eleven v4 — мовну модель, яка точніше реагує на вказівки та зберігає послідовність голосів у тривалих проєктах.
- Нова версія підтримує понад 90 мов, покращує клонування голосів і обробляє до 10 000 символів за один запит.
- Eleven v4 Turbo призначена для голосових агентів і відповідає за 150 мілісекунд, що, за словами Elevenlabs, швидше за конкуруючі моделі.
Elevenlabs випускає Eleven v4 — нову мовну модель, яка точніше реагує на вказівки та зберігає послідовність голосів у тривалих проєктах. Нова архітектура моделі також лежить в основі варіанта Turbo для голосових агентів у реальному часі.
Eleven v4 надійніше генерує сміх, шепіт і звуки на кшталт грюкання дверима, ніж її попередниця. Варіант Turbo для голосових агентів починає генерувати мовлення приблизно за 150 мілісекунд. Eleven v3, випущена трохи більше року тому, уже підтримувала ці аудіотеги, але реагувала на них менш точно.

Більша послідовність
Elevenlabs стверджує, що v4 використовує нову архітектуру, яка аналізує тон, темп і контекст сценарію. Користувачі можуть задавати вказівки за допомогою тегів або звичайних речень і використовувати фонетичний запис, щоб встановити вимову імен і технічних термінів. Компанія заявляє, що засоби керування вимовою тепер працюють надійніше. Голоси оповідачів і персонажів мають залишатися послідовними протягом усього проєкту, навіть якщо користувачі кілька разів повторно генерують окремі репліки.
Eleven v4 обробляє до 10 000 символів за один запит — приблизно десять хвилин аудіо. Для довших творів, як-от аудіокниг, використовуються кілька сегментів, причому темп і манера подачі мають залишатися послідовними під час переходів. У діалогах мовці ШІ реагують на контекст усієї сцени, а не промовляють кожну репліку ізольовано.
Нова версія підтримує понад 90 мов — порівняно приблизно із 70 у v3. Клоновані голоси мають розмовляти іншими мовами з автентичними акцентами, не повертаючись із часом до початкових акцентів. Professional Voice Clones знову працюють після того, як не підтримувалися у v3, а для "Instant Voice Clone" потрібно лише десять секунд аудіо.
Turbo має пришвидшити виразних голосових агентів
Elevenlabs також випускає швидший варіант v4 для застосувань у реальному часі, як-от обслуговування клієнтів телефоном або персонажів у відеоіграх. Компанія стверджує, що раніше розробникам голосових агентів доводилося обирати між швидкістю та виразністю, а v4 Turbo має забезпечити і те, і інше.
У тестах Elevenlabs Turbo починає генерувати чутне мовлення за 150 мілісекунд, тоді як Cartesia Sonic 3.6 — за 262 мілісекунди. GPT-4o mini TTS від OpenAI потребує 814 мілісекунд. Elevenlabs оптимізувала Turbo спільно зі своєю платформою ElevenAgents.

Eleven v4 посідає вище місце за Cartesia Sonic 3.6 і Gemini 3.8 Flash TTS від Google у рейтингу Provider Voice Arena від Artificial Analysis. Вона набирає 91,7 відсотка в тесті вимови — проти 85,6 відсотка у v3. У сліпих тестах Elevenlabs приблизно три чверті слухачів віддали перевагу v4 моделям від Cartesia, Inworld і Google.

Клони голосів вищої якості роблять v4 корисною для дубляжу, а Elevenlabs рекламує можливість використовувати голос актора всіма підтримуваними мовами. Компанія ліцензує голоси людей, яким вони належать. Актори озвучування можуть запропонувати у бібліотеці Elevenlabs ретельно натренований клон свого голосу й заробляти гроші, коли його використовують платні користувачі. Elevenlabs уже пропонує доступ до голосів знаменитостей, зокрема Майкла Кейна, через спеціальний маркетплейс.
Обидві моделі запускаються з тимчасово зниженими цінами
Стандартна ціна API Elevenlabs становить 80 доларів за мільйон символів для v4 і 40 доларів для Turbo. До 12 жовтня ці ставки знижено до 22 і 11 доларів відповідно. За даними Elevenlabs, користувачі з місячним планом Creator за 22 долари або дорожчим можуть протягом двох тижнів користуватися v4 у ElevenCreative без додаткової плати. Використання обмежене подвійним обсягом їхніх щомісячних кредитів. Artificial Analysis вказує ціну Sonic 3.6 на рівні 49 доларів за мільйон символів, а Gemini 3.8 Flash TTS — 16,49 долара.
Обидві моделі вже доступні в ElevenAgents, ElevenCreative і через API. За замовчуванням Elevenlabs зберігає дані клієнтів у США, згідно з її документацією. Корпоративні клієнти можуть зберігати дані в ізольованих середовищах у ЄС, Індії або Сінгапурі, хоча деяка обробка може відбуватися за межами обраного регіону. У ЄС клієнти можуть залишати обробку API в межах регіону, використовуючи режим, який не зберігає дані.
У середині вересня Elevenlabs також випустила свою модель Music 2.5, призначену для створення щільніших і природніших пісень.
Новини ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний прикордонний звіт "AI Radar" шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.