Створюйте багатомовних голосових агентів із низькою затримкою: відкриті ваги та повний контроль над розгортанням за допомогою NVIDIA Magpie TTS
Кожна голосова взаємодія має бюджет затримки.
До того моменту, коли користувач почує відповідь вашого застосунку, ви вже витратите дорогоцінні мілісекунди на захоплення аудіо, транскрибування мовлення, запуск LLM, отримання контексту та генерування відповіді. Перетворення тексту на мовлення (TTS) — це фінальний етап, який користувачі помічають найбільше. Якщо генерування мовлення повільне, увесь досвід здається повільним.
Що більшу частину цього конвеєра ви можете запускати й налаштовувати самостійно, то більшу частину бюджету затримки ви повертаєте.
Голосовий ШІ розвивається швидкими темпами. Інтегровані мовленнєві моделі забезпечують простоту — один виклик API, аудіо на вході, аудіо на виході, — але натомість ви втрачаєте можливість тонко налаштовувати кожен компонент під свій домен, замінювати моделі на кращі в міру їх випуску, забезпечувати локалізацію даних і точно розуміти, звідки походить затримка. Для більшого контролю каскадна архітектура — спеціалізовані компоненти ASR, TTS і LLM, що працюють разом, — зберігає можливість незалежно налаштовувати й розгортати кожен рівень на інфраструктурі, якою ви володієте.
NVIDIA Magpie Multilingual TTS створено саме для цього. Завдяки відкритим вагам, готовому до використання у виробництві NVIDIA NIM та підтримці 12 мов ви можете розгорнути багатомовне мовлення у власній інфраструктурі, оптимізувати затримку під своє робоче навантаження й налаштувати модель під свій домен — від початку до кінця, у власному середовищі.
Останній випуск розширює багатомовне охоплення сучасною стандартною арабською, корейською та бразильською португальською, водночас підвищуючи якість багатьох наявних мов завдяки оновленим навчальним даним і вдосконаленням моделі.
Незалежно від того, чи створюєте ви агентів підтримки клієнтів, медичних асистентів, корпоративних копілотів, системи перекладу або застосунки розмовного ШІ, Magpie надає відкриту основу для голосового ШІ виробничого рівня.
Голосовий ШІ за замовчуванням стає багатомовним
Сучасні голосові застосунки не працюють лише однією мовою.
Глобальна підтримка клієнтів, корпоративні асистенти, медична документація, автоматизація роздрібної торгівлі та робочі процеси перекладу дедалі частіше потребують природних розмов кількома мовами — і все це з низькою затримкою.
Підтримка більшої кількості мов — лише частина виклику. Розробникам також потрібна можливість:
- Розгортати системи там, де зберігаються їхні дані
- Відповідати корпоративним вимогам щодо конфіденційності
- Налаштовувати вимову та голоси
- Прогнозувати затримку під виробничими навантаженнями
- Масштабуватися на власній інфраструктурі
Відкриті моделі змінюють можливості в кожному з цих напрямів.
Одна відкрита модель, дванадцять мов
Magpie TTS Multilingual — це модель із 364 мільйонами параметрів і відкритими вагами, яка підтримує:
Англійську · іспанську · французьку · німецьку · італійську · в’єтнамську · китайську (мандарин) · гінді · японську · сучасну стандартну арабську (нова) · корейську (нова) · бразильську португальську (нова)
Для кожної мови доступні чоловічі та жіночі голоси мовців завдяки спільному багатомовному представленню мовця.
Цей випуск також розширює багатомовну гнучкість завдяки вдосконаленій підтримці перемикання мов для гінді та японської, реалізованій через обробку графем у фонеми за допомогою IPA та спеціальні словники вимови, що спрощує точну вимову імен, технічної термінології та різномовного контенту.
Замість підтримки окремих моделей TTS для різних регіонів розробники можуть створювати багатомовні застосунки на єдиній відкритій основі.
Затримка, яку насправді помічають ваші користувачі
У розмовному ШІ перетворення тексту на мовлення — фінальний етап перед тим, як користувачі почують відповідь. Тому час до першого аудіо (TTFA) — затримка між початком генерування мовлення та надходженням першого аудіо до користувача — є одним із найважливіших показників затримки в голосовому конвеєрі.
Оскільки Magpie TTS можна розгорнути у власному середовищі, вимірювана вами затримка є серверною затримкою, яку ви справді контролюєте, без урахування часу обміну з керованим сервісом.
| GPU | TTFA для 1 потоку | RTFX для 1 потоку | TTFA для 64 потоків | RTFX для 64 потоків |
|---|---|---|---|---|
| B200 | 32 мс | 12.1× | 239 мс | 319.81× |
| H100 | 47 мс | 14.7× | 275 мс | 290.79× |
| DGX Spark | 53 мс | 9.8× | 962 мс | 75.88× |
| A100 | 79 мс | 12.2× | 395 мс | 197× |
Джерело: документація NVIDIA щодо продуктивності TTS NIM (v26.07), середнє значення трьох випробувань, локальне розгортання.
TTFA = затримка до першого аудіо; RTFX = пропускна здатність як кратне значення реального часу.
За показника TTFA 32 мс на B200 Magpie залишає решту бюджету затримки для обробки ASR і LLM, утримуючи загальну наскрізну затримку в межах менш ніж 200 мс, необхідних для природної розмови. На графічних процесорах NVIDIA Magpie генерує перше аудіо за 32–79 мс в одному потоці. За 64 одночасних потоків B200 досягає TTFA 239 мс і забезпечує пропускну здатність у 320 разів вищу за реальний час — генеруючи аудіо більш ніж у 300 разів швидше, ніж воно відтворюється, навіть за одночасного навантаження.
У таблиці вище показано Magpie, що працює як NVIDIA NIM, із вимірюваннями за локального розгортання — оптимізований контейнер працює на вашому власному GPU. Відкрита контрольна точка на Hugging Face — це та сама модель і ваш шлях для досліджень та тонкого налаштування; NIM — це оптимізований стек обслуговування, який забезпечує ці виробничі показники затримки. Обидва варіанти працюють на обладнанні, яким ви керуєте.
Оскільки модель працює на вашій власній інфраструктурі, ви можете безпосередньо оцінювати продуктивність, налаштовувати її під своє розгортання та масштабувати відповідно до робочого навантаження. Для голосових агентів реального часу саме це визначає різницю між розмовами, які здаються чуйними, і розмовами, що відчуваються повільними.
Оптимізовано для генерування мовлення в реальному часі
Низька затримка не виникає випадково. Magpie запроваджує два взаємодоповнювальні архітектурні вдосконалення, які скорочують час виведення, зберігаючи якість мовлення.
Стекінг кадрів. Декодер прогнозує два аудіокадри на кожному кроці декодування замість одного. Це вдвічі скорочує кількість ітерацій декодера, зменшуючи час генерування та підвищуючи пропускну здатність.
Локальний трансформер. Сам по собі стекінг кадрів знижував би якість аудіо, створюючи залежності між токенами кодової книги, які генеруються одночасно. Локальний трансформер моделює ці залежності й уточнює згенероване аудіо, відновлюючи якість, якою стекінг кадрів інакше довелося б пожертвувати.
Разом ці методи забезпечують і швидше генерування, і природний синтез мовлення. Архітектуру описано в роботі Frame-Stacked Local Transformers for Efficient Multi-Codebook Speech Generation (ICASSP 2026).
Швидкість не має значення, якщо мовлення звучить неприродно
Цей випуск не лише додає мови — він також підвищує якість синтезу багатьма вже наявними мовами. Порівняно з попереднім випуском Magpie демонструє нижчі показники помилок символів (CER) і вищу подібність до голосу мовця (SSIM) для кількох мов, причому найпомітніші покращення спостерігаються для французької та іспанської:
| Мова | CER (попередня) | CER (цей випуск) | SSIM (попередня) | SSIM (цей випуск) |
|---|---|---|---|---|
| Французька | 2.70% | 1.54% | 0.703 | 0.747 |
| Іспанська | 1.14% | 0.60% | 0.715 | 0.793 |
| Німецька | 0.66% | 0.80% | 0.626 | 0.742 |
Джерело: картка моделі Magpie TTS Multilingual. Нижчий CER — краще; вищий SSIM — краще.
Нещодавно додані моделі арабської (CER 1.62%), корейської (2.69%) та бразильської португальської (2.91%) встановлюють базовий рівень якості для майбутніх удосконалень.
Хоча об’єктивні метрики допомагають вимірювати прогрес, якість мовлення зрештою є перцептивною. Ви можете самі почути різницю на NVIDIA Build або в демо Hugging Face.
Чому відкриті ваги мають значення
Затримка, яку можна виміряти, корисна. Затримка, яку можна контролювати, ще краща.
Відкриті ваги надають розробникам можливості, що з’являються завдяки володінню розгортанням. З Magpie ви можете:
- Розгортати на інфраструктурі, якою ви керуєте — повністю працювати у власній інфраструктурі, зокрема у приватних середовищах або середовищах без доступу до мережі.
- Самостійно керувати бюджетом затримки — без обміну даними з керованим сервісом, із прямою оптимізацією під ваше обладнання та робоче навантаження.
- Налаштовувати вимову та голоси — виконувати тонке налаштування за допомогою NeMo під власний бренд, галузеву лексику або дані мовців.
- Масштабуватися на власних умовах — оптимізувати стек обслуговування під свою інфраструктуру та робоче навантаження.
- Зберігати корпоративний контроль — зберігати конфіденційні розмови та дані клієнтів у власному середовищі.
Для підприємств, які створюють голосовий ШІ виробничого рівня, саме цей контроль над розгортанням, продуктивністю та налаштуванням часто має найбільше значення.
Створюйте повноцінних голосових агентів — не лише якісніше мовлення
Голосовий ШІ у виробничому середовищі — це система моделей, а не одна модель. Magpie TTS є частиною прикладу розробника NVIDIA Nemotron Voice Agent — еталонної реалізації, яка демонструє, як спеціалізовані моделі мовлення, мови та міркування працюють разом як скоординована система, щоб ви могли створювати голосових агентів, які працюють постійно, а не лише мовлення, що краще звучить.
Розробники можуть поєднувати:
- Nemotron Speech для потокового розпізнавання мовлення
- Magpie TTS для природного багатомовного синтезу мовлення
- мовні та мультимодальні моделі Nemotron для міркування, виклику інструментів і мультимодального розуміння
- NVIDIA NIM для оптимізованих під GPU, готових до використання у виробництві мікросервісів інференсу
- NeMo для налаштування й тонкого налаштування
Приклад розробника Nemotron Voice Agent містить наскрізну еталонну реалізацію, яку розробники можуть клонувати, налаштовувати та розгортати за кілька годин. Він включає виробничі шаблони для:
- Перериваних розмов у реальному часі (barge-in)
- Мультимодальних голосових агентів із розумінням зображень
- Оркестрації кількох агентів і виклику інструментів
- Багатомовної голосової взаємодії
- Наскрізної затримки менше секунди з використанням NVIDIA NIM
Замість того щоб збирати окремі компоненти з нуля, розробники можуть почати з повної еталонної архітектури й адаптувати її до власних застосунків.
Початок роботи
Спробуйте модель
Розгорніть у виробничому середовищі
- NVIDIA Magpie Multilingual TTS NIM — оптимізовані контейнери інференсу
Налаштуйте під свій домен
- NVIDIA NeMo Speech — тонке налаштування та навчання
Створюйте повноцінних голосових агентів
Відкриті ваги та ліцензія
- Картка моделі на Hugging Face — відкриті ваги за ліцензією NVIDIA Open Model License.
Рекомендована конфігурація інференсу:
cfg_scale = 2.5
temperature = 0.6
top_k = 80
apply_attention_prior = True
prior_epsilon = 0.1
Моделі, згадані в цій статті 1
Простори, згадані в цій статті 1
Спільнота
· Зареєструйтеся або увійдіть, щоб коментувати
Моделі, згадані в цій статті 1
Простори, згадані в цій статті 1
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

