Sakhanda Wire
NVDA $218.35 -2.51% MSFT $505.80 +1.16% GOOGL $354.10 -0.06% META $592.91 +0.14% AMZN $276.91 +0.89%
← Към новините

Изграждайте многоезични гласови агенти с ниска латентност: отворени тегла и пълен контрол върху внедряването с NVIDIA Magpie TTS

Изграждане на многоезични гласови агенти с ниска латентност: отворени тегла и пълен контрол върху внедряването с NVIDIA Magpie TTS
За предприятия + Статия
Публикувано 10 август 2026 г.
newsletter-speech-ai-customer-600x600 (4)

Всяко гласово взаимодействие има бюджет за латентност.

Докато потребителят чуе отговора на приложението ви, вече сте изразходвали ценни милисекунди за запис на аудио, транскрибиране на реч, стартиране на LLM, извличане на контекст и генериране на отговор. Преобразуването на текст в реч (TTS) е последната стъпка — и тази, която потребителите забелязват най-много. Ако генерирането на реч е бавно, цялото изживяване се усеща бавно.

Колкото повече части от този процес можете да изпълнявате и настройвате сами, толкова по-голяма част от бюджета за латентност си връщате.

Гласовият изкуствен интелект се развива бързо. Интегрираните речеви модели предлагат простота — една заявка към API, аудио на входа, аудио на изхода — но в замяна ограничават възможността да настройвате всеки компонент за своята област, да заменяте моделите с по-добри, когато бъдат пуснати, да налагате локализация на данните и да разбирате точно откъде идва латентността. За по-голям контрол каскадната архитектура — специално създадени компоненти за ASR, TTS и LLM, които работят заедно — запазва възможността всеки слой да се настройва независимо и да се внедрява върху инфраструктура, която притежавате.

NVIDIA Magpie Multilingual TTS е създаден за тази цел. С отворени тегла, готов за продукция NVIDIA NIM и поддръжка на 12 езика можете да внедрите многоезична реч в собствената си инфраструктура, да оптимизирате латентността за работното си натоварване и да персонализирате модела за своята област — от край до край, в собствената си среда.

Най-новото издание разширява многоезичното покритие с книжовен арабски, корейски и бразилски португалски, като същевременно подобрява качеството на много от съществуващите езици чрез актуализирани обучаващи данни и подобрения на модела.

Независимо дали изграждате агенти за клиентска поддръжка, здравни асистенти, корпоративни копилоти, системи за превод или приложения с разговорен изкуствен интелект, Magpie предоставя отворена основа за гласов изкуствен интелект в продукция.

Гласовият изкуствен интелект по подразбиране става многоезичен

Днешните гласови приложения не обслужват само един език.

Глобалната клиентска поддръжка, корпоративните асистенти, медицинската документация, автоматизацията в търговията на дребно и работните процеси за превод все по-често изискват естествени разговори на множество езици — при това с ниска латентност.

Поддръжката на повече езици е само част от предизвикателството. Разработчиците също се нуждаят от възможност да:

  • Внедряват там, където се намират данните им
  • Отговарят на изискванията за корпоративна поверителност
  • Персонализират произношението и гласовете
  • Предвиждат латентността при продукционни натоварвания
  • Мащабират върху собствената си инфраструктура

Отворените модели променят възможното във всяка от тези области.

Един отворен модел, дванадесет езика

Magpie TTS Multilingual е модел с 364 милиона параметъра и отворени тегла, който поддържа:

Английски · испански · френски · немски · италиански · виетнамски · мандарин · хинди · японски · книжовен арабски (нов) · корейски (нов) · бразилски португалски (нов)

Всеки език включва гласове на мъжки и женски говорители чрез споделено многоезично представяне на говорителите.

Това издание също подобрява многоезичната гъвкавост чрез разширена поддръжка на превключване между езици за хинди и японски, активирана чрез обработка на графеми към фонеми с IPA и персонализирани речници за произношение — което улеснява точното произнасяне на имена, техническа терминология и съдържание на смесени езици.

Вместо да поддържат отделни TTS модели за различни региони, разработчиците могат да изграждат многоезични приложения върху една отворена основа.

Латентността, която потребителите ви действително забелязват

В разговорния изкуствен интелект преобразуването на текст в реч е последният етап, преди потребителите да чуят отговор. Това превръща времето до първото аудио (TTFA) — забавянето между началото на генерирането на реч и достигането на първото аудио до потребителя — в един от най-важните показатели за латентност в гласовия процес.

Тъй като Magpie TTS може да бъде внедрен в собствената ви среда, измерената латентност е сървърната латентност, която действително контролирате, без в показателя да се включва двупосочно пътуване до управлявана услуга.

GPU TTFA при 1 поток RTFX при 1 поток TTFA при 64 потока RTFX при 64 потока
B200 32 ms 12.1× 239 ms 319.81×
H100 47ms 14.7× 275 ms 290.79×
DGX Spark 53 ms 9.8× 962 ms 75.88×
A100 79 ms 12.2× 395 ms 197×

Източник: Документация за производителността на NVIDIA TTS NIM (v26.07), средна стойност от три изпитвания, локално.
TTFA = латентност до първото аудио; RTFX = пропускателна способност като множител на реалното време.

При 32 ms на B200 TTFA на Magpie оставя останалата част от бюджета за латентност за обработката от ASR и LLM — като поддържа общата латентност от край до край в рамките на под 200 ms, необходими за естествен разговор. На графичните процесори на NVIDIA Magpie генерира първото аудио за 32–79 ms при един поток. При 64 едновременни потока B200 достига TTFA от 239 ms, като осигурява пропускателна способност 320× в реално време — генерирайки аудио над 300 пъти по-бързо, отколкото то се възпроизвежда, дори при едновременно натоварване.

Таблицата по-горе показва Magpie, обслужван като NVIDIA NIM, измерен локално — оптимизираният контейнер, работещ върху вашия собствен GPU. Отворената контролна точка в Hugging Face е същият модел и вашият път за изследвания и фино дообучаване; NIM е оптимизираният стек за обслужване, който постига тези продукционни латентности. И двата варианта работят върху хардуер, който контролирате.

Тъй като моделът работи върху собствената ви инфраструктура, можете директно да сравнявате производителността, да го настройвате за внедряването си и да мащабирате според работното си натоварване. За гласови агенти в реално време това е разликата между разговори, които се усещат отзивчиви, и разговори, които се усещат забавени.

Оптимизиран за генериране на реч в реално време

Ниската латентност не е случайна. Magpie въвежда две допълващи се архитектурни подобрения, които намаляват времето за инференс, като същевременно запазват качеството на речта.

Стекиране на кадри. Декодерът предсказва два аудиокадъра при всяка стъпка на декодиране вместо един. Това намалява наполовина броя на итерациите на декодера, съкращава времето за генериране и подобрява пропускателната способност.

Локален трансформатор. Самото стекиране на кадри би намалило качеството на аудиото, като въведе зависимости между едновременно генерираните токени на кодовата книга. Локалният трансформатор моделира тези зависимости и усъвършенства генерираното аудио, възстановявайки качеството, което стекирането на кадри иначе би пожертвало.

Заедно тези техники осигуряват едновременно по-бързо генериране и естествен синтез на реч. Архитектурата е описана в Frame-Stacked Local Transformers for Efficient Multi-Codebook Speech Generation (ICASSP 2026).

По-високата скорост няма значение, ако речта не звучи естествено

Това издание не добавя само езици — то подобрява и качеството на синтеза при много от съществуващите езици. В сравнение с предишното издание Magpie показва намалени нива на грешки по символи (CER) и по-висока прилика с говорителя (SSIM) при няколко езика, като най-ясни са подобренията при френския и испанския:

Език CER (предишно) CER (това издание) SSIM (предишно) SSIM (това издание)
Френски 2.70% 1.54% 0.703 0.747
Испански 1.14% 0.60% 0.715 0.793
Немски 0.66% 0.80% 0.626 0.742

Източник: Карта на модела Magpie TTS Multilingual. По-нисък CER е по-добър; по-висок SSIM е по-добър.

Ново добавените модели за арабски (1.62% CER), корейски (2.69%) и бразилски португалски (2.91%) установяват базово качество за бъдещи подобрения.

Макар обективните показатели да помагат за измерването на напредъка, качеството на речта в крайна сметка е перцептивно. Можете сами да чуете разликата в NVIDIA Build или в демото на Hugging Face.

Защо отворените тегла са важни

Латентността, която можете да измервате, е полезна. Латентността, която можете да контролирате, е още по-добра.

Отворените тегла дават на разработчиците възможности, произтичащи от притежаването на внедряването. С Magpie можете да:

  • Внедрявате върху инфраструктура, която контролирате — да работите изцяло в собствената си инфраструктура, включително в частни или изолирани от мрежата среди.
  • Притежавате бюджета си за латентност — без двупосочно пътуване до управлявана услуга и с директна оптимизация за вашия хардуер и работно натоварване.
  • Персонализирате произношението и гласовете — да правите фино дообучаване с NeMo за собствената си марка, отраслов речник или данни за говорители.
  • Мащабирате според собствените си условия — да оптимизирате стека за обслужване за вашата инфраструктура и работно натоварване.
  • Поддържате корпоративен контрол — да съхранявате чувствителните разговори и данните на клиентите в собствената си среда.

За предприятията, които изграждат продукционен гласов изкуствен интелект, този контрол върху внедряването, производителността и персонализацията често е най-важен.

Изграждайте цялостни гласови агенти — не просто по-добра реч

Гласовият изкуствен интелект в продукция е система от модели, а не един-единствен модел. Magpie TTS е част от примера за разработчици NVIDIA Nemotron Voice Agent, референтна реализация, показваща как специално създадени модели за реч, език и разсъждение работят заедно като координирана система — така че да можете да изграждате постоянно активни гласови агенти, а не просто реч с по-добро звучене.

Разработчиците могат да комбинират:

  • Nemotron Speech за поточно разпознаване на реч
  • Magpie TTS за естествен синтез на многоезична реч
  • Езикови и мултимодални модели Nemotron за разсъждение, извикване на инструменти и мултимодално разбиране
  • NVIDIA NIM за оптимизирани за GPU, готови за продукция микросървиси за инференс
  • NeMo за персонализация и фино дообучаване

Примерът за разработчици Nemotron Voice Agent предоставя цялостна референтна реализация от край до край, която разработчиците могат да клонират, персонализират и внедрят за часове. Той включва продукционни модели за:

  • Разговори в реално време с възможност за прекъсване (barge-in)
  • Мултимодални гласови агенти с разбиране на изображения
  • Оркестрация на множество агенти и извикване на инструменти
  • Многоезични гласови взаимодействия
  • Латентност от край до край под една секунда с NVIDIA NIM

Вместо да сглобяват отделни компоненти от нулата, разработчиците могат да започнат от цялостна референтна архитектура и да я адаптират за собствените си приложения.

Първи стъпки

Изпробвайте модела

Внедрете в продукция

Персонализирайте за своята област

Изградете цялостни гласови агенти

Отворени тегла и лиценз

Препоръчителна конфигурация за инференс:

cfg_scale = 2.5          
temperature = 0.6
top_k = 80
apply_attention_prior = True
prior_epsilon = 0.1

Модели, споменати в тази статия 1

Пространства, споменати в тази статия 1

Общност

Качвайте изображения, аудио и видеоклипове чрез плъзгане в текстовото поле, поставяне или щракване тук.
Докоснете или поставете тук, за да качите изображения

· Регистрирайте се или влезте в профила си, за да коментирате

Модели, споменати в тази статия 1

Пространства, споменати в тази статия 1

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от Hugging Face на

Прочетете оригинала в Hugging Face ↗

Текстът и изображенията са собственост на Hugging Face и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини