Sakhanda Wire
NVDA $218.35 -2.51% MSFT $505.80 +1.16% GOOGL $354.10 -0.06% META $592.91 +0.14% AMZN $276.91 +0.89%
← К новостям

Создавайте мультиязычных голосовых агентов с низкой задержкой: открытые веса и полный контроль над развертыванием с NVIDIA Magpie TTS

Создавайте мультиязычных голосовых агентов с низкой задержкой: открытые веса и полный контроль над развёртыванием с NVIDIA Magpie TTS
Для бизнеса + Статья
Опубликовано 10 августа 2026 г.
newsletter-speech-ai-customer-600x600 (4)

У каждого голосового взаимодействия есть бюджет задержки.

К тому времени, когда пользователь слышит ответ вашего приложения, вы уже потратили драгоценные миллисекунды на захват аудио, расшифровку речи, запуск LLM, извлечение контекста и генерацию ответа. Синтез речи (TTS) — последний этап, который пользователи замечают сильнее всего. Если генерация речи идёт медленно, медленным кажется весь процесс.

Чем большую часть этого конвейера вы можете запускать и настраивать самостоятельно, тем больше бюджета задержки возвращается в ваше распоряжение.

Голосовой ИИ развивается стремительно. Интегрированные речевые модели обеспечивают простоту — один вызов API, аудио на входе и аудио на выходе, — но взамен ограничивают возможность настраивать каждый компонент под свой домен, заменять его на более совершенные модели по мере их появления, обеспечивать хранение данных в нужном регионе и точно понимать источник задержки. Для большего контроля каскадная архитектура — совместная работа специализированных компонентов ASR, TTS и LLM — позволяет независимо настраивать каждый слой и развёртывать его на собственной инфраструктуре.

Мультиязычный TTS NVIDIA Magpie создан именно для этого. Благодаря открытым весам, готовому к эксплуатации NVIDIA NIM и поддержке 12 языков вы можете развернуть мультиязычную речь внутри собственной инфраструктуры, оптимизировать задержку под свою рабочую нагрузку и адаптировать модель под свой домен — от начала до конца, в собственной среде.

Последний выпуск расширяет мультиязычное покрытие за счёт современного литературного арабского, корейского и бразильского португальского, одновременно повышая качество для многих уже поддерживаемых языков благодаря обновлённым обучающим данным и улучшениям модели.

Создаёте ли вы агентов поддержки клиентов, медицинских ассистентов, корпоративных копилотов, системы перевода или приложения разговорного ИИ — Magpie предоставляет открытую основу для голосового ИИ промышленного уровня.

Голосовой ИИ по умолчанию становится мультиязычным

Современные голосовые приложения не ограничиваются одним языком.

Глобальная поддержка клиентов, корпоративные ассистенты, медицинская документация, автоматизация розничной торговли и процессы перевода всё чаще требуют естественных разговоров на нескольких языках — при сохранении низкой задержки.

Поддержка большего числа языков — лишь часть задачи. Разработчикам также необходимо уметь:

  • развёртывать решения там, где находятся их данные
  • соблюдать требования корпоративной конфиденциальности
  • настраивать произношение и голоса
  • предсказывать задержку при рабочих нагрузках промышленного уровня
  • масштабировать решения на собственной инфраструктуре

Открытые модели меняют возможности по каждому из этих направлений.

Одна открытая модель, двенадцать языков

Magpie TTS Multilingual — модель с открытыми весами и 364 млн параметров, поддерживающая:

английский · испанский · французский · немецкий · итальянский · вьетнамский · китайский (мандарин) · хинди · японский · современный литературный арабский (новый) · корейский (новый) · бразильский португальский (новый)

Для каждого языка доступны голоса мужчин и женщин благодаря общей мультиязычной репрезентации говорящих.

Этот выпуск также повышает гибкость при работе с несколькими языками благодаря расширенной поддержке переключения между языками для хинди и японского, реализованной с помощью обработки графем в фонемы на основе IPA и пользовательских словарей произношения. Это упрощает корректное произношение имён, технической терминологии и смешанного языкового контента.

Вместо поддержки отдельных моделей TTS для разных регионов разработчики могут создавать мультиязычные приложения на единой открытой основе.

Задержка, которую действительно замечают пользователи

В разговорном ИИ синтез речи — последний этап перед тем, как пользователь услышит ответ. Поэтому время до первого аудио (TTFA) — задержка между началом генерации речи и поступлением первого аудиофрагмента к пользователю — одна из важнейших метрик задержки в голосовом конвейере.

Поскольку Magpie TTS можно развернуть внутри собственной среды, измеряемая задержка представляет собой серверную задержку, которую вы действительно контролируете, без учёта задержки обмена с управляемым сервисом.

Графический процессор TTFA для 1 потока RTFX для 1 потока TTFA для 64 потоков RTFX для 64 потоков
B200 32 мс 12.1× 239 мс 319.81×
H100 47 мс 14.7× 275 мс 290.79×
DGX Spark 53 мс 9.8× 962 мс 75.88×
A100 79 мс 12.2× 395 мс 197×

Источник: документация по производительности NVIDIA TTS NIM (v26.07), среднее значение трёх испытаний, локальное развёртывание.
TTFA = задержка до первого аудио; RTFX = пропускная способность как кратное значение реального времени.

При значении TTFA 32 мс на B200 у Magpie остаётся остальная часть бюджета задержки для ASR и обработки LLM — это позволяет удерживать общую сквозную задержку в пределах менее 200 мс, необходимых для естественного разговора. На графических процессорах NVIDIA Magpie генерирует первое аудио за 32–79 мс в одном потоке. При 64 параллельных потоках B200 достигает TTFA 239 мс, обеспечивая пропускную способность в 320 раз выше реального времени: аудио генерируется более чем в 300 раз быстрее скорости его воспроизведения даже при параллельной нагрузке.

В таблице выше показана работа Magpie в качестве NVIDIA NIM, измеренная при локальном развёртывании — в оптимизированном контейнере, запущенном на вашем графическом процессоре. Открытая контрольная точка на Hugging Face — это та же модель и ваш путь для исследований и тонкой настройки; NIM — оптимизированный стек обслуживания, обеспечивающий такие показатели задержки в промышленной эксплуатации. Оба варианта работают на оборудовании, которое вы контролируете.

Поскольку модель работает на вашей собственной инфраструктуре, вы можете напрямую оценивать производительность, настраивать её под своё развёртывание и масштабировать в соответствии с рабочей нагрузкой. Для голосовых агентов реального времени именно это определяет разницу между отзывчивым и запаздывающим диалогом.

Оптимизация для генерации речи в реальном времени

Низкая задержка не возникает случайно. Magpie внедряет два взаимодополняющих архитектурных улучшения, которые сокращают время вывода, сохраняя качество речи.

Объединение кадров. Декодер предсказывает два аудиокадра на каждом шаге декодирования вместо одного. Это вдвое сокращает число итераций декодера, уменьшая время генерации и повышая пропускную способность.

Локальный трансформер. Само по себе объединение кадров снизило бы качество аудио, создавая зависимости между одновременно генерируемыми токенами кодбука. Локальный трансформер моделирует эти зависимости и уточняет сгенерированное аудио, возвращая качество, которым пришлось бы пожертвовать из-за объединения кадров.

Вместе эти методы обеспечивают и более быструю генерацию, и естественный синтез речи. Архитектура описана в работе Frame-Stacked Local Transformers for Efficient Multi-Codebook Speech Generation (ICASSP 2026).

Высокая скорость не имеет значения, если речь звучит неестественно

Этот выпуск не только добавляет новые языки, но и повышает качество синтеза для многих уже поддерживаемых языков. По сравнению с предыдущим выпуском Magpie демонстрирует снижение частоты ошибок на уровне символов (CER) и более высокое сходство голосов (SSIM) для нескольких языков; наиболее заметные улучшения отмечены для французского и испанского:

Язык CER (предыдущая версия) CER (этот выпуск) SSIM (предыдущая версия) SSIM (этот выпуск)
Французский 2.70% 1.54% 0.703 0.747
Испанский 1.14% 0.60% 0.715 0.793
Немецкий 0.66% 0.80% 0.626 0.742

Источник: карточка мультиязычной модели Magpie TTS. Чем ниже CER, тем лучше; чем выше SSIM, тем лучше.

Недавно добавленные модели для арабского (CER 1.62%), корейского (2.69%) и бразильского португальского (2.91%) задают базовый уровень качества для будущих улучшений.

Хотя объективные метрики помогают измерять прогресс, качество речи в конечном счёте воспринимается на слух. Вы можете сами услышать разницу на NVIDIA Build или в демонстрации Hugging Face.

Почему открытые веса важны

Измеряемая задержка полезна. Но ещё лучше — задержка, которую можно контролировать.

Открытые веса дают разработчикам возможности, связанные с владением развёртыванием. С Magpie вы можете:

  • развёртывать решения на контролируемой инфраструктуре — полностью работать внутри собственной инфраструктуры, включая частные среды и среды без подключения к внешним сетям.
  • контролировать бюджет задержки — без обмена данными с управляемым сервисом, с прямой оптимизацией под своё оборудование и рабочую нагрузку.
  • настраивать произношение и голоса — выполнять тонкую настройку с помощью NeMo под собственный бренд, отраслевую лексику или данные говорящих.
  • масштабировать решения на своих условиях — оптимизировать стек обслуживания под свою инфраструктуру и рабочую нагрузку.
  • сохранять корпоративный контроль — хранить конфиденциальные разговоры и данные клиентов внутри собственной среды.

Для компаний, создающих голосовой ИИ промышленного уровня, именно такой контроль над развёртыванием, производительностью и настройкой зачастую имеет наибольшее значение.

Создавайте полноценных голосовых агентов, а не только улучшайте речь

Голосовой ИИ в промышленной эксплуатации — это система моделей, а не одна модель. Magpie TTS входит в состав примера разработчика NVIDIA Nemotron Voice Agent — эталонной реализации, демонстрирующей, как специализированные модели речи, языка и рассуждений работают вместе как согласованная система. Это позволяет создавать постоянно доступных голосовых агентов, а не просто улучшать звучание речи.

Разработчики могут объединить:

  • Nemotron Speech для потокового распознавания речи
  • Magpie TTS для естественного мультиязычного синтеза речи
  • языковые и мультимодальные модели Nemotron для рассуждений, вызова инструментов и мультимодального понимания
  • NVIDIA NIM для оптимизированных под графические процессоры микросервисов вывода, готовых к промышленной эксплуатации
  • NeMo для настройки и тонкой настройки

Пример разработчика Nemotron Voice Agent предоставляет сквозную эталонную реализацию, которую разработчики могут клонировать, настраивать и развёртывать за несколько часов. Он включает готовые для промышленной эксплуатации шаблоны:

  • переговоры в реальном времени с возможностью прерывания
  • мультимодальных голосовых агентов с пониманием изображений
  • оркестрацию нескольких агентов и вызов инструментов
  • мультиязычное голосовое взаимодействие
  • сквозную задержку менее секунды с использованием NVIDIA NIM

Вместо сборки отдельных компонентов с нуля разработчики могут начать с полноценной эталонной архитектуры и адаптировать её под собственные приложения.

Начало работы

Попробуйте модель

Разверните в промышленной среде

Адаптируйте под свой домен

Создавайте полноценных голосовых агентов

Открытые веса и лицензия

Рекомендуемая конфигурация вывода:

cfg_scale = 2.5          
temperature = 0.6
top_k = 80
apply_attention_prior = True
prior_epsilon = 0.1

Модели, упомянутые в этой статье 1

Пространства, упомянутые в этой статье 1

Сообщество

Загружайте изображения, аудио и видео, перетаскивая их в текстовое поле, вставляя или нажимая здесь.
Нажмите или вставьте сюда, чтобы загрузить изображения

· Зарегистрируйтесь или войдите, чтобы оставить комментарий

Модели, упомянутые в этой статье 1

Пространства, упомянутые в этой статье 1

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием Hugging Face

Читать оригинал на Hugging Face ↗

Текст и изображения принадлежат Hugging Face и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости