Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

NVIDIA выпустила NemotronLabs VoiceChat 11B: открытую полнодуплексную модель преобразования речи в речь со сменой реплик за ~450 мс и вызовом инструментов в реальном времени

NVIDIA выпустила NemotronLabs VoiceChat 11B — открытую сквозную модель преобразования речи в речь с 11 млрд параметров для общения в реальном времени в полнодуплексном режиме. Вместо объединения ASR, LLM и TTS в цепочку она выполняет потоковое понимание и генерацию речи в рамках единой сети. Это устраняет необходимость в оркестрации нескольких моделей и передаче данных между API, требуемых каскадной архитектурой, а также сокращает сквозную задержку: измеренная задержка плавной смены реплик составляет 448 мс в тесте Full-Duplex-Bench 1.0. Модель слушает, пока говорит, поэтому пользователь может перебить её в середине реплики, а агент уступит ему слово; коэффициент передачи хода составляет 1,00 при 480 мс. Это также первая открытая полнодуплексная модель с поддержкой вызова инструментов во время продолжающегося разговора: для скриптов <TOOLCALL> используется отдельный канал вывода, а заданные оператором реплики «на удержании» заполняют паузу, пока выполняется API-запрос.

Можно ли её развернуть?

ЧАСТИЧНО — сегодня подходит для пилотных проектов, но не для промышленной эксплуатации. Веса и контейнер опубликованы, а лицензия является разрешительной. Однако команда NVIDIA заявляет, что чекпойнт «готов только для исследовательских целей», а в репозитории документированы реальные сбои: ограничение аудиоконтекста двумя минутами, деградация до невосстанавливаемой бессмыслицы после нескольких реплик, неконтролируемый монолог после окончания хода и пропуск слов при транскрипции пользовательской речи.

  • Какие компании: любая команда, способная выделить один GPU как минимум с 80 ГБ видеопамяти — A100, H100, RTX 6000 Pro или B200 под Linux на x86_64. Это охватывает стартапы с ИИ в основе, финансируемые быстрорастущие компании, корпоративные R&D- и инновационные лаборатории, поставщиков облачных GPU-ресурсов и университетские группы, занимающиеся речевыми технологиями. Размещённого API нет, и ни один провайдер инференса пока не предоставляет эту модель, поэтому команды без доступа к GPU не смогут её оценить.
  • Отрасли: контакт-центры и CX-платформы, автомобильные ассистенты в салоне, розничная торговля и оформление заказов через drive-thru, модернизация телекоммуникационных IVR-систем, игры и диалоги NPC, а также инструменты доступности.
  • Применения: голосовые агенты с возможностью перебивания, голосовые интерфейсы для внутренних API, ассистенты с поиском данных в реальном времени (погода, цены, статус заказа) и стенды для тестирования дуплексной задержки.

Архитектура

Модель представляет собой гибрид Mamba/Transformer, собранный из трёх существующих компонентов NVIDIA и одного нового выходного канала:

  • Речевой энкодер Fast Conformer из Nemotron-Speech-Streaming-En-0.6b, который непрерывно кодирует входящий поток с частотой 16 кГц.
  • LLM-основа NVIDIA Nemotron Nano v2, которая принимает аудиотокены и предсказывает текстовые токены.
  • Декодер и кодек NVIDIA TTS, предсказывающие аудиокоды, которые преобразуются в речь агента с частотой 22,05 кГц.
  • Отдельный выходной канал, предназначенный для скриптов вызова инструментов.

На выходе формируются аудио агента, текст агента и текущая транскрипция речи пользователя. Для обучения использовалось около 550 тыс. часов аудио из реальных и синтетических корпусов на основе SALM-Duplex и Audio Flamingo 3.

Вызов инструментов без тишины

Вызовы инструментов передаются по вспомогательному каналу в виде блока <TOOLCALL>; ваш код возвращает результаты в блоке <TOOL_RESPONSE>. Важной особенностью является сообщение на удержании: для каждого инструмента оператор задаёт реплику, которую агент произносит в момент генерации моделью текста, инициирующего вызов, чтобы разговор не прерывался тишиной во время выполнения API-запроса.

Ограничения описаны явно. NVIDIA рекомендует использовать не более пяти инструментов за сеанс; модель не может надёжно вызывать несколько инструментов одновременно, а пользователь не может перебить агента во время выполнения инструмента. Системные промпты и ответы инструментов должны содержать только ASCII-символы и быть удобными для TTS.

Производительность

В тесте Full-Duplex-Bench 1.0: TOR плавной смены реплик — 0,82 при 448 мс, TOR прерывания пользователем — 1,00 при 480 мс, а TOR обработки пауз — 0,153 (синтетический набор) и 0,255 (Candor), где меньшее значение лучше.

В тесте AU Harness BFCL-v3 для вызова инструментов голосом: 58,5% для простых, 62,5% для множественных, 42,5% для параллельных, 27,5% для параллельно-множественных вызовов, 89,6% для нерелевантных запросов, в среднем 56,1%. В тесте Full-Duplex-Bench v3: 82,5% выбора инструмента, 44,2% точности аргументов, 33% pass@1.

NVIDIA сообщает, что модель занимает 2-е место среди открытых полнодуплексных моделей в тесте VoiceBench и 2-е место среди открытых моделей в Full-Duplex-Bench 1.0.

Интерактивное объяснение

Основные выводы

  • Одна модель с 11 млрд параметров заменяет цепочку ASR → LLM → TTS, обеспечивая измеренную задержку смены реплик в 448 мс.
  • Первая открытая полнодуплексная модель с вызовом инструментов, использующая вспомогательный канал и заданные оператором сообщения на удержании.
  • Веса распространяются по разрешительной лицензии OpenMDW-1.1, но NVIDIA обозначает чекпойнт как предназначенный только для исследований.
  • Требуется один GPU с 80 ГБ видеопамяти; размещённого API сегодня не существует.

Изучите карточку модели на Hugging Face, GitHub (NeMo Speech) и контейнер NGC. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с аудиторией более 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы пользуетесь Telegram? Теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости