Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

NVIDIA пусна NemotronLabs VoiceChat 11B: отворен пълнодуплексен модел за преобразуване на реч в реч с редуване на репликите за ~450 мс и извикване на инструменти в реално време

NVIDIA пусна NemotronLabs VoiceChat 11B — отворен 11B модел от край до край за преобразуване на реч в реч и разговори в реално време с пълен дуплекс. Вместо да свързва ASR, LLM и TTS, той извършва поточно разбиране и генериране на реч в една унифицирана мрежа. Това премахва необходимостта от оркестрация на множество модели и предаване между API, каквито изисква каскадната архитектура, и намалява латентността от край до край: измерената латентност при плавно редуване на репликите е 448 ms според Full-Duplex-Bench 1.0. Моделът слуша, докато говори, така че потребителят може да се намеси по средата на репликата, а агентът отстъпва, с коефициент на предаване 1,00 при 480 ms. Това е и първият отворен модел с пълен дуплекс, който поддържа извикване на инструменти, докато разговорът продължава, чрез отделен изходен канал за скриптове <TOOLCALL>, както и дефинирани от оператора реплики „при изчакване“, които запълват паузата, докато се изпълнява API заявка.

Може ли да бъде внедрен?

ЧАСТИЧНО — може да бъде внедрен днес за пилотни проекти, но не и за продукционна употреба. Теглата и контейнерът са публични, а лицензът е либерален. Екипът на NVIDIA обаче посочва, че контролният пункт е „готов само за изследователски цели“, а хранилището описва реални режими на отказ: ограничение на аудиоконтекста до две минути, влошаване до невъзстановим безсмислен говор след няколко хода, неконтролируемо самоговорене след края на репликата и пропуснати думи при транскрипцията на потребителя.

  • Кои компании: всеки екип, който може да отдели един GPU с поне 80 GB VRAM — A100, H100, RTX 6000 Pro или B200 под x86_64 Linux. Това обхваща стартъпи, създадени около AI, финансирани разрастващи се компании, корпоративни отдели за НИРД и иновации, доставчици на GPU облачни услуги и университетски групи, занимаващи се с речеви технологии. Няма хостван API и понастоящем нито един доставчик на инференс не предлага модела, така че екипи без достъп до GPU може да не успеят да го оценят.
  • Индустрии: контактни центрове и CX платформи, автомобилни асистенти в купето, търговия на дребно и поръчки на автомати за обслужване, модернизация на телекомуникационни IVR системи, игри и диалози на NPC персонажи, както и инструменти за достъпност.
  • Приложения: гласови агенти, способни да приемат намеса по време на реплика, гласови интерфейси към вътрешни API, асистенти за справки в реално време (времето, цени, статус на поръчки) и тестови системи за измерване на дуплексната латентност.

Архитектура

Моделът е хибрид Mamba/Transformer, изграден от три съществуващи компонента на NVIDIA, заедно с един нов изходен път:

  • Речев енкодер Fast Conformer от Nemotron-Speech-Streaming-En-0.6b, който непрекъснато кодира входящия поток с честота 16 kHz.
  • Ядро на LLM NVIDIA Nemotron Nano v2, което приема аудиотокени и предсказва текстови токени.
  • Декодер и кодек NVIDIA TTS, който предсказва аудиокодове, визуализирани като агентска реч с честота 22,05 kHz.
  • Отделен изходен канал, предназначен за скриптове за извикване на инструменти.

Изходите включват аудио на агента, текст на агента и текуща транскрипция на потребителя. При обучението са използвани приблизително 550 хил. часа аудио от реални и синтетични корпуси, надграждайки върху SALM-Duplex и Audio Flamingo 3.

Извикване на инструменти без мъртва тишина

Извикванията на инструменти се изпращат по страничния канал като блок <TOOLCALL>; вашият код връща резултатите в блок <TOOL_RESPONSE>. Забележителният елемент е съобщението при изчакване: за всеки инструмент операторът задава реплика, която агентът произнася в момента, в който моделът генерира текста, задействащ извикването, така че разговорът да не замлъква, докато API се изпълнява.

Ограниченията са изрично посочени. NVIDIA препоръчва максимум пет инструмента на сесия, моделът не може надеждно да извиква няколко инструмента едновременно, а потребителят не може да прекъсва агента по време на изпълнението на инструмент. Системните подсказки и отговорите на инструментите трябва да съдържат само ASCII символи и да са подходящи за TTS.

Производителност

В Full-Duplex-Bench 1.0: TOR за плавно редуване на репликите 0,82 при 448 ms, TOR за прекъсване от потребителя 1,00 при 480 ms и TOR за обработка на паузи 0,153 (синтетичен набор) и 0,255 (Candor), като по-ниската стойност е по-добра.

В AU Harness BFCL-v3 за извикване на говорими инструменти: 58,5% прости, 62,5% множество, 42,5% паралелни, 27,5% паралелни-множество, 89,6% нерелевантност, 56,1% средно. В Full-Duplex-Bench v3: 82,5% избор на инструмент, 44,2% точност на аргументите, 33% pass@1.

NVIDIA съобщава, че моделът заема второ място сред отворените модели с пълен дуплекс във VoiceBench и второ място сред отворените модели във Full-Duplex-Bench 1.0.

Интерактивно обяснение

Основни изводи

  • Един модел с 11B параметъра заменя веригата ASR → LLM → TTS при измерена латентност за редуване на репликите от 448 ms.
  • Първият отворен модел с пълен дуплекс и извикване на инструменти, използващ страничен канал и дефинирани от оператора съобщения при изчакване.
  • Теглата са с либерален лиценз OpenMDW-1.1, но NVIDIA обозначава контролния пункт като предназначен само за изследователски цели.
  • Необходим е един GPU с 80 GB; днес не съществува хостван API.

Разгледайте картата на модела в Hugging Face, GitHub (NeMo Speech) и NGC контейнера. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ продуктова премиера ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини