Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

NVIDIA випустила NemotronLabs VoiceChat 11B: відкриту повнодуплексну модель перетворення мовлення в мовлення зі зміною реплік за ~450 мс і викликом інструментів у реальному часі

NVIDIA випустила NemotronLabs VoiceChat 11B — відкриту наскрізну модель перетворення мовлення в мовлення з 11 млрд параметрів для діалогу в реальному часі та повнодуплексної розмови. Замість об’єднання ASR, LLM і TTS у ланцюжок вона виконує потокове розуміння та генерацію мовлення в одній уніфікованій мережі. Це усуває потребу в оркестрації кількох моделей і передачі даних між API, необхідних каскадній архітектурі, та скорочує наскрізну затримку: виміряна затримка плавної зміни реплік становить 448 мс у Full-Duplex-Bench 1.0. Модель слухає, водночас розмовляючи, тож користувач може перебити її посеред репліки, а агент поступиться чергою; коефіцієнт перехоплення становить 1,00 при 480 мс. Це також перша відкрита повнодуплексна модель із підтримкою виклику інструментів під час безперервної розмови: вона використовує окремий вихідний канал для скриптів <TOOLCALL>, а також визначені оператором фрази «на утриманні», які заповнюють паузу під час виконання API.

Чи можна її розгорнути?

ЧАСТКОВО — сьогодні придатна для пілотних проєктів, але не для продуктивного використання. Ваги моделі та контейнер є загальнодоступними, а ліцензія має дозвільний характер. Однак команда NVIDIA зазначає, що чекпойнт «готовий лише для дослідницьких цілей», а документація репозиторію описує реальні проблеми: обмеження аудіоконтексту у дві хвилини, деградацію до невідновного набору безглуздих слів після кількох реплік, неконтрольоване проговорювання моделлю власних реплік після завершення ходу та пропуск слів у транскрипції користувача.

  • Які компанії: будь-яка команда, здатна виділити один GPU щонайменше з 80 ГБ відеопам’яті — A100, H100, RTX 6000 Pro або B200 на x86_64 Linux. До них належать стартапи, що розробляють AI-рішення як основу продукту, фінансовані компанії на етапі масштабування, корпоративні відділи R&D та інноваційні лабораторії, постачальники хмарних GPU-ресурсів і університетські групи, що досліджують мовлення. Розміщеного API немає, і жоден провайдер інференсу наразі не обслуговує модель, тож команди без доступу до GPU не зможуть її оцінити.
  • Галузі: контакт-центри та платформи CX, автомобільні асистенти в салоні, роздрібна торгівля та замовлення на автокасах, модернізація телекомунікаційних IVR-систем, ігри та діалоги NPC, а також інструменти доступності.
  • Застосування: голосові агенти, здатні реагувати на перебивання, голосові інтерфейси для внутрішніх API, асистенти з пошуком даних у реальному часі (погода, ціни, статус замовлення) та засоби тестування дуплексної затримки.

Архітектура

Модель є гібридом Mamba/Transformer, зібраним із трьох наявних компонентів NVIDIA та одного нового вихідного каналу:

  • Мовленнєвий енкодер Fast Conformer із Nemotron-Speech-Streaming-En-0.6b, який безперервно кодує вхідний потік із частотою 16 кГц.
  • Базова LLM-модель NVIDIA Nemotron Nano v2, яка обробляє аудіотокени та прогнозує текстові токени.
  • Декодер і кодек TTS NVIDIA, які прогнозують аудіокоди, що відтворюються як мовлення агента з частотою 22,05 кГц.
  • Окремий вихідний канал, призначений для скриптів виклику інструментів.

Вихідні дані включають аудіо агента, текст агента та поточну транскрипцію мовлення користувача. Для навчання використано приблизно 550 тис. годин аудіо з реальних і синтетичних корпусів на основі SALM-Duplex і Audio Flamingo 3.

Виклик інструментів без тиші в ефірі

Виклики інструментів передаються бічним каналом у вигляді блоку <TOOLCALL>; ваш код повертає результати в блоці <TOOL_RESPONSE>. Важливим елементом є повідомлення на утриманні: для кожного інструмента оператор визначає фразу, яку агент вимовляє в момент, коли модель генерує текст, що запускає виклик, тож розмова не замовкає під час роботи API.

Обмеження чітко визначені. NVIDIA рекомендує використовувати не більше п’яти інструментів за сеанс, модель не може надійно викликати кілька інструментів одночасно, а користувач не може перебити агента під час виконання інструмента. Системні підказки та відповіді інструментів мають містити лише символи ASCII і бути придатними для TTS.

Продуктивність

У Full-Duplex-Bench 1.0: TOR плавної зміни реплік — 0,82 при 448 мс, TOR переривання користувачем — 1,00 при 480 мс, а TOR обробки пауз становить 0,153 (синтетичний набір) і 0,255 (Candor), де менше значення є кращим.

У AU Harness для голосового виклику інструментів BFCL-v3: 58,5% для простих, 62,5% для множинних, 42,5% для паралельних, 27,5% для паралельних множинних, 89,6% для нерелевантних запитів, середній показник — 56,1%. У Full-Duplex-Bench v3: 82,5% вибору інструмента, 44,2% точності аргументів, 33% pass@1.

NVIDIA повідомляє, що модель посідає 2-ге місце серед відкритих повнодуплексних моделей у VoiceBench і 2-ге місце серед відкритих моделей у Full-Duplex-Bench 1.0.

Інтерактивне пояснення

Ключові висновки

  • Одна модель із 11 млрд параметрів замінює ланцюжок ASR → LLM → TTS, забезпечуючи виміряну затримку зміни реплік 448 мс.
  • Перша відкрита повнодуплексна модель із викликом інструментів, що використовує бічний канал і визначені оператором повідомлення на утриманні.
  • Ваги поширюються за дозвільною ліцензією OpenMDW-1.1, але NVIDIA позначає чекпойнт як призначений лише для досліджень.
  • Потрібен один GPU із 80 ГБ; розміщеного API наразі немає.

Ознайомтеся з карткою моделі на Hugging Face, GitHub (NeMo Speech) і контейнером NGC. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання з понад 150 тис. учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібне партнерство з нами для просування вашого репозиторію на GitHub, сторінки на Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини