Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

NVIDIA пусна Nemotron 3 Diarization: модел с отворени тегла и 100 млн. параметъра, който проследява 8 говорители в реално време

NVIDIA пусна Nemotron 3 Diarization — модел с отворени тегла за диаризация на говорители в Hugging Face. Той отговаря на един въпрос за всеки разговор: кой кога е говорил. Моделът с 100 млн. параметъра проследява до 8 говорители, включително когато гласовете се припокриват. Един контролен пункт обработва както офлайн записи, така и поточно предаване в реално време.

Може ли да бъде внедрен? Да. Теглата са публикувани под лиценза OpenMDW 1.1, който разрешава търговска употреба. Моделът работи под Linux чрез NVIDIA NeMo, използвайки графични процесори Ampere, Ada Lovelace, Hopper или Blackwell.

Защо е нужна диаризация на говорители?

Автоматичното разпознаване на реч (ASR) ви дава думите. То не ви казва кой ги е изрекъл. Без приписване на репликите към говорители обобщаващият модел не може да определи кой е поел ангажимент или кой е повдигнал възражение.

Диаризацията извежда времевите интервали, през които всеки говорител е активен. Тези времеви маркери се комбинират с резултата от ASR, за да се създаде транскрипция с посочени говорители. Инструментите за срещи, анализът на обаждания, конвейерите за подкасти и паметта на гласовите агенти зависят от тази стъпка.

Какво се промени спрямо Streaming Sortformer

Предишният контролен пункт на NVIDIA — Streaming Sortformer, diar_streaming_sortformer_4spk-v2.1 — поддържаше 4 говорители. Nemotron 3 Diarization удвоява този лимит до 8. Според съобщението на NVIDIA целта е обработка на сложен многопартиен звук, в който хората говорят едновременно.

Как работи архитектурата

Моделът приема едноканален звук с честота 16 kHz във формат .wav, .flac, .opus или .mp3. Той преобразува звука в мел-спектрограмни характеристики със стъпка от 10 ms. Характеристиките се подреждат със степен 8, което създава енкодерни кадри от 80 ms.

Енкодер Transformer с 31 слоя и ротационни позиционни вграждания (RoPE) обработва тези кадри. След това слой Conv1D повишава дискретизацията на прогнозите обратно до разделителна способност от 10 ms. Резултатът е тензор [T, 8] с вероятности за активност на всеки говорител.

Този дизайн обработва припокриването директно. Ако 2 души говорят едновременно, 2 канала се активират в същия кадър.

Моделът следва подхода на Sortformer за подреждане на говорителите според времето на появата им. Първият нов глас получава канал 1, следващият — канал 2 и т.н. Това запазва стабилността на етикетите между отделните части на потока, така че моделът да не трябва да съпоставя говорителите с каналите наново за всяка част.

Поточното предаване използва 2 механизма за запаметяване. Кешът за говорители по ред на появяване (AOSC) съхранява информация за говорителите от по-ранни части. FIFO опашка осигурява контекст от скорошни кадри. Етикетите са анонимни, а съпоставянето им с реални самоличности е оставено на приложенията надолу по веригата.

4 работни режима на латентност

Латентността на входния буфер е равна на (част + десен контекст) × 80 ms. Таблицата използва DER за пълния набор DIHARD III и компилирана пропускателна способност с batch-32 от картата на модела.

КонфигурацияЛатентност на буфераDER на DIHARD IIIRTFx (batch 32, компилиран)
Офлайн режим30.4 s12.73%15,113×
Ниска латентност1.04 s13.18%865×
Много ниска латентност0.64 s13.28%579×
Ултраниска латентност0.32 s13.55%292×

Тази латентност не включва времето за изчисления, мрежата и ASR. Технически моделът може да работи с буфер от 80 ms, но 0.32 s е най-ниската препоръчителна настройка.

Резултати от бенчмарковете

В първоначалните резултати на Voice Arena от Diarization-Bench моделът се класира на първо място сред 12 системи и 17 конфигурации. Тестът обхваща 139 разговора на английски език с обща продължителност около 22 часа. Моделът постига 14.72% DER спрямо 19.3% за следващата система в класацията — приблизително 24% относително намаление. NVIDIA отбелязва, че тези резултати може да се променят, след като Voice Arena завърши оценяването на версия 1.

Спрямо базовия модел с 4 говорители и латентност от 1.04 s, DER намалява при всичките 8 условия за оценяване. Относителните намаления варират от 9.0% при CALLHOME-Part2 до 65.2% при NOTSOFAR1 MHM. Средната стойност без претегляне за 8-те условия е 41.0%.

Има една регресия. При CALLHOME с 2 говорители и 30.4 s DER нараства от 5.68% на 5.98%. Пълният набор CALLHOME-Part2 все пак показва подобрение — от 10.32% до 9.10%.

Пропускателната способност също се увеличава значително. При 30.4 s моделът достига 15,113× RTFx спрямо 2,619× за базовия модел. Тестовете са проведени с BF16 на NVIDIA RTX PRO 5000 и torch.compile(). Това са стойности при пакетна обработка, а не латентност на приложение с един поток.

Данни за обучение

Обучението комбинира около 10 000 часа реални разговори с 82 611 часа симулирани смеси от разговори с множество говорители. Сместа включва реален многоговорителен звук, лицензиран от David AI. Добавянето на данните от David AI намалява съставния DER от 11.19% на 10.42%. Лицензираният изходен звук за симулираните смеси обхваща 21 езика.

Първи стъпки

Инсталирайте NVIDIA NeMo Speech с Python 3.12 или по-нова версия:

Копиране на кодаКопираноИзползвайте друг браузър
uv pip install 'nemo-toolkit[asr]'
Копиране на кодаКопираноИзползвайте друг браузър
from nemo.collections.asr.models import SortformerEncLabelModel
diar_model = SortformerEncLabelModel.from_pretrained("nvidia/Nemotron-3-Diarization")
diar_model.eval()
segments = diar_model.diarize(audio=["conversation.wav"], batch_size=1)

Изходните сегменти имат формата start end speaker_id. За да получите и думите, комбинирайте модела с Parakeet TDT 0.6B v3, като използвате ръководството за интеграция с ASR.

Демонстрационното пространство на живо предлага синтетични разговори, микрофон на живо, многоезичен микрофон на живо и качване на аудио. За продукционна употреба NVIDIA посочва Baseten и DigitalOcean. Поддръжка за устройства е налична чрез Argmax Pro SDK 3. Моделът все още не е достъпен чрез доставчиците на Inference на Hugging Face.

Моделът има ограничения. Записите с повече от 8 говорители могат да доведат до пропусната или неправилно приписана реч. Силният шум, реверберацията и записът от далечно поле също могат да повишат процента грешки.

Интерактивно обяснение

Основни изводи

  • Модел с отворени тегла и 100 млн. параметъра, който проследява до 8 припокриващи се говорители.
  • Един контролен пункт обхваща всичко — от офлайн обработка (30.4 s) до ултраниско латентно поточно предаване (0.32 s).
  • Класиран на първо място в първоначалния Diarization-Bench на Voice Arena с 14.72% DER.
  • Постига средно 41.0% относително намаление на DER спрямо Streaming Sortformer при 1.04 s.
  • Лицензът OpenMDW-1.1 разрешава търговска употреба; моделът работи на графични процесори NVIDIA чрез NeMo.

Разгледайте теглата на модела, техническия блог и демото. Всички заслуги принадлежат на изследователя на този проект. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хиляди членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Нуждаете се от партньор за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово издание, уебинар и др.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини