Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

NVIDIA випустила Nemotron 3 Diarization: модель із відкритими вагами та 100 млн параметрів, яка відстежує 8 мовців у реальному часі

NVIDIA випустила Nemotron 3 Diarization — модель діаризації мовців із відкритими вагами на Hugging Face. Вона відповідає на одне запитання про будь-яку розмову: хто і коли говорив. Модель зі 100 млн параметрів відстежує до 8 мовців, зокрема коли їхні голоси перекриваються. Одна контрольна точка підтримує як офлайн-записи, так і потокову обробку в реальному часі.

Чи придатна вона для розгортання? Так. Ваги випущено за умовами ліцензії OpenMDW 1.1, яка дозволяє комерційне використання. Модель працює в Linux через NVIDIA NeMo, використовуючи графічні процесори Ampere, Ada Lovelace, Hopper або Blackwell.

Навіщо потрібна діаризація мовців?

Автоматичне розпізнавання мовлення (ASR) надає вам слова. Але воно не повідомляє, хто їх сказав. Без атрибуції система узагальнення не може визначити, хто взяв на себе зобов’язання або хто висловив заперечення.

Діаризація визначає часові інтервали, упродовж яких активний кожен мовець. Ці часові мітки поєднуються з результатами ASR, утворюючи транскрипт із зазначенням мовців. Інструменти для зустрічей, аналітика дзвінків, подкаст-пайплайни та пам’ять голосових агентів — усі вони залежать від цього етапу.

Що змінилося порівняно зі Streaming Sortformer

Попередня контрольна точка NVIDIA Streaming Sortformer, diar_streaming_sortformer_4spk-v2.1, підтримувала 4 мовців. Nemotron 3 Diarization подвоює це обмеження до 8. Згідно з повідомленням NVIDIA, модель орієнтована на складний багатосторонній аудіозапис, де люди говорять одночасно.

Як працює архітектура

Модель приймає одноканальне аудіо з частотою 16 кГц у форматах .wav, .flac, .opus або .mp3. Вона перетворює аудіо на ознаки мел-спектрограм із кроком 10 мс. Ознаки об’єднуються з коефіцієнтом 8, у результаті чого утворюються кадри енкодера тривалістю 80 мс.

Ці кадри обробляє 31-шаровий енкодер Transformer із ротарними позиційними вбудовуваннями (RoPE). Потім шар Conv1D підвищує частоту дискретизації прогнозів до роздільності 10 мс. Результатом є тензор [T, 8] із імовірностями активності кожного мовця.

Ця конструкція безпосередньо обробляє перекривання мовлення. Якщо 2 людини говорять одночасно, у тому самому кадрі активуються 2 канали.

Модель використовує підхід Sortformer, упорядковуючи мовців за часом їхньої появи. Перший новий голос отримує канал 1, наступний — канал 2 і так далі. Це забезпечує стабільність міток між потоковими фрагментами, тому моделі не потрібно повторно зіставляти мовців із каналами для кожного фрагмента.

Потокова обробка використовує 2 механізми пам’яті. Кеш мовців за порядком появи (AOSC) зберігає інформацію про мовців із попередніх фрагментів. Черга FIFO надає контекст останніх кадрів. Мітки є анонімними, а їхнє зіставлення зі справжніми особами залишається завданням наступних застосунків.

4 режими затримки

Затримка вхідного буфера дорівнює (розмір фрагмента + правий контекст) × 80 мс. У таблиці наведено DER для повного набору DIHARD III і пропускну здатність, скомпільовану для batch-32, з картки моделі.

КонфігураціяЗатримка буфераDER DIHARD IIIRTFx (batch 32, скомпільовано)
Офлайн-режим30.4 с12.73%15,113×
Низька затримка1.04 с13.18%865×
Дуже низька затримка0.64 с13.28%579×
Наднизька затримка0.32 с13.55%292×

Ця затримка не враховує час обчислень, роботи мережі та ASR. Технічно модель може працювати з буфером 80 мс, але найнижче рекомендоване значення становить 0.32 с.

Результати бенчмарків

У початкових результатах Diarization-Bench від Voice Arena модель посіла перше місце серед 12 систем і 17 конфігурацій. Тест охоплював 139 англомовних розмов загальною тривалістю близько 22 годин. Вона продемонструвала DER 14.72% проти 19.3% у системи, що посіла друге місце, — приблизно на 24% менше у відносному вираженні. NVIDIA зазначає, що ці результати можуть змінитися після завершення Voice Arena оцінювання версії 1.

Порівняно з базовою моделлю для 4 мовців із затримкою 1.04 с показник DER знизився в усіх 8 умовах оцінювання. Відносне зниження становило від 9.0% для CALLHOME-Part2 до 65.2% для NOTSOFAR1 MHM. Середнє без зважування для 8 умов становило 41.0%.

Є один регрес. У випадку з 2 мовцями CALLHOME і затримкою 30.4 с DER зріс із 5.68% до 5.98%. Для повного набору CALLHOME-Part2 показник усе ж покращився — з 10.32% до 9.10%.

Пропускна здатність також зросла. За затримки 30.4 с модель досягла 15,113× RTFx проти 2,619× у базової моделі. Тести проводилися у форматі BF16 на NVIDIA RTX PRO 5000 із використанням torch.compile(). Це пакетні показники, а не затримка застосунку для одного потоку.

Дані для навчання

Для навчання було об’єднано близько 10 000 годин реальних розмов із 82 611 годинами змодельованих сумішей із кількома мовцями. До набору увійшло реальне багатомовцеве аудіо, ліцензоване в David AI. Додавання даних David AI зменшило складений DER із 11.19% до 10.42%. Ліцензовані вихідні аудіодані для змодельованих сумішей охоплюють 21 мову.

Початок роботи

Встановіть NVIDIA NeMo Speech із Python 3.12 або новішої версії:

Копіювати кодСкопійованоВикористати інший браузер
uv pip install 'nemo-toolkit[asr]'
Копіювати кодСкопійованоВикористати інший браузер
from nemo.collections.asr.models import SortformerEncLabelModel
diar_model = SortformerEncLabelModel.from_pretrained("nvidia/Nemotron-3-Diarization")
diar_model.eval()
segments = diar_model.diarize(audio=["conversation.wav"], batch_size=1)

Вихідні сегменти мають формат start end speaker_id. Щоб отримати також слова, поєднайте модель із Parakeet TDT 0.6B v3, використовуючи посібник з інтеграції ASR.

Живий демопростір пропонує синтетичні розмови, живий мікрофон, багатомовний живий мікрофон і завантаження аудіо. Для продакшн-використання NVIDIA зазначає Baseten і DigitalOcean. Підтримка роботи на пристрої доступна через Argmax Pro SDK 3. Модель поки що недоступна через провайдерів Inference Providers на Hugging Face.

Модель має обмеження. Записи з понад 8 мовцями можуть призвести до пропуску або неправильного призначення мовлення. Сильний шум, реверберація та запис із великої відстані також можуть підвищити рівень помилок.

Інтерактивне пояснення

Ключові висновки

  • Модель зі 100 млн параметрів і відкритими вагами відстежує до 8 мовців, які можуть говорити одночасно.
  • Одна контрольна точка охоплює все: від офлайн-режиму (30.4 с) до потокової обробки з наднизькою затримкою 0.32 с.
  • Посіла перше місце в початковому Diarization-Bench від Voice Arena із DER 14.72%.
  • У середньому забезпечує відносне зниження DER на 41.0% порівняно зі Streaming Sortformer за затримки 1.04 с.
  • Ліцензія OpenMDW-1.1 дозволяє комерційне використання; модель працює на графічних процесорах NVIDIA через NeMo.

Ознайомтеся з вагами моделі, технічним блогом і демоверсією. Уся заслуга належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту 150k+ ML та підписатися на нашу розсилку. Зачекайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Потрібне партнерство з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини