Nvidia випустила безкоштовну модель зі 100 млн параметрів, яка в реальному часі розпізнає до восьми мовців
Nvidia випустила Nemotron 3 Diarization — модель штучного інтелекту, яка визначає, хто з мовців говорить у будь-який момент розмови. Модель має близько 100 мільйонів параметрів, а її ваги доступні безкоштовно. Вона може розрізняти до восьми мовців і визначати, коли кілька людей говорять одночасно. Більша кількість учасників, сильний фоновий шум або реверберація підвищують рівень помилок. У поєднанні з системою розпізнавання мовлення на кшталт Parakeet модель може створювати транскрипти з позначеннями мовців, хоча й лише анонімними, як-от «speaker_2». Вона працює як із записами, так і з аудіо в реальному часі.

Аудіобуфер можна налаштувати на чотири рівні — від 30,4 до 0,32 секунди. Коротші буфери зазвичай знижують точність. У Diarization-Bench від VoiceArena модель наразі посідає перше місце з рівнем помилок 14,72%, випереджаючи наступну найкращу систему з результатом 19,3%. Бенчмарк є суворим. Перекривання мовлення враховується, і навіть найменші неточності під час переходів між мовцями оцінюються як помилки. Порівняно з попередницею Streaming Sortformer нова модель у середньому знижує рівень помилок на 41% у восьми тестових сценаріях за використання буфера тривалістю 1,04 секунди.
Новини про ШІ без хайпу — добірка від людей
Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ, ексклюзивний передовий звіт «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.