Nvidia выпустила бесплатную модель со 100 млн параметров, которая в реальном времени распознаёт до восьми говорящих
Nvidia выпустила Nemotron 3 Diarization — модель ИИ, которая в любой момент разговора определяет, кто именно говорит. Модель содержит около 100 миллионов параметров, а её веса доступны бесплатно. Она может различать до восьми говорящих и определять моменты, когда несколько людей говорят одновременно. При большем числе участников, сильном фоновом шуме или реверберации уровень ошибок возрастает. В сочетании с системой распознавания речи, такой как Parakeet, модель может создавать расшифровки с метками говорящих, хотя это будут лишь анонимные обозначения вроде «speaker_2». Она работает как с записями, так и с аудио в реальном времени.

Буфер аудио можно настроить на один из четырёх уровней — от 30,4 до 0,32 секунды. Более короткие буферы обычно снижают точность. В бенчмарке Diarization-Bench от VoiceArena модель в настоящее время занимает первое место с уровнем ошибок 14,72%, опережая следующую по качеству систему с результатом 19,3%. Бенчмарк отличается строгими критериями. Ошибками считаются пересекающаяся речь и даже малейшие неточности на переходах между говорящими. По сравнению со своей предшественницей Streaming Sortformer новая модель в среднем снижает уровень ошибок на 41% в восьми тестовых сценариях при использовании буфера длительностью 1,04 секунды.
Новости ИИ без хайпа — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный аналитический отчёт о передовых разработках «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.