Nvidia пусна безплатен модел със 100 млн. параметъра, който разпознава до осем говорители в реално време
Nvidia пусна Nemotron 3 Diarization — модел с изкуствен интелект, който идентифицира кой говорител говори във всеки даден момент от разговора. Моделът има около 100 милиона параметъра, а теглата му са свободно достъпни. Той може да различава до осем говорители и да открива кога няколко души говорят едновременно. Повече участници, силен фонов шум или реверберация повишават процента грешки. В комбинация със система за разпознаване на реч като Parakeet моделът може да създава транскрипции с етикети на говорителите, макар че те са само анонимни, например „speaker_2“. Той работи както със записи, така и със звук на живо.

Аудиобуферът може да бъде настроен на четири нива — от 30,4 до 0,32 секунди. По-кратките буфери обикновено намаляват точността. В Diarization-Bench на VoiceArena моделът в момента заема първо място с процент грешки от 14,72%, пред следващата най-добра система с 19,3%. Бенчмаркът е строг. Отчитат се припокриващите се изказвания, а дори и минималните разминавания при преходите между говорителите се оценяват като грешки. В сравнение с предшественика си Streaming Sortformer новият модел намалява процента грешки средно с 41% в осем тестови сценария при използване на буфер от 1,04 секунди.
Новини за изкуствения интелект без сензации – подбрани от хора
Абонирайте се за THE DECODER, за да четете без реклами, да получавате седмичен бюлетин за изкуствения интелект и нашия ексклузивен обзор на новостите „AI Radar“ шест пъти годишно, както и пълен достъп до архива и секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.