Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Nvidia пусна безплатен модел със 100 млн. параметъра, който разпознава до осем говорители в реално време

Nvidia пуска безплатен модел със 100 милиона параметъра, който идентифицира до осем говорители в реално време
Джонатан Кемпър
27 септември 2026 г.

Nvidia пусна Nemotron 3 Diarization — модел с изкуствен интелект, който идентифицира кой говорител говори във всеки даден момент от разговора. Моделът има около 100 милиона параметъра, а теглата му са свободно достъпни. Той може да различава до осем говорители и да открива кога няколко души говорят едновременно. Повече участници, силен фонов шум или реверберация повишават процента грешки. В комбинация със система за разпознаване на реч като Parakeet моделът може да създава транскрипции с етикети на говорителите, макар че те са само анонимни, например „speaker_2“. Той работи както със записи, така и със звук на живо.

Стълбовидна диаграма: сравнение на дванадесетте модела за синтез на диалози на английски език в бенчмарка VoiceArena; NVIDIA Nemotron 3 постига най-добрия резултат от 14,7%.
В бенчмарка VoiceArena Diarization Benchmark v1 свободно достъпният Nemotron 3 заема първо място с DER от 14,7% и превъзхожда предшественика си Streaming Sortformer с 41%.

Аудиобуферът може да бъде настроен на четири нива — от 30,4 до 0,32 секунди. По-кратките буфери обикновено намаляват точността. В Diarization-Bench на VoiceArena моделът в момента заема първо място с процент грешки от 14,72%, пред следващата най-добра система с 19,3%. Бенчмаркът е строг. Отчитат се припокриващите се изказвания, а дори и минималните разминавания при преходите между говорителите се оценяват като грешки. В сравнение с предшественика си Streaming Sortformer новият модел намалява процента грешки средно с 41% в осем тестови сценария при използване на буфер от 1,04 секунди.

Новини за изкуствения интелект без сензации – подбрани от хора

Абонирайте се за THE DECODER, за да четете без реклами, да получавате седмичен бюлетин за изкуствения интелект и нашия ексклузивен обзор на новостите „AI Radar“ шест пъти годишно, както и пълен достъп до архива и секцията за коментари.

Източник: Hugging Face

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от The Decoder на

Прочетете оригинала в The Decoder ↗

Текстът и изображенията са собственост на The Decoder и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

The Decoder Изследователи свързаха GPT-6 Astra директно към робот и го оставиха да подреди непозната кухня The Decoder OpenAI заявява, че 80–90% от изследванията му вече са насочени към GPT 7 и следващите версии The Decoder Десетки хиляди проверки за сигурността показват, че инцидентът с Hugging Face на OpenAI е бил само началото The Decoder Goldman Sachs очаква Big Tech да похарчи $1,2 трилиона за инфраструктура за изкуствен интелект до 2027 г., надминавайки многократно оценките на Wall Street MarkTechPost AI агенти за програмиране в предприятията: обезщетяване при нарушения на интелектуална собственост, локализация на данните и сравнение на разходите за 500 места MarkTechPost Ръководство за кодиране на MSEB на Google Research: създаване на звукови енкодери според изискванията на бенчмарка и оценяването им за класификация, клъстеризация, извличане и сегментация

Всички последни новини