Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Nvidia выпустила бесплатную модель со 100 млн параметров, которая в реальном времени распознаёт до восьми говорящих

Nvidia выпускает бесплатную модель со 100 млн параметров, которая в реальном времени определяет до восьми говорящих
Jonathan Kemper
27 сен. 2026

Nvidia выпустила Nemotron 3 Diarization — модель ИИ, которая в любой момент разговора определяет, кто именно говорит. Модель содержит около 100 миллионов параметров, а её веса доступны бесплатно. Она может различать до восьми говорящих и определять моменты, когда несколько людей говорят одновременно. При большем числе участников, сильном фоновом шуме или реверберации уровень ошибок возрастает. В сочетании с системой распознавания речи, такой как Parakeet, модель может создавать расшифровки с метками говорящих, хотя это будут лишь анонимные обозначения вроде «speaker_2». Она работает как с записями, так и с аудио в реальном времени.

Столбчатая диаграмма: сравнение двенадцати моделей синтеза диалогов на английском языке в бенчмарке VoiceArena; NVIDIA Nemotron 3 показала лучший результат — 14,7%.
В бенчмарке диаризации VoiceArena Diarization Benchmark v1 бесплатная Nemotron 3 лидирует с показателем DER 14,7% и превосходит свою предшественницу Streaming Sortformer на 41%.

Буфер аудио можно настроить на один из четырёх уровней — от 30,4 до 0,32 секунды. Более короткие буферы обычно снижают точность. В бенчмарке Diarization-Bench от VoiceArena модель в настоящее время занимает первое место с уровнем ошибок 14,72%, опережая следующую по качеству систему с результатом 19,3%. Бенчмарк отличается строгими критериями. Ошибками считаются пересекающаяся речь и даже малейшие неточности на переходах между говорящими. По сравнению со своей предшественницей Streaming Sortformer новая модель в среднем снижает уровень ошибок на 41% в восьми тестовых сценариях при использовании буфера длительностью 1,04 секунды.

Новости ИИ без хайпа — отобраны людьми

Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный аналитический отчёт о передовых разработках «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.

Источник: Hugging Face

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием The Decoder

Читать оригинал на The Decoder ↗

Текст и изображения принадлежат The Decoder и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

The Decoder Исследователи подключили GPT-6 Astra напрямую к роботу и позволили ему навести порядок в незнакомой кухне The Decoder OpenAI заявляет, что 80–90% его исследований уже направлены на GPT 7 и последующие версии The Decoder Десятки тысяч проверок безопасности показывают, что инцидент OpenAI с Hugging Face был лишь началом The Decoder Goldman Sachs ожидает, что Big Tech потратит $1,2 трлн на инфраструктуру ИИ к 2027 году, значительно превысив оценки Уолл-стрит MarkTechPost ИИ-агенты для программирования в корпоративной среде: возмещение ущерба за нарушения интеллектуальной собственности, локализация данных и сравнение стоимости 500 мест MarkTechPost Руководство по кодированию для MSEB от Google Research: написание звуковых энкодеров в соответствии с требованиями бенчмарка и их оценка для классификации, кластеризации, поиска и сегментации

Все последние новости