Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

Meta Superintelligence Labs представя Muse Voice Transcribe: един модел в реално време за поточно разпознаване на реч, диаризация и определяне края на речта

Повечето производствени гласови стекове представляват три системи, свързани една с друга. Единият модел транскрибира, вторият разделя говорителите, а детекторът определя кога потребителят е спрял да говори. Всяко предаване добавя латентност и нов източник на грешки.

Muse Voice Transcribe, представен тази седмица от Meta Superintelligence Labs, обединява тези три задачи в един авторегресивен модел. Meta го нарича своя първи модел за възприемане на аудио в реално време. Той извършва поточна ASR, диаризация на говорители за 20+ говорители и определяне на края на изказването в един проход, без необходима последваща обработка.

Може ли да бъде внедрен? Да, но само като хостван API. Той е наличен в Meta Model API като muse-voice-transcribe-1.0 на цена от 3,00 долара за 1 000 аудиоминути (0,18 долара на час) и вече захранва диктовката в Meta AI за Mac и Muse Code. Теглата не са публикувани, така че няма възможност за самостоятелно хостване.

Поточната ASR като основа

Muse Voice Transcribe е авторегресивен мултимодален модел от семейството Muse Spark. Аудиото постъпва на части от по 80 ms при честота 12,5 Hz. Всяка част се преобразува в един мек токен.

След всяка част моделът прави един двоичен избор. Той или предсказва токен <|next_audio|> и продължава да слуша, или излъчва текстов токен. Когато моделът предскаже <|next_audio|>, този токен се заменя с действителната следваща аудиочаст в подадения вход. Когато потокът приключи, се вмъква токен <|empty_audio|> и моделът изписва целия оставащ текст, без да изисква още аудио.

Слушането и писането споделят един цикъл на декодиране, така че няма отделен етап за подравняване, който да се отклонява.

Адаптивно закъснение, обучено с RL

Тъй като моделът контролира кога слуша, той контролира и какъв аудиоконтекст стои зад всяка дума. Meta нарича тази разлика „закъснение“. По-дългото закъснение означава по-точен транскрипт и по-висока латентност.

Вместо да фиксира този компромис, Meta обучава модела да го управлява. Обучението с подсилване комбинира мултипликативно награда за процента грешки в думите и награда за закъснението, създавайки политика, която променя закъснението за всяка дума според трудността. Meta съобщава, че това поставя модела на границата на Парето по отношение на скоростта и точността, измерени чрез времето до окончателната транскрипция, пред предишната граница, формирана от системите на Soniox, Cartesia и ElevenLabs.

Диаризацията и определянето на края на изказването са още токени

Meta не е добавила втори модел за приписване на репликите на говорители. Вместо това е добавила специални токени към същия поток.

При диаризацията токенът <|start_of_turn|> маркира потенциална смяна на говорителя, а тагът <|speaker_{A-Z}|> идентифицира говорителя. Токенът за начало на реплика се активира веднага щом е възможна смяна, докато тагът за говорителя се забавя до края на частта. Аудиото от един говорител може да бъде разделено на няколко сегмента, които в крайна сметка получават един и същ таг.

При определянето на края на изказването <|speech_onset|> маркира началото на речта, а <|speech_endpoint|> маркира момента, в който потребителят е приключил. И двете задачи се обучават съвместно с поточната ASR, като върху наградата за ASR се наслагват допълнителни награди.

Възможности

Моделът е обучен на 70+ езика, от които 25 са подробно проверени и препоръчани при стартирането. Превключването между езици е вградено както в рамките на едно изречение, така и между изреченията, което е важно за двуезичните говорители, които сменят езика по средата на фразата. Точността може да бъде допълнително подобрена чрез задаване на език, ключови думи и контекст.

Обработката на дълъг контекст е практическо предимство. Meta посочва, че моделът поддържа естествено аудиовход с продължителност над един час и 20+ говорители, без необходима последваща обработка.

Бенчмаркове

Meta съобщава за първо място в Artificial Analysis при поточно преобразуване на реч в текст и в публични бенчмаркове за диаризация към 1 септември 2026 г.

В Artificial Analysis AA-WER Streaming Muse Voice Transcribe постига 3,1% WER за окончателния транскрипт при 0,16 сек. след края на речта. Cartesia Ink-2 със семантични крайни точки постига 3,4% при 0,43 сек. ElevenLabs Scribe v2 Realtime постига 3,6% при 0,14 сек. Cartesia Ink-2 с външни крайни точки е най-бързият модел при 0,07 сек., но е най-неточен — 4,0%. При първия частичен транскрипт Muse Voice Transcribe постига 3,6% WER при 0,13 сек.

При диаризацията Meta съобщава за среден процент грешки при диаризацията от 17,5% в AMI-IHM, AMI-SDM и VoxConverse. Пет други системи в същата графика са в диапазона от 21,1% до 28,6%.

Цената е другият показател. При 3,00 долара за 1 000 минути той е по-евтин от Cartesia Ink-2, който струва 4,00 долара, и е по-малко от половината от цената от 6,50 долара за ElevenLabs Scribe v2 Realtime и Deepgram Flux.

Интерактивно обяснение

Основни изводи

  • Един модел извършва поточна ASR, диаризация за 20+ говорители и определяне на края на изказването.
  • 3,1% WER за окончателния транскрипт при 0,16 сек. в Artificial Analysis AA-WER Streaming.
  • Обучението с подсилване учи модела на политика за „адаптивно закъснение“ за всяка дума.
  • Обучен на 70+ езика, 25 от които са подробно проверени, с вградено превключване между езици.
  • Само API достъп на цена от 0,18 долара за аудиочас. Няма отворени тегла.

Вижте блога за изследвания на Meta AI, AI at Meta в X, Artificial Analysis и страницата на модела в Meta Model API. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризирането на вашето GitHub хранилище ИЛИ страница в Hugging Face, ИЛИ продуктова версия, ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини