Meta Superintelligence Labs выпустила Muse Voice Transcribe: одну модель реального времени для потокового ASR, диаризации и определения окончания речи
Большинство производственных стеков голосовых технологий представляют собой три соединённые системы. Одна модель выполняет транскрипцию, вторая разделяет говорящих, а детектор определяет, когда пользователь перестал говорить. Каждая передача данных добавляет задержку и новый источник ошибок.
Muse Voice Transcribe, представленная на этой неделе Meta Superintelligence Labs, объединяет эти три задачи в одну авторегрессионную модель. Meta называет её своей первой моделью восприятия аудио в реальном времени. Она выполняет потоковое ASR, диаризацию более чем для 20 говорящих и определение конца высказывания за один проход, без обязательной постобработки.
Можно ли её развернуть? Да, но только как размещённый API. Модель уже доступна в Meta Model API под названием muse-voice-transcribe-1.0 по цене $3,00 за 1 000 минут аудио ($0,18 в час), а также уже используется для диктовки в Meta AI для Mac и Muse Code. Веса модели не опубликованы, поэтому возможности самостоятельного хостинга нет.
Потоковое ASR как основа
Muse Voice Transcribe — мультимодальная авторегрессионная модель из семейства Muse Spark. Аудио поступает фрагментами по 80 мс с частотой 12,5 Гц. Каждый фрагмент преобразуется в один мягкий токен.
После каждого фрагмента модель делает один бинарный выбор. Она либо предсказывает токен <|next_audio|> и продолжает слушать, либо выдаёт текстовый токен. Когда модель предсказывает <|next_audio|>, этот токен заменяется фактическим следующим аудиофрагментом во входных данных. Когда поток заканчивается, вставляется токен <|empty_audio|>, и модель выдаёт весь оставшийся текст, не запрашивая дополнительные аудиоданные.
Слушание и запись используют один цикл декодирования, поэтому отдельного этапа выравнивания, который мог бы приводить к рассинхронизации, нет.
Адаптивная задержка, обученная с помощью RL
Поскольку модель сама управляет моментом прослушивания, она также управляет объёмом аудиоконтекста, стоящего за каждым словом. Meta называет этот промежуток «задержкой». Большая задержка означает более точную транскрипцию и более высокую латентность.
Вместо того чтобы фиксировать этот компромисс, Meta обучает ему модель. Обучение с подкреплением мультипликативно объединяет награду за частоту ошибок в словах и награду за задержку, формируя стратегию, которая варьирует задержку для каждого слова в зависимости от его сложности. По данным Meta, это выводит модель на фронт Парето по скорости и точности, измеряемым временем до получения итоговой транскрипции, опережая предыдущий фронт, сформированный системами Soniox, Cartesia и ElevenLabs.
Диаризация и определение конца высказывания — это дополнительные токены
Meta не стала добавлять вторую модель для определения говорящих. Вместо этого она добавила специальные токены в тот же поток.
Для диаризации токен <|start_of_turn|> обозначает возможную смену говорящего, а тег <|speaker_{A-Z}|> идентифицирует говорящего. Токен смены реплики срабатывает, как только такая смена становится возможной, тогда как тег говорящего задерживается до конца фрагмента. Аудио одного говорящего может быть разделено на несколько сегментов, которые в итоге получают один и тот же тег.
Для определения конца высказывания <|speech_onset|> обозначает начало речи, а <|speech_endpoint|> — момент, когда пользователь закончил говорить. Обе задачи обучаются совместно с потоковым ASR с использованием дополнительных наград, наложенных поверх награды за ASR.
Возможности
Модель обучалась на более чем 70 языках, из которых 25 прошли обширную проверку и рекомендованы к использованию на момент запуска. Переключение между языками поддерживается изначально — как внутри предложения, так и между предложениями, что важно для двуязычных пользователей, смешивающих языки в середине фразы. Точность можно дополнительно повысить с помощью указания языка, ключевых слов и контекста.
Обработка длинного контекста является практическим преимуществом. Meta заявляет, что модель изначально поддерживает аудиовход длительностью более одного часа и более 20 говорящих без обязательного этапа постобработки.
Тесты производительности
По данным Meta, по состоянию на 1 сентября 2026 года модель заняла первое место в рейтинге Artificial Analysis по потоковому преобразованию речи в текст и в открытых тестах диаризации.
В тесте Artificial Analysis AA-WER Streaming Muse Voice Transcribe показывает 3,1% WER итоговой транскрипции через 0,16 с после окончания речи. Cartesia Ink-2 с семантическим определением конца высказывания показывает 3,4% через 0,43 с. ElevenLabs Scribe v2 Realtime — 3,6% через 0,14 с. Cartesia Ink-2 с внешним определением конца высказывания работает быстрее всех — через 0,07 с, но отличается наименьшей точностью: 4,0%. Для первой частичной транскрипции Muse Voice Transcribe показывает 3,6% WER через 0,13 с.
В диаризации Meta сообщает о среднем показателе ошибки диаризации 17,5% на наборах AMI-IHM, AMI-SDM и VoxConverse. Пять других систем на той же диаграмме имеют показатели от 21,1% до 28,6%.
Цена — ещё один важный параметр. При стоимости $3,00 за 1 000 минут модель дешевле Cartesia Ink-2 ($4,00) и стоит менее половины цены ElevenLabs Scribe v2 Realtime и Deepgram Flux ($6,50).
Интерактивное объяснение
Основные выводы
- Одна модель выполняет потоковое ASR, диаризацию для более чем 20 говорящих и определение конца высказывания.
- WER итоговой транскрипции составляет 3,1% через 0,16 с в тесте Artificial Analysis AA-WER Streaming.
- Обучение с подкреплением формирует для модели стратегию «адаптивной задержки» для каждого слова.
- Модель обучена на более чем 70 языках, 25 из которых прошли обширную проверку; переключение между языками поддерживается изначально.
- Доступна только через API по цене $0,18 за час аудио. Открытых весов нет.
Ознакомьтесь с блогом Meta AI Research, страницей AI at Meta в X, Artificial Analysis и страницей модели в Meta Model API. Также подписывайтесь на нас в Твиттере и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тысячами участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.
Хотите стать нашим партнёром для продвижения своего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.