Новая аудиомодель Meta для работы в реальном времени — основа для ИИ-ассистентов, которые никогда не перестают слушать
Ключевые моменты
- Meta выпустила Muse Voice Transcribe — модель реального времени, которая транскрибирует речь, определяет границы предложений и различает до 20 говорящих без использования отдельных систем.
- Модель разбивает аудио на фрагменты длительностью 80 миллисекунд и регулирует задержку для каждого слова в зависимости от его сложности, на лету балансируя между скоростью и точностью.
- При цене $0,18 за час Meta обходит конкурентов вроде OpenAI и ElevenLabs. Модель поддерживает более 70 языков и уже доступна в Meta AI и через Meta Model API.
Superintelligence Labs компании Meta выпустила свою первую модель восприятия аудио в реальном времени. Она транскрибирует речь, различает говорящих и определяет границы предложений во время живого разговора.
Модель семейства Spark разбивает входящий аудиопоток на фрагменты длительностью 80 миллисекунд. После каждого фрагмента она решает, продолжить ли прослушивание или вывести следующее слово в виде текста, определяя, сколько контекста собрать перед фиксацией транскрипции.
Более длительное ожидание повышает точность, но увеличивает задержку. По данным Meta, Muse Voice Transcribe динамически регулирует время ожидания для каждого слова в зависимости от его сложности. Простые слова появляются быстрее, а более сложные получают больше времени на прослушивание. Meta обучала эту модель с помощью обучения с подкреплением, одновременно поощряя низкий уровень ошибок и короткие задержки.

Разделение говорящих и определение предложений без дополнительных систем
Meta встроила остальные функции в ту же модель, не используя отдельные системы. Для атрибуции речи модель отмечает смену говорящего в текущем тексте и помечает каждый фрагмент идентификатором от A до Z. Для определения границ предложений она отмечает начало и конец каждого высказывания. Обе задачи обучаются совместно с распознаванием речи.
Модель может одновременно различать более 20 говорящих и обрабатывать записи длительностью более часа без постобработки. По данным Meta, в демонстрации с участием восьми человек в комнате система в реальном времени распределяет слова между отдельными говорящими.
Мультиязычная поддержка как ключевое преимущество
Meta заявляет, что Muse Voice Transcribe обучалась более чем на 70 языках, из которых 25 были подробно протестированы. Модель также обрабатывает переключение языков, когда говорящие переходят с одного языка на другой в середине предложения. Подсказки о языке, ключевых словах и контексте могут дополнительно повысить точность, особенно для имен собственных вроде «Meta», «Muse» или «Menlo Park».

Artificial Analysis подтверждает заявления Meta в независимой оценке. Muse Voice Transcribe достигает показателя ошибок в словах 3,1 процента для английского языка через 0,16 секунды после окончания речи говорящего. ElevenLabs Scribe v2 Realtime показывает 3,6 процента и 0,14 секунды, а AssemblyAI Universal-3.5 Pro Realtime — 4,0 процента. Cartesia Ink-2 набирает 3,4 или 4,0 процента в зависимости от того, определяет ли модель окончания высказываний самостоятельно или полагается на внешнюю систему. Конкуренция очень высока. В мае OpenAI выпустила GPT-Realtime-Whisper для той же цели, а в июле снизила цены на модели транскрипции.
Meta связывает выпуск модели с видением генерального директора Марка Цукерберга о «персональном сверхинтеллекте». В постановочной демонстрации сотрудники Meta утверждают, что надежное распознавание речи — основа персональных ИИ-агентов, которые будут подслушивать реальные разговоры через ИИ-очки. В Германии недавно обсуждался запрет очков Meta с камерой, однако Федеральное сетевое агентство Германии решило не предпринимать дальнейших действий.
Доступность
Muse Voice Transcribe теперь обеспечивает голосовой ввод в Meta AI и Muse Code, а также доступна через Meta Model API. Пользователи могут попробовать ее, удерживая клавишу «Fn» в любом приложении.
Meta предлагает более низкую цену, чем конкуренты. При стоимости $0,18 за час, или $3 за 1000 минут аудио, сервис дешевле Cartesia Ink-2 за $4, а также ElevenLabs Scribe v2 Realtime и Deepgram Flux, каждый из которых стоит $6,50.
Это продолжение стратегии, примененной в Muse Spark 1.1 и Muse Spark 1.2, где Meta конкурирует ценой, а не максимальной производительностью. Компания не раскрыла количество параметров модели, объем обучающих данных или источники аудиоданных и не выпускает веса модели.
Летом 2025 года Meta реорганизовала свое подразделение ИИ под эгидой Superintelligence Labs, наняв ведущих исследователей из OpenAI, Google DeepMind и Apple и предложив им пакеты вознаграждений размером до $300 млн на четыре года. Однако остались не все. Некоторые вернулись в OpenAI всего через несколько недель.
Новости ИИ без хайпа — отобраны людьми
Подпишитесь на THE DECODER и получите чтение без рекламы, еженедельную рассылку об ИИ, эксклюзивный обзор передовых разработок «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.