Meta Superintelligence Labs випустила Muse Voice Transcribe: одну модель реального часу для потокового ASR, діаризації та визначення завершення мовлення
Більшість виробничих голосових стеків складаються з трьох зшитих разом систем. Одна модель транскрибує мовлення, друга розділяє мовців, а детектор визначає, коли користувач припинив говорити. Кожна передача додає затримку та створює новий режим відмови.
Muse Voice Transcribe, про яку цього тижня оголосила Meta Superintelligence Labs, об’єднує ці три завдання в одну авторегресійну модель. Meta називає її своєю першою моделлю сприйняття аудіо в реальному часі. Вона виконує потокове ASR, діаризацію мовців для понад 20 мовців і визначення кінцевої точки в один прохід, без обов’язкової постобробки.
Чи придатна вона до розгортання? Так, але лише як розміщений API. Вона доступна в Meta Model API під назвою muse-voice-transcribe-1.0 за ціною $3,00 за 1 000 аудіохвилин ($0,18 за годину), а також уже забезпечує диктування в Meta AI для Mac і Muse Code. Ваги моделі не опубліковано, тож можливості самостійного хостингу немає.
Потокове ASR як основа
Muse Voice Transcribe — це авторегресійна мультимодальна модель із сімейства Muse Spark. Аудіо надходить фрагментами тривалістю 80 мс із частотою 12,5 Гц. Кожен фрагмент перетворюється на один м’який токен.
Після кожного фрагмента модель робить один бінарний вибір. Вона або прогнозує токен <|next_audio|> і продовжує слухати, або генерує текстовий токен. Коли модель прогнозує <|next_audio|>, цей токен замінюється фактичним наступним аудіофрагментом у вхідних даних. Коли потік завершується, вставляється токен <|empty_audio|>, і модель виводить увесь текст, що залишився, не запитуючи додаткового аудіо.
Слухання та написання використовують один цикл декодування, тож немає окремого етапу вирівнювання, який міг би поступово зміщуватися.
Адаптивна затримка, навчена за допомогою RL
Оскільки модель керує тим, коли вона слухає, вона також керує обсягом аудіоконтексту, що передує кожному слову. Meta називає цей проміжок «затримкою». Більша затримка означає точнішу транскрипцію та вищу латентність.
Замість того щоб фіксувати цей компроміс, Meta навчає модель керувати ним. Навчання з підкріпленням мультиплікативно поєднує винагороду за частоту помилок у словах і винагороду за затримку, створюючи політику, яка змінює затримку для кожного слова залежно від складності. Meta повідомляє, що завдяки цьому модель перебуває на фронті Парето за співвідношенням швидкості й точності, виміряним часом до остаточної транскрипції, випереджаючи попередній фронт, сформований системами Soniox, Cartesia та ElevenLabs.
Діаризація та визначення кінцевої точки — це додаткові токени
Meta не додавала другу модель для атрибуції мовців. Вона додала спеціальні токени до того самого потоку.
Для діаризації токен <|start_of_turn|> позначає потенційну зміну мовця, а тег <|speaker_{A-Z}|> ідентифікує мовця. Токен зміни мовця спрацьовує, щойно така зміна стає можливою, тоді як тег мовця відкладається до кінця фрагмента. Аудіо одного мовця може бути розділене на кілька сегментів, які зрештою отримують один і той самий тег.
Для визначення кінцевої точки <|speech_onset|> позначає початок мовлення, а <|speech_endpoint|> — момент, коли користувач завершив говорити. Обидва завдання навчаються спільно з потоковим ASR із використанням додаткових винагород, накладених поверх винагороди за ASR.
Можливості
Модель навчали на понад 70 мовах, 25 із яких були ретельно перевірені та рекомендовані на момент запуску. Перемикання між мовами є вбудованим — як у межах речення, так і між реченнями, що важливо для двомовних мовців, які змішують мови в середині фрази. Точність можна ще покращити за допомогою мовного, ключового та контекстного упередження.
Робота з довгим контекстом є практичною відмінністю моделі. Meta зазначає, що модель нативно підтримує аудіовхід тривалістю понад одну годину та понад 20 мовців, без обов’язкового етапу постобробки.
Бенчмарки
Meta повідомляє про перше місце в Artificial Analysis у потоковому перетворенні мовлення на текст і в публічних бенчмарках діаризації станом на 1 вересня 2026 року.
У Artificial Analysis AA-WER Streaming Muse Voice Transcribe демонструє WER остаточної транскрипції на рівні 3,1% через 0,16 с після завершення мовлення. Cartesia Ink-2 із семантичними кінцевими точками показує 3,4% через 0,43 с. ElevenLabs Scribe v2 Realtime — 3,6% через 0,14 с. Cartesia Ink-2 із зовнішніми кінцевими точками є найшвидшою — 0,07 с, але найменш точною — 4,0%. Для першої часткової транскрипції Muse Voice Transcribe демонструє WER 3,6% через 0,13 с.
Щодо діаризації Meta повідомляє про середній рівень помилок діаризації 17,5% на наборах AMI-IHM, AMI-SDM і VoxConverse. П’ять інших систем на тій самій діаграмі мають показники від 21,1% до 28,6%.
Ціна — ще один важливий аспект. За ціною $3,00 за 1 000 хвилин сервіс дешевший за Cartesia Ink-2 ($4,00) і коштує менш ніж половину ціни ElevenLabs Scribe v2 Realtime та Deepgram Flux ($6,50).
Інтерактивне пояснення
Ключові висновки
- Одна модель виконує потокове ASR, діаризацію для понад 20 мовців і визначення кінцевої точки.
- WER остаточної транскрипції становить 3,1% через 0,16 с у Artificial Analysis AA-WER Streaming.
- Навчання з підкріпленням навчає модель політики «адаптивної затримки» для кожного слова.
- Модель навчали на понад 70 мовах, 25 із яких ретельно перевірені; вона нативно підтримує перемикання між мовами.
- Доступна лише через API за ціною $0,18 за аудіогодину. Відкритих ваг немає.
Ознайомтеся з блогом Meta AI Research, AI at Meta у X, Artificial Analysis та сторінкою моделі в Meta Model API. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого ML SubReddit із понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.