Нова аудіомодель Meta для роботи в реальному часі — основа для ШІ-асистентів, які ніколи не припиняють слухати
Основні моменти
- Meta випустила Muse Voice Transcribe — модель реального часу, яка транскрибує мовлення, визначає межі речень і розрізняє до 20 мовців без використання окремих систем.
- Модель розбиває аудіо на фрагменти тривалістю 80 мілісекунд і коригує затримку для кожного слова залежно від його складності, динамічно балансуючи між швидкістю та точністю.
- За ціною $0,18 за годину Meta випереджає за дешевизною таких конкурентів, як OpenAI та ElevenLabs. Модель підтримує понад 70 мов і вже доступна в Meta AI та через Meta Model API.
Superintelligence Labs компанії Meta випустила свою першу модель сприйняття аудіо в реальному часі. Вона транскрибує мовлення, розрізняє мовців і визначає межі речень під час живої розмови.
Модель сімейства Spark розбиває вхідне аудіо на фрагменти тривалістю 80 мілісекунд. Після кожного фрагмента вона вирішує, чи продовжувати слухати, чи вивести наступне слово у вигляді тексту, визначаючи, скільки контексту потрібно зібрати перед фіксацією транскрипції.
Більше очікування означає кращу точність, але довші затримки. За даними Meta, Muse Voice Transcribe динамічно регулює час очікування для кожного слова залежно від його складності. Прості слова з’являються швидше, а складні отримують більше часу на прослуховування. Meta навчила цю поведінку за допомогою навчання з підкріпленням, одночасно винагороджуючи модель за низький рівень помилок і короткі затримки.

Розділення мовців і визначення речень без додаткових систем
Meta вбудовує решту функцій у ту саму модель, без окремих систем. Для визначення мовців модель позначає зміни мовця в поточному тексті та додає до кожного фрагмента ідентифікатор від A до Z. Для визначення меж речень вона позначає початок і кінець кожного висловлювання. Обидва завдання навчаються спільно з розпізнаванням мовлення.
Модель може одночасно розрізняти понад 20 мовців і обробляти записи тривалістю понад годину без подальшої обробки. За даними Meta, під час демонстрації за участю восьми людей у кімнаті система в реальному часі розподіляє слова між окремими мовцями.
Багатомовна підтримка як ключова перевага
Meta повідомляє, що Muse Voice Transcribe навчали на даних більш ніж 70 мов, 25 із яких було детально протестовано. Модель також обробляє перемикання між мовами, коли мовці переходять з однієї мови на іншу посередині речення. Підказки щодо мови, ключових слів і контексту можуть додатково підвищити точність, особливо для власних назв на кшталт "Meta", "Muse" або "Menlo Park."

Artificial Analysis підтверджує заяви Meta в незалежному оцінюванні. Muse Voice Transcribe досягає частоти помилок у словах 3,1 відсотка для англійської мови через 0,16 секунди після завершення мовлення мовця. ElevenLabs Scribe v2 Realtime показує результат 3,6 відсотка та 0,14 секунди, а AssemblyAI Universal-3.5 Pro Realtime — 4,0 відсотка. Cartesia Ink-2 отримує результат 3,4 або 4,0 відсотка залежно від того, чи модель сама визначає завершення висловлювання, чи покладається на зовнішню систему. Конкуренція є дуже жорсткою. У травні OpenAI випустила GPT-Realtime-Whisper для тієї самої мети, а в липні знизила ціни на моделі транскрипції.
Meta пов’язує цей випуск із баченням генерального директора Марка Цукерберга щодо «персонального суперінтелекту». Під час постановочної демонстрації співробітники Meta стверджують, що надійне розпізнавання мовлення є основою для персональних ШІ-агентів, які підслуховують реальні розмови через ШІ-окуляри. У Німеччині нещодавно обговорювали заборону на камери-окуляри Meta, хоча Федеральне мережеве агентство Німеччини вирішило не продовжувати цю справу.
Доступність
Muse Voice Transcribe уже забезпечує голосовий диктант у Meta AI та Muse Code і доступна через Meta Model API. Користувачі можуть випробувати її, утримуючи клавішу "Fn" у будь-якому застосунку.
Meta пропонує найнижчу ціну на ринку. За вартості $0,18 за годину, або $3 за 1000 аудіохвилин, вона дешевша за Cartesia Ink-2 ($4), а також ElevenLabs Scribe v2 Realtime і Deepgram Flux (по $6,50 кожна).
Це продовження стратегії, застосованої для Muse Spark 1.1 і Muse Spark 1.2, де Meta конкурує ціною, а не максимальною продуктивністю. Компанія не розкрила кількість параметрів моделі, обсяг навчальних даних або джерела аудіоданих і не випускає ваги моделі.
Meta реорганізувала свій підрозділ штучного інтелекту влітку 2025 року під егідою Superintelligence Labs, залучивши провідних дослідників з OpenAI, Google DeepMind і Apple із пакетами винагороди до $300 мільйонів за чотири роки. Не всі з них залишилися. Дехто повернувся до OpenAI лише через кілька тижнів.
Новини ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримати щотижневу розсилку про ШІ, наш ексклюзивний передовий звіт «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.