Новият модел на Meta за аудио в реално време е основата за AI асистенти, които никога не спират да слушат
Основни моменти
- Meta пусна Muse Voice Transcribe – модел в реално време, който транскрибира реч, открива границите между изреченията и различава до 20 говорители без отделни системи.
- Моделът разделя аудиото на фрагменти от 80 милисекунди и регулира закъснението за всяка дума според нейната сложност, като балансира скоростта и точността в движение.
- На цена от 0,18 долара на час Meta предлага по-ниска цена от конкуренти като OpenAI и ElevenLabs. Моделът поддържа над 70 езика и вече е достъпен в Meta AI и чрез Meta Model API.
Superintelligence Labs на Meta пуснаха първия си модел за възприемане на аудио в реално време. Той транскрибира реч, различава говорителите и открива границите между изреченията по време на разговор на живо.
Моделът от семейството Spark разделя постъпващото аудио на фрагменти от 80 милисекунди. След всеки фрагмент той решава дали да продължи да слуша, или да изведе следващата дума като текст, като така контролира колко контекст да събере, преди да потвърди транскрипцията.
По-дългото изчакване означава по-добра точност, но и по-голямо закъснение. Според Meta Muse Voice Transcribe динамично регулира времето за изчакване за всяка дума според нейната сложност. Лесните думи се извеждат по-бързо, а по-трудните получават повече време за прослушване. Meta е обучила това поведение чрез обучение с подсилване, като едновременно е поощрявала модела за нисък процент грешки и кратки закъснения.

Разделяне на говорителите и откриване на изречения без допълнителни системи
Meta интегрира останалите функции в същия модел, без отделни системи. При идентифицирането на говорителите моделът отбелязва промените на говорителя в текущия текст и обозначава всеки пасаж с идентификатор от A до Z. При границите на изреченията той отбелязва къде започва и завършва всяко изказване. И двете задачи се обучават съвместно с разпознаването на реч.
Моделът може едновременно да различава повече от 20 говорители и да обработва записи с продължителност над един час без последваща обработка. В демонстрация с осем души в една стая системата приписва думите на отделните говорители в реално време, според Meta.
Многоезичната поддръжка като ключово предимство
Meta заявява, че Muse Voice Transcribe е обучен на над 70 езика, като 25 от тях са тествани задълбочено. Моделът обработва и превключване между езици, при което говорителите преминават от един език на друг в средата на изречението. Подсказки за езика, ключови думи и контекст могат допълнително да повишат точността, особено при собствени имена като „Meta“, „Muse“ или „Menlo Park“.

Artificial Analysis потвърждава твърденията на Meta в независимо оценяване. Muse Voice Transcribe постига процент грешки на думите от 3,1% на английски език 0,16 секунди след като говорителят приключи да говори. ElevenLabs Scribe v2 Realtime постига 3,6% за 0,14 секунди, а AssemblyAI Universal-3.5 Pro Realtime – 4,0%. Cartesia Ink-2 постига 3,4 или 4,0% в зависимост от това дали моделът сам открива края на изказванията, или разчита на външна система. Конкуренцията е ожесточена. OpenAI пусна GPT-Realtime-Whisper за същата цел през май и намали цените на моделите за транскрипция през юли.
Meta свързва пускането с визията на изпълнителния директор Марк Зукърбърг за „персонална свръхинтелигентност“. В инсценирана демонстрация служители на Meta твърдят, че надеждното разпознаване на реч е основата за персонални ИИ агенти, които се вслушват в реални разговори чрез очила с ИИ. В Германия наскоро беше обсъждана забрана на очилата на Meta с камера, макар че Федералната мрежова агенция на Германия реши да не предприема действия.
Достъпност
Muse Voice Transcribe вече захранва гласовата диктовка в Meta AI и Muse Code и е достъпен чрез Meta Model API. Потребителите могат да го изпробват, като задържат клавиша „Fn“ във всяко приложение.
Meta предлага по-ниска цена от конкурентите. При 0,18 долара на час, или 3 долара за 1000 аудио минути, услугата струва по-малко от Cartesia Ink-2 – 4 долара – и ElevenLabs Scribe v2 Realtime и Deepgram Flux – по 6,50 долара.
Това продължава подхода, използван при Muse Spark 1.1 и Muse Spark 1.2, при който Meta се конкурира чрез цената, а не чрез върхова производителност. Компанията не е разкрила броя на параметрите на модела, обема на обучаващите данни или източниците на аудио данни и не пуска теглата му.
Meta реорганизира подразделението си за ИИ през лятото на 2025 г. под шапката на Superintelligence Labs, като привлече водещи изследователи от OpenAI, Google DeepMind и Apple с пакети за възнаграждение до 300 милиона долара за четири години. Не всички от тях останаха. Някои се върнаха в OpenAI само след няколко седмици.
ИИ новини без сензацията – подбрани от хора
Абонирайте се за THE DECODER и получете четене без реклами, седмичен бюлетин за ИИ, ексклузивния ни доклад за водещите технологии „AI Radar“ шест пъти годишно, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.