Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Новият модел на Meta за аудио в реално време е основата за AI асистенти, които никога не спират да слушат

Meta представи нов аудио модел в реално време – основата за ИИ асистенти, които никога не спират да слушат
Джонатан Кемпер
6 септември 2026 г.
Meta

Основни моменти

  • Meta пусна Muse Voice Transcribe – модел в реално време, който транскрибира реч, открива границите между изреченията и различава до 20 говорители без отделни системи.
  • Моделът разделя аудиото на фрагменти от 80 милисекунди и регулира закъснението за всяка дума според нейната сложност, като балансира скоростта и точността в движение.
  • На цена от 0,18 долара на час Meta предлага по-ниска цена от конкуренти като OpenAI и ElevenLabs. Моделът поддържа над 70 езика и вече е достъпен в Meta AI и чрез Meta Model API.

Superintelligence Labs на Meta пуснаха първия си модел за възприемане на аудио в реално време. Той транскрибира реч, различава говорителите и открива границите между изреченията по време на разговор на живо.

Моделът от семейството Spark разделя постъпващото аудио на фрагменти от 80 милисекунди. След всеки фрагмент той решава дали да продължи да слуша, или да изведе следващата дума като текст, като така контролира колко контекст да събере, преди да потвърди транскрипцията.

По-дългото изчакване означава по-добра точност, но и по-голямо закъснение. Според Meta Muse Voice Transcribe динамично регулира времето за изчакване за всяка дума според нейната сложност. Лесните думи се извеждат по-бързо, а по-трудните получават повече време за прослушване. Meta е обучила това поведение чрез обучение с подсилване, като едновременно е поощрявала модела за нисък процент грешки и кратки закъснения.

Диаграма на разсейването с процента грешки на думите по оста Y и времето до финалната транскрипция по оста X; Muse Voice Transcribe е на около 3,0 процента и 0,16 секунди, под пунктираната досегашна граница на Парето от Soniox, Cartesia и ElevenLabs.
Адаптивното закъснение променя компромиса между скорост и точност, тъй като моделът решава за всяка дума колко дълго да продължи да слуша. | Изображение: Meta

Разделяне на говорителите и откриване на изречения без допълнителни системи

Meta интегрира останалите функции в същия модел, без отделни системи. При идентифицирането на говорителите моделът отбелязва промените на говорителя в текущия текст и обозначава всеки пасаж с идентификатор от A до Z. При границите на изреченията той отбелязва къде започва и завършва всяко изказване. И двете задачи се обучават съвместно с разпознаването на реч.

Моделът може едновременно да различава повече от 20 говорители и да обработва записи с продължителност над един час без последваща обработка. В демонстрация с осем души в една стая системата приписва думите на отделните говорители в реално време, според Meta.

Многоезичната поддръжка като ключово предимство

Meta заявява, че Muse Voice Transcribe е обучен на над 70 езика, като 25 от тях са тествани задълбочено. Моделът обработва и превключване между езици, при което говорителите преминават от един език на друг в средата на изречението. Подсказки за езика, ключови думи и контекст могат допълнително да повишат точността, особено при собствени имена като „Meta“, „Muse“ или „Menlo Park“.

Стълбовидна диаграма „AA-WER Streaming Index Final Transcription“ сравнява осем системи за транскрипция в реално време; Muse Voice Transcribe е начело с 3,1 процента грешки на думите, а AssemblyAI U3.5 Realtime Pro и Gemini 3.5 Transcribe Live са на последно място с по 4,0 процента.
При тестове на Artificial Analysis от 1 септември 2026 г. Muse Voice Transcribe създава най-точния финален транскрипт след установения край на речта. | Изображение: Meta

Artificial Analysis потвърждава твърденията на Meta в независимо оценяване. Muse Voice Transcribe постига процент грешки на думите от 3,1% на английски език 0,16 секунди след като говорителят приключи да говори. ElevenLabs Scribe v2 Realtime постига 3,6% за 0,14 секунди, а AssemblyAI Universal-3.5 Pro Realtime – 4,0%. Cartesia Ink-2 постига 3,4 или 4,0% в зависимост от това дали моделът сам открива края на изказванията, или разчита на външна система. Конкуренцията е ожесточена. OpenAI пусна GPT-Realtime-Whisper за същата цел през май и намали цените на моделите за транскрипция през юли.

Meta свързва пускането с визията на изпълнителния директор Марк Зукърбърг за „персонална свръхинтелигентност“. В инсценирана демонстрация служители на Meta твърдят, че надеждното разпознаване на реч е основата за персонални ИИ агенти, които се вслушват в реални разговори чрез очила с ИИ. В Германия наскоро беше обсъждана забрана на очилата на Meta с камера, макар че Федералната мрежова агенция на Германия реши да не предприема действия.

Достъпност

Muse Voice Transcribe вече захранва гласовата диктовка в Meta AI и Muse Code и е достъпен чрез Meta Model API. Потребителите могат да го изпробват, като задържат клавиша „Fn“ във всяко приложение.

Meta предлага по-ниска цена от конкурентите. При 0,18 долара на час, или 3 долара за 1000 аудио минути, услугата струва по-малко от Cartesia Ink-2 – 4 долара – и ElevenLabs Scribe v2 Realtime и Deepgram Flux – по 6,50 долара.

Това продължава подхода, използван при Muse Spark 1.1 и Muse Spark 1.2, при който Meta се конкурира чрез цената, а не чрез върхова производителност. Компанията не е разкрила броя на параметрите на модела, обема на обучаващите данни или източниците на аудио данни и не пуска теглата му.

Meta реорганизира подразделението си за ИИ през лятото на 2025 г. под шапката на Superintelligence Labs, като привлече водещи изследователи от OpenAI, Google DeepMind и Apple с пакети за възнаграждение до 300 милиона долара за четири години. Не всички от тях останаха. Някои се върнаха в OpenAI само след няколко седмици.

ИИ новини без сензацията – подбрани от хора

Абонирайте се за THE DECODER и получете четене без реклами, седмичен бюлетин за ИИ, ексклузивния ни доклад за водещите технологии „AI Radar“ шест пъти годишно, пълен достъп до архива и достъп до секцията за коментари.

Източник: Meta | Artificial Analysis/X

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от The Decoder на

Прочетете оригинала в The Decoder ↗

Текстът и изображенията са собственост на The Decoder и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини