Microsoft AI пусна нови модели за транскрипция и синтез на реч за гласови агенти
Microsoft AI пусна MAI-Transcribe-2-Streaming — нов модел за транскрипция в реално време. Microsoft заявява, че моделът заема първо място по точност в Artificial Analysis. Моделът транскрибира 60 езика и предоставя първите си частични резултати само за малко над 100 милисекунди. Според Microsoft това позволява на гласовите агенти да отговарят, докато човекът все още не е довършил изречението си. До края на годината един час аудио струва $0,54 на промоционалната цена.
Microsoft пусна и два нови модела за преобразуване на текст в реч. MAI-Voice-2.1 е проектиран да говори на 23 езика с един и същ глас, като използва естествен акцент за всеки от тях. Според Microsoft вариантът MAI-Voice-2.1-Flash постига латентност от 150 милисекунди и струва $15 на милион знака вместо $22.
И двата гласови модела могат да клонират глас само от няколко секунди референтен аудиозапис, а вградените предпазни мерки са предназначени да предотвратяват злоупотреби. Моделите са достъпни чрез Microsoft Foundry и MAI Playground, наред с други платформи, а двата гласови модела са налични и в OpenRouter. При един тест около половината от 4000 участници са помислили, че гласовете принадлежат на реален човек.
AI новини без сензация — подбрани от хора
Абонирайте се за THE DECODER за четене без реклами, седмичен бюлетин за AI, нашия ексклузивен граничен доклад „AI Radar“ шест пъти годишно, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.