Alibaba пуска Qwen Audio 3.1 с нови модели и намалява цените на AI аудиото с до 95 процента
AI екипът на Alibaba Qwen пусна Qwen-Audio-3.1 – набор от пет модела за разпознаване на реч (ASR), преобразуване на текст в реч (TTS) и взаимодействие в реално време. Моделът ASR подобрява разпознаването на многоезична реч и диалекти и автоматично премахва паразитните думи и повторенията. ASR-Next добавя идентифициране на множество говорители с времеви маркери и разпознава емоции, фонови звуци и шум от машини. TTS поддържа многоезичен синтез с естествено прехвърляне на гласа между езици. Потребителите контролират емоцията, скоростта и стила чрез прости текстови подкани като „Прочети това с рязък, властен тон, изискващ уважение.“
TTS-Next съчетава езиков модел с дифузионен подход, за да генерира глас, звукови ефекти и фоново аудио в един проход. Моделът за работа в реално време поддържа едновременно говорене и слушане с незабавно прекъсване. Когато засече потиснато настроение, той отговаря по-бавно и с повече емпатия, според Qwen. Alibaba също намалява цените. Цената на TTS пада с около 70 процента, на Realtime – с приблизително 85 процента, а на ASR – с до 95 процента. Повече подробности има в блога и в Qwen Cloud.
AI новини без сензацията – подбрани от хора
Абонирайте се за THE DECODER за четене без реклами, седмичен AI бюлетин, нашия ексклузивен тримесечен доклад за новите тенденции в AI „AI Radar“, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.