Alibaba запускає Qwen Audio 3.1 із новими моделями та знижує ціни на ШІ-аудіо до 95 відсотків
Команда Alibaba, що займається ШІ, Qwen випустила Qwen-Audio-3.1 — лінійку з п’яти моделей для розпізнавання мовлення (ASR), синтезу мовлення (TTS) і взаємодії в реальному часі. Модель ASR покращує розпізнавання різних мов і діалектів та автоматично прибирає слова-паразити й повтори. ASR-Next додає ідентифікацію кількох мовців із часовими мітками, а також виявляє емоції, навколишні звуки та шум машин. TTS підтримує багатомовний синтез із природним перенесенням голосу між мовами. Користувачі керують емоціями, швидкістю та стилем за допомогою простих текстових підказок, наприклад: «Прочитай це різким, командним тоном, що вимагає поваги».
TTS-Next поєднує мовну модель із дифузійним підходом для генерації голосу, звукових ефектів і фонового аудіо за один прохід. Модель реального часу підтримує одночасне говоріння й слухання з миттєвим перериванням. За словами Qwen, коли модель виявляє пригнічений настрій, вона відповідає повільніше та з більшою емпатією. Alibaba також суттєво знижує ціни. Вартість TTS зменшується приблизно на 70 відсотків, Realtime — приблизно на 85 відсотків, а ASR — до 95 відсотків. Більше деталей у блозі та на Qwen Cloud.
Новини про ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ, ексклюзивний галузевий звіт «AI Radar» шість разів на рік, мати повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.