Alibaba запускает Qwen Audio 3.1 с новыми моделями и снижает цены на ИИ-аудио до 95 процентов
Команда Alibaba, занимающаяся ИИ, выпустила Qwen-Audio-3.1 — линейку из пяти моделей для распознавания речи (ASR), преобразования текста в речь (TTS) и взаимодействия в реальном времени. Модель ASR улучшает распознавание многоязычной речи и диалектов, а также автоматически удаляет слова-паразиты и повторы. ASR-Next добавляет идентификацию нескольких говорящих с временными метками и распознаёт эмоции, фоновые звуки и шум работающих машин. TTS поддерживает многоязычный синтез с естественным переносом голоса между языками. Пользователи управляют эмоциями, скоростью и стилем с помощью простых текстовых запросов, например: «Прочитай это резким, властным тоном, требуя уважения».
TTS-Next объединяет языковую модель с диффузионным подходом для генерации голоса, звуковых эффектов и фонового аудио за один проход. Модель реального времени поддерживает одновременную речь и прослушивание с мгновенным прерыванием. По данным Qwen, при обнаружении подавленного настроения она отвечает медленнее и с большей эмпатией. Alibaba также значительно снижает цены. Стоимость TTS уменьшается примерно на 70 процентов, Realtime — примерно на 85 процентов, а ASR — до 95 процентов. Подробнее — в блоге и на сайте Qwen Cloud.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER и получите чтение без рекламы, еженедельную рассылку об ИИ, эксклюзивный отраслевой отчёт «AI Radar» шесть раз в год, полный доступ к архиву и возможность оставлять комментарии.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.