Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Команда Alibaba Qwen выпустила Qwen3.8-LiveTranslate: модель синхронного перевода в реальном времени, сокращающая среднюю задержку до 2,3 секунды для 60 языков

Qwen выпустила Qwen3.8-LiveTranslate — модель синхронного перевода следующего поколения в реальном времени. Она прослушивает речь в реальном времени, при необходимости анализируя видеокадры, и возвращает переведённый текст и речь, пока говорящий ещё продолжает говорить. Ключевым изменением стала новая архитектура Interleave. По данным Qwen, модель стала лучше по точности передачи смысла, беглости и лаконичности, а средняя задержка (LAAL) снизилась с 2,8 до 2,3 секунды. В релизе также появились диаризация говорящих в реальном времени, синхронное двуязычное отображение и устранение неоднозначности на основе длинного контекста.

Доступно для развертывания? Да, в виде размещённого API. Сервис уже доступен в Alibaba Cloud Model Studio и QwenCloud под именем qwen3.8-livetranslate-flash-realtime через WebSocket.

Что изменилось внутри

Синхронный перевод — это компромисс. Более длительное ожидание даёт модели больше контекста. Более раннее начало речи уменьшает задержку для слушателя. Qwen3.8-LiveTranslate перестраивает этот цикл с помощью архитектуры Interleave.

Используемая здесь метрика задержки — LAAL, или адаптивная к длине средняя задержка. Она измеряет, насколько в среднем перевод отстаёт от исходной речи. Кроме того, она не позволяет системам получать преимущество за счёт генерации избыточного текста. Снижение с 2,8 до 2,3 секунды означает примерно 18%-ное сокращение средней задержки.

Команда QwenCloud описывает модель как версию Qwen3.8-LiveTranslate-Flash для работы в реальном времени. Она создана на основе стека Qwen-Omni, крупномасштабных мультимодальных данных, выравнивания между языками и модальностями, а также визуального улучшения. Модель Flash также поддерживает офлайн-перевод аудио и видео.

Три новые возможности

  • Диаризация говорящих в реальном времени: Модель различает говорящих при многопользовательской речи. Она также сохраняет голос каждого говорящего благодаря более стабильному клонированию голоса. API предоставляет режимы клонирования, включая режим always, который выполняет повторное клонирование перед каждым ответом в сессиях с несколькими говорящими.
  • Синхронное двуязычное отображение: Исходный текст и перевод отображаются на экране одновременно. В API исходная транскрипция передаётся как отдельные события наряду с потоком перевода.
  • Устранение неоднозначности на основе длинного контекста: Модель использует историю разговора для уточнения имён и терминологии. Имя, представленное в начале встречи, сохраняет единообразие в последующем переводе.

Попробуйте ознакомиться с пояснением ниже. В нём показаны чередующийся поток, маркировка говорящих, устранение неоднозначности с учётом контекста, языковая поддержка и стоимость сессии.

Языки, входные данные и зрение

Модель понимает 60 языков. На 29 из них она может говорить, возвращая аудио и текст. Для остальных 31 доступен только текст. Вывод речи поддерживается для китайского, английского, арабского, немецкого, французского, испанского, японского, корейского, хинди и других языков.

Входными данными являются аудио и дополнительные изображения. Выходными данными — текст и аудио. Визуальные сигналы, такие как движения губ, жесты и текст на экране, помогают работать в шумных помещениях и различать неоднозначные слова. В документации рекомендуется отправлять не более 2 изображений в секунду.

Команды также могут задавать ключевые слова. Они сопоставляют исходные термины с фиксированными переводами на целевой язык. В документации рекомендуется настраивать не более 1 000 ключевых слов.

API, цены и ограничения

Разработчики подключаются через WebSocket Realtime API, используя идентификатор модели qwen3.8-livetranslate-flash-realtime. Тип обнаружения реплик по умолчанию — speaker_detection. Клиенты непрерывно передают аудио и получают ответы, сгенерированные сервером.

По умолчанию на вход подаётся PCM-аудио с частотой 16 кГц, а на выходе выдаётся PCM-аудио с частотой 24 кГц. Голос по умолчанию — Tina. Установите для session.output_modalities значение «только текст» либо «текст и аудио». Всегда отправляйте session.finish перед закрытием соединения, иначе последний фрагмент будет потерян.

Тарифы в Сингапуре за 1 млн токенов:

  • Входные аудиоданные: $7.50
  • Входные изображения: $0.55
  • Выходной текст: $20
  • Выходные аудиоданные: $30

Тарифы в Пекине ниже и составляют $5.653, $0.466, $14.133 и $22.613 соответственно в долларах США. Входные аудиоданные расходуют 7 токенов в секунду. Выходные аудиоданные расходуют 12,5 токена в секунду. Один час входящей и исходящей речи стоит в Сингапуре около $1.54 без учёта текстовых токенов и токенов изображений.

Размер контекстного окна составляет 53 248 токенов: 49 152 предназначены для входных данных и 4 096 — для выходных. Лимиты запросов по умолчанию — 10 запросов и 100 000 токенов в минуту. В Model Studio указано, что вызов функций, структурированные выходные данные, пакетный вывод и дообучение не поддерживаются.

Ключевые выводы

  • Qwen3.8-LiveTranslate сокращает среднюю задержку (LAAL) с 2,8 до 2,3 секунды.
  • Новая архитектура Interleave повышает точность передачи смысла, беглость и лаконичность.
  • Добавлены диаризация говорящих, двуязычное отображение и устранение неоднозначности на основе длинного контекста.
  • Модель понимает 60 языков и говорит на 29 из них.
  • Доступ предоставляется только через API Alibaba Cloud Model Studio и QwenCloud.

Ознакомьтесь с техническими подробностями. Вся заслуга принадлежит исследователю этого проекта. Также не стесняйтесь подписаться на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости