Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Екипът на Alibaba Qwen представи Qwen3.8-LiveTranslate: модел за превод в реално време, който намалява средното закъснение до 2,3 секунди на 60 езика

Qwen пусна Qwen3.8-LiveTranslate, своя модел от следващо поколение за превод в реално време и симултанен превод. Той слуша реч на живо, с опционални видеокадри, и връща преведен текст и реч, докато говорещият все още говори. Основната промяна е нова архитектура Interleave. Qwen отчита подобрения във вярността, плавността и краткостта, като средното закъснение (LAAL) спада от 2,8 секунди на 2,3 секунди. Изданието добавя също диаризация на говорещите в реално време, синхронизиран двуезичен дисплей и разрешаване на неясноти с дълъг контекст.

Готов ли е за внедряване? Да, като хостван API. Той е наличен в Alibaba Cloud Model Studio и QwenCloud като qwen3.8-livetranslate-flash-realtime през WebSocket.

Какво се промени под капака

Симултанният превод е компромис. По-дългото изчакване дава на модела повече контекст. По-бързото започване намалява забавянето за слушателя. Qwen3.8-LiveTranslate преизгражда този цикъл с архитектура Interleave.

Метриката за латентност тук е LAAL, или Length-Adaptive Average Lagging. Тя измерва с колко средно преводът изостава от изходната реч. Освен това не възнаграждава системи, които генерират прекалено много изход. Спадът от 2,8 секунди на 2,3 секунди представлява приблизително 18% намаление на средното закъснение.

Екипът на QwenCloud описва модела като версията в реално време на Qwen3.8-LiveTranslate-Flash. Той се основава на стека Qwen-Omni, широкомащабни мултимодални данни, междуезиково и междумодално съгласуване и визуално подобрение. Моделът Flash поддържа също офлайн превод на аудио и видео.

Три нови възможности

  • Диаризация на говорещите в реално време: Моделът различава говорещите при разговори с множество участници. Той също така запазва гласа на всеки говорещ чрез по-стабилно клониране на глас. API предоставя режими за клониране, включително режим always, който клонира гласа отново преди всеки отговор при сесии с множество говорещи.
  • Синхронизиран двуезичен дисплей: Изходният текст и преводът се появяват едновременно на екрана. В API транскрипцията на изходната реч се предава като собствени събития редом с потока на превода.
  • Разрешаване на неясноти с дълъг контекст: Моделът използва историята на разговора, за да разрешава неясноти при имена и терминология. Име, въведено в началото на срещата, остава последователно и по-късно в превода.

Разгледайте обяснението по-долу. То представя потока с редуващи се елементи, обозначаването на говорещите, разрешаването на неясноти чрез контекст, езиковото покритие и цената на сесиите.

Езици, входове и зрение

Моделът разбира 60 езика. Той може да говори на 29 от тях, като връща аудио и текст. За останалите 31 връща само текст. Гласовият изход обхваща китайски, английски, арабски, немски, френски, испански, японски, корейски, хинди и други езици.

Входовете са аудио и опционални изображения. Изходите са текст и аудио. Визуални сигнали като движения на устните, жестове и текст на екрана помагат в шумни помещения и при неясни думи. Документацията препоръчва да се изпращат не повече от 2 изображения в секунда.

Екипите могат също да задават ключови думи. Те съпоставят термини от източника с фиксирани преводи на целевия език. Документацията препоръчва да се конфигурират не повече от 1000 ключови думи.

API, цени и ограничения

Разработчиците се свързват чрез WebSocket Realtime API с идентификатор на модела qwen3.8-livetranslate-flash-realtime. Типът за откриване на реплики по подразбиране е speaker_detection. Клиентите предават аудио непрекъснато и получават отговори, генерирани от сървъра.

Аудиото по подразбиране е 16 kHz PCM на входа и 24 kHz PCM на изхода. Гласът по подразбиране е Tina. Задайте session.output_modalities само на текст или на текст и аудио. Винаги изпращайте session.finish преди затваряне, в противен случай последният сегмент ще бъде изгубен.

Публични цени за Сингапур за 1 млн. токена:

  • Аудио вход: $7.50
  • Изображение вход: $0.55
  • Текстов изход: $20
  • Аудио изход: $30

Цените за Пекин са по-ниски — съответно $5.653, $0.466, $14.133 и $22.613 в щатски долари. Аудио входът използва 7 токена в секунда. Аудио изходът използва 12,5 токена в секунда. Един час входяща и изходяща реч струва около $1.54 в Сингапур, без да се включват текстовите и графичните токени.

Контекстният прозорец е 53 248 токена, от които 49 152 са за вход, а 4 096 — за изход. Ограниченията на честотата по подразбиране са 10 заявки и 100 000 токена в минута. Model Studio посочва извикването на функции, структурирания изход, пакетното инфериране и дообучаването като неподдържани.

Основни изводи

  • Qwen3.8-LiveTranslate намалява средното закъснение (LAAL) от 2,8 до 2,3 секунди.
  • Новата архитектура Interleave подобрява вярността, плавността и краткостта.
  • Добавя диаризация на говорещите, двуезичен дисплей и разрешаване на неясноти с дълъг контекст.
  • Разбира 60 езика и говори на 29 от тях.
  • Достъпът е само чрез API посредством Alibaba Cloud Model Studio и QwenCloud.

Разгледайте техническите подробности. Всички заслуги са на изследователя на този проект. Също така не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ продуктово издание ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини