Екипът на Alibaba Qwen представи Qwen3.8-LiveTranslate: модел за превод в реално време, който намалява средното закъснение до 2,3 секунди на 60 езика
Qwen пусна Qwen3.8-LiveTranslate, своя модел от следващо поколение за превод в реално време и симултанен превод. Той слуша реч на живо, с опционални видеокадри, и връща преведен текст и реч, докато говорещият все още говори. Основната промяна е нова архитектура Interleave. Qwen отчита подобрения във вярността, плавността и краткостта, като средното закъснение (LAAL) спада от 2,8 секунди на 2,3 секунди. Изданието добавя също диаризация на говорещите в реално време, синхронизиран двуезичен дисплей и разрешаване на неясноти с дълъг контекст.
Готов ли е за внедряване? Да, като хостван API. Той е наличен в Alibaba Cloud Model Studio и QwenCloud като qwen3.8-livetranslate-flash-realtime през WebSocket.
Какво се промени под капака
Симултанният превод е компромис. По-дългото изчакване дава на модела повече контекст. По-бързото започване намалява забавянето за слушателя. Qwen3.8-LiveTranslate преизгражда този цикъл с архитектура Interleave.
Метриката за латентност тук е LAAL, или Length-Adaptive Average Lagging. Тя измерва с колко средно преводът изостава от изходната реч. Освен това не възнаграждава системи, които генерират прекалено много изход. Спадът от 2,8 секунди на 2,3 секунди представлява приблизително 18% намаление на средното закъснение.
Екипът на QwenCloud описва модела като версията в реално време на Qwen3.8-LiveTranslate-Flash. Той се основава на стека Qwen-Omni, широкомащабни мултимодални данни, междуезиково и междумодално съгласуване и визуално подобрение. Моделът Flash поддържа също офлайн превод на аудио и видео.
Три нови възможности
- Диаризация на говорещите в реално време: Моделът различава говорещите при разговори с множество участници. Той също така запазва гласа на всеки говорещ чрез по-стабилно клониране на глас. API предоставя режими за клониране, включително режим
always, който клонира гласа отново преди всеки отговор при сесии с множество говорещи. - Синхронизиран двуезичен дисплей: Изходният текст и преводът се появяват едновременно на екрана. В API транскрипцията на изходната реч се предава като собствени събития редом с потока на превода.
- Разрешаване на неясноти с дълъг контекст: Моделът използва историята на разговора, за да разрешава неясноти при имена и терминология. Име, въведено в началото на срещата, остава последователно и по-късно в превода.
Разгледайте обяснението по-долу. То представя потока с редуващи се елементи, обозначаването на говорещите, разрешаването на неясноти чрез контекст, езиковото покритие и цената на сесиите.
Езици, входове и зрение
Моделът разбира 60 езика. Той може да говори на 29 от тях, като връща аудио и текст. За останалите 31 връща само текст. Гласовият изход обхваща китайски, английски, арабски, немски, френски, испански, японски, корейски, хинди и други езици.
Входовете са аудио и опционални изображения. Изходите са текст и аудио. Визуални сигнали като движения на устните, жестове и текст на екрана помагат в шумни помещения и при неясни думи. Документацията препоръчва да се изпращат не повече от 2 изображения в секунда.
Екипите могат също да задават ключови думи. Те съпоставят термини от източника с фиксирани преводи на целевия език. Документацията препоръчва да се конфигурират не повече от 1000 ключови думи.
API, цени и ограничения
Разработчиците се свързват чрез WebSocket Realtime API с идентификатор на модела qwen3.8-livetranslate-flash-realtime. Типът за откриване на реплики по подразбиране е speaker_detection. Клиентите предават аудио непрекъснато и получават отговори, генерирани от сървъра.
Аудиото по подразбиране е 16 kHz PCM на входа и 24 kHz PCM на изхода. Гласът по подразбиране е Tina. Задайте session.output_modalities само на текст или на текст и аудио. Винаги изпращайте session.finish преди затваряне, в противен случай последният сегмент ще бъде изгубен.
Публични цени за Сингапур за 1 млн. токена:
- Аудио вход: $7.50
- Изображение вход: $0.55
- Текстов изход: $20
- Аудио изход: $30
Цените за Пекин са по-ниски — съответно $5.653, $0.466, $14.133 и $22.613 в щатски долари. Аудио входът използва 7 токена в секунда. Аудио изходът използва 12,5 токена в секунда. Един час входяща и изходяща реч струва около $1.54 в Сингапур, без да се включват текстовите и графичните токени.
Контекстният прозорец е 53 248 токена, от които 49 152 са за вход, а 4 096 — за изход. Ограниченията на честотата по подразбиране са 10 заявки и 100 000 токена в минута. Model Studio посочва извикването на функции, структурирания изход, пакетното инфериране и дообучаването като неподдържани.
Основни изводи
- Qwen3.8-LiveTranslate намалява средното закъснение (LAAL) от 2,8 до 2,3 секунди.
- Новата архитектура Interleave подобрява вярността, плавността и краткостта.
- Добавя диаризация на говорещите, двуезичен дисплей и разрешаване на неясноти с дълъг контекст.
- Разбира 60 езика и говори на 29 от тях.
- Достъпът е само чрез API посредством Alibaba Cloud Model Studio и QwenCloud.
Разгледайте техническите подробности. Всички заслуги са на изследователя на този проект. Също така не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ продуктово издание ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.