Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Команда Alibaba Qwen випустила Qwen3.8-LiveTranslate: модель синхронного перекладу в реальному часі, що скорочує середню затримку до 2,3 секунди для 60 мов

Qwen випустила Qwen3.8-LiveTranslate — модель нового покоління для синхронного перекладу в реальному часі. Вона прослуховує мовлення наживо, за потреби аналізує відеокадри й повертає перекладений текст та мовлення, поки спікер ще говорить. Ключова зміна — нова архітектура Interleave. Qwen повідомляє про покращення точності передачі змісту, плавності та стислості, а середня затримка (LAAL) скоротилася з 2,8 до 2,3 секунди. У релізі також додано розділення мовців у реальному часі, синхронне двомовне відображення та розв’язання неоднозначностей із використанням довгого контексту.

Доступна для розгортання? Так, як розміщений API. Вона доступна в Alibaba Cloud Model Studio і QwenCloud під назвою qwen3.8-livetranslate-flash-realtime через WebSocket.

Що змінилося всередині

Синхронний переклад — це компроміс. Якщо чекати довше, модель отримує більше контексту. Якщо починати говорити раніше, затримка для слухача зменшується. Qwen3.8-LiveTranslate перебудовує цей цикл за допомогою архітектури Interleave.

Показник затримки тут — LAAL, або Length-Adaptive Average Lagging. Він вимірює, наскільки в середньому переклад відстає від вихідного мовлення. Також він не дає переваги системам, які генерують надмірний обсяг тексту. Скорочення з 2,8 до 2,3 секунди означає приблизно 18-відсоткове зменшення середньої затримки.

Команда QwenCloud описує модель як версію Qwen3.8-LiveTranslate-Flash для роботи в реальному часі. Вона базується на стеку Qwen-Omni, великомасштабних мультимодальних даних, міжмовному та міжмодальному вирівнюванні, а також візуальному покращенні. Модель Flash також підтримує офлайн-переклад аудіо та відео.

Три нові можливості

  • Розділення мовців у реальному часі: Модель розрізняє мовців у багатосторонньому спілкуванні. Вона також зберігає голос кожного мовця завдяки стабільнішому клонуванню голосу. API надає режими клонування, зокрема режим always, який повторно клонує голос перед кожною відповіддю під час сеансів із кількома мовцями.
  • Синхронне двомовне відображення: Вихідний текст і переклад з’являються на екрані одночасно. В API транскрипція вихідного мовлення передається як окремі події поруч із потоком перекладу.
  • Розв’язання неоднозначностей у довгому контексті: Модель використовує історію розмови для визначення імен і термінології. Ім’я, представлене на початку зустрічі, залишається узгодженим у подальшому перекладі.

Перегляньте пояснення нижче. У ньому розглядаються чергування потоків, позначення мовців, розв’язання неоднозначностей у контексті, мовне охоплення та вартість сеансу.

Мови, вхідні дані та бачення

Модель розуміє 60 мов. Вона може говорити 29 із них, повертаючи аудіо й текст. Для решти 31 мови повертається лише текст. Виведення мовлення охоплює китайську, англійську, арабську, німецьку, французьку, іспанську, японську, корейську, гінді та інші мови.

Вхідними даними є аудіо та необов’язкові зображення. Вихідні дані — текст і аудіо. Візуальні ознаки, як-от рухи губ, жести та текст на екрані, допомагають у шумних приміщеннях і в разі неоднозначних слів. Документація рекомендує надсилати не більше 2 зображень на секунду.

Команди також можуть налаштовувати ключові слова. Вони зіставляють терміни вихідної мови з фіксованими перекладами цільовою мовою. Документація рекомендує налаштовувати не більше 1 000 ключових слів.

API, ціни та обмеження

Розробники підключаються через WebSocket Realtime API за ідентифікатором моделі qwen3.8-livetranslate-flash-realtime. Тип виявлення реплік за замовчуванням — speaker_detection. Клієнти безперервно передають аудіо й отримують відповіді, згенеровані сервером.

За замовчуванням аудіо надходить у форматі PCM із частотою 16 кГц, а виводиться у форматі PCM із частотою 24 кГц. Голос за замовчуванням — Tina. Встановіть для session.output_modalities значення «лише текст» або «текст і аудіо». Перед закриттям завжди надсилайте session.finish, інакше фінальний сегмент буде втрачено.

Тарифи в Сінгапурі за 1 млн токенів:

  • Вхідне аудіо: $7.50
  • Вхідні зображення: $0.55
  • Вихідний текст: $20
  • Вихідне аудіо: $30

Тарифи в Пекіні нижчі: $5.653, $0.466, $14.133 і $22.613 відповідно в доларах США. Вхідне аудіо споживає 7 токенів на секунду. Вихідне аудіо споживає 12,5 токена на секунду. Одна година вхідного та вихідного мовлення коштує приблизно $1.54 у Сінгапурі, без урахування текстових токенів і токенів зображень.

Контекстне вікно становить 53 248 токенів: 49 152 для вхідних даних і 4 096 для вихідних. Типові ліміти швидкості — 10 запитів і 100 000 токенів на хвилину. У Model Studio зазначено, що виклик функцій, структуровані вихідні дані, пакетний висновок і донавчання не підтримуються.

Ключові висновки

  • Qwen3.8-LiveTranslate скорочує середню затримку (LAAL) із 2,8 до 2,3 с.
  • Нова архітектура Interleave покращує точність передачі змісту, плавність і стислість.
  • Додано розділення мовців, двомовне відображення та розв’язання неоднозначностей у довгому контексті.
  • Модель розуміє 60 мов і говорить 29 із них.
  • Доступ надається лише через API Alibaba Cloud Model Studio та QwenCloud.

Ознайомтеся з технічними деталями. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання зі 150 тисячами+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібна співпраця з нами для просування вашого репозиторію на GitHub, сторінки на Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини