Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Sarvam AI выпускает Saaras V4: модель преобразования речи в текст для всех 22 индийских языков и глобального английского

Sarvam AI выпустила Saaras V4 — новое поколение своей модели распознавания речи. Она охватывает все 22 официально признанных индийских языка, а также английский, включая теперь акценты английского со всего мира. Sarvam сообщает о лучшей в своем классе точности для всех 22 языков.

Возможна ли ее интеграция? Да, уже сегодня через API Sarvam с использованием model="saaras:v4". Веса модели не опубликованы, а документация Sarvam по самостоятельному размещению в SageMaker пока охватывает только Saaras v3.

Что внутри Saaras V4

Saaras V4 — это система с архитектурой энкодер–декодер. Аудиоэнкодер преобразует звуковую волну в эмбеддинги, содержащие фонетические и акустические характеристики. Затем адаптер с временным уменьшением дискретизации сокращает эту последовательность и проецирует ее в пространство эмбеддингов языковой модели. Благодаря этому длинные записи помещаются в контекстное окно декодера.

В качестве декодера используется Sarvam-3B — гибридная языковая модель с пространством состояний и 3 млрд параметров, обученная с нуля внутри компании. Она считывает аудиопризнаки вместе с текстовым промптом. Затем модель авторегрессионно генерирует расшифровку, подавая каждый токен обратно на вход для получения следующего.

Результаты тестирования

  • Английский язык: Sarvam протестировала модель на 7 наборах данных для английского языка. Шесть из них взяты из Open ASR Leaderboard на Hugging Face: AMI, GigaSpeech, LibriSpeech clean, LibriSpeech other, SPGISpeech и VoxPopuli. Седьмой — индийский набор данных с акцентами Svarah от AI4Bharat. Оценка проводится с использованием кода нормализации лидерборда. Saaras V4 показывает самый низкий средний WER среди протестированных Sarvam моделей.
  • Индийские языки: На наборе Vistaar Sarvam сообщает о результатах для 10 индийских языков с использованием как WER, так и LLM-WER. LLM-WER добавляет семантическую проверку. Он отделяет реальные ошибки в значении от несущественных вариантов написания или форматирования, часто встречающихся в индийских письменностях.
  • Зашумленный звук: На наборе Kathbath Noisy, измеренном с помощью LLM-WER, Sarvam утверждает, что уровень ошибок Saaras V4 менее чем вдвое ниже, чем у Deepgram Nova-3 и GPT-4o Transcribe. Набор включает сжатые, обрезанные и содержащие много фонового шума записи.
  • Определение языка: На проверенных высказываниях из IndicVoices ошибка определения языка составляет 2,9% для 10 наиболее распространенных индийских языков. Для всех 22 языков этот показатель составляет 5,22%.

Важно отметить, что все приведенные выше цифры предоставлены производителем. Независимое воспроизведение результатов пока не опубликовано.

5 режимов вывода из 1 модели

Одна и та же аудиозапись может возвращать 5 представлений, выбираемых с помощью параметра mode:

  • transcribe (по умолчанию): оригинальная письменность с нормализованными числами и датами.
  • verbatim: каждое слово в том виде, как оно было произнесено, включая слова-паразиты и произнесенные числа.
  • codemix: оригинальная письменность, при этом английские слова остаются на английском.
  • translit: вся фраза в латинской транслитерации.
  • translate: перевод на английский с нормализованными числами.

Аргумент Sarvam прост. Обработка этих вариантов внутри модели устраняет этапы постобработки, на которых ошибки могут накапливаться.

Подсказки с ключевыми терминами

Подсказки с ключевыми терминами появились в V4 и работают только с saaras:v4. В параметре keyterms передается список JSON, содержащий до 50 терминов длиной до 64 символов каждый. Ключевые термины влияют на распознавание, но не гарантируют появление в результате. Используйте режим codemix, если такой бренд, как PhonePe, должен оставаться написанным латиницей.

На наборе IndicContextEval (статья, Interspeech 2026) Saaras V4 показывает WER 16,03% в сценарии L5 с подсказками по ключевым словам. Sarvam утверждает, что это лучший результат в данном тестировании.

Потоковая передача, длинные аудиозаписи и цены

  • Потоковая передача: WebSocket с промежуточными результатами и временем до первого токена менее 150 мс.
  • REST: синхронная расшифровка фрагментов длительностью до 30 секунд.
  • Пакетная обработка: асинхронные задания для файлов длительностью до 2 часов с возможностью диаризации говорящих.
  • SDK: Python 3.9+ и Node.js 18+, а также интеграции с LiveKit Agents, Pipecat и Vercel AI SDK.
  • Цена: Sarvam указывает стоимость преобразования речи в текст на уровне ₹30 в час для режима реального времени, потоковой и пакетной обработки и ₹45 в час при использовании диаризации.

Saaras v3 остается моделью по умолчанию. V4 использует ту же структуру запроса, поэтому переход требует изменения одной строки.

Saaras V4 в сравнении с ближайшими конкурентами

Ниже представлены 3 системы, с которыми Sarvam сравнивала свою модель. Данные взяты из открытой документации и страниц с ценами каждого поставщика и проверены 26 сентября 2026 года.

ХарактеристикаSarvam Saaras V4Deepgram Nova-3ElevenLabs Scribe v2OpenAI GPT-4o Transcribe
Индийские официально признанные языки (из 22)221114Не указано для каждого языка
Общее количество языков23 (22 индийских + английский)45+90+Мультиязычная
Влияние ключевых терминовДо 50 терминовДа, платное дополнениеДо 1 000 (пакетная обработка), 50 (режим реального времени), платное дополнениеТекстовый prompt
Встроенные режимы вывода5 (transcribe, verbatim, codemix, translit, translate)Расшифровка и Smart FormattingVerbatim или no_verbatimРасшифровка
Потоковая передача в реальном времениWebSocket, менее 150 мс TTFT (заявление производителя)Да (WebSocket)Scribe v2 Realtime, около 150 мсПотоковая передача файлов; в реальном времени через Realtime API
Диаризация говорящихBatch APIДаДо 32 говорящихОтдельная модель gpt-4o-transcribe-diarize
Прейскурантная цена₹30/час$0,0052/мин (мультиязычная модель, предварительно записанная речь)$0,22/час (пакетная обработка)~$0,006/мин
Самостоятельное размещениеПока недоступно для V4 (v3 в SageMaker)ДаОблачный APIОблачный API

Основные выводы

  • Saaras V4 охватывает все 22 индийских языка и глобальный английский в рамках 1 модели.
  • За аудиоэнкодером находится гибридный декодер с пространством состояний и 3 млрд параметров, обученный с нуля.
  • Подсказки с ключевыми терминами поддерживают до 50 терминов и показали WER 16,03% на уровне L5 набора IndicContextEval.
  • 5 режимов вывода и TTFT потоковой передачи менее 150 мс обеспечиваются одной и той же моделью.
  • Сегодня модель доступна только через API по цене ₹30 в час; документация по самостоятельному размещению по-прежнему охватывает v3.

Ознакомьтесь с техническими подробностями. Вся заслуга принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с аудиторией более 150 тысяч участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости