Sarvam AI выпускает Saaras V4: модель преобразования речи в текст для всех 22 индийских языков и глобального английского
Sarvam AI выпустила Saaras V4 — новое поколение своей модели распознавания речи. Она охватывает все 22 официально признанных индийских языка, а также английский, включая теперь акценты английского со всего мира. Sarvam сообщает о лучшей в своем классе точности для всех 22 языков.
Возможна ли ее интеграция? Да, уже сегодня через API Sarvam с использованием model="saaras:v4". Веса модели не опубликованы, а документация Sarvam по самостоятельному размещению в SageMaker пока охватывает только Saaras v3.
Что внутри Saaras V4
Saaras V4 — это система с архитектурой энкодер–декодер. Аудиоэнкодер преобразует звуковую волну в эмбеддинги, содержащие фонетические и акустические характеристики. Затем адаптер с временным уменьшением дискретизации сокращает эту последовательность и проецирует ее в пространство эмбеддингов языковой модели. Благодаря этому длинные записи помещаются в контекстное окно декодера.
В качестве декодера используется Sarvam-3B — гибридная языковая модель с пространством состояний и 3 млрд параметров, обученная с нуля внутри компании. Она считывает аудиопризнаки вместе с текстовым промптом. Затем модель авторегрессионно генерирует расшифровку, подавая каждый токен обратно на вход для получения следующего.
Результаты тестирования
- Английский язык: Sarvam протестировала модель на 7 наборах данных для английского языка. Шесть из них взяты из Open ASR Leaderboard на Hugging Face: AMI, GigaSpeech, LibriSpeech clean, LibriSpeech other, SPGISpeech и VoxPopuli. Седьмой — индийский набор данных с акцентами Svarah от AI4Bharat. Оценка проводится с использованием кода нормализации лидерборда. Saaras V4 показывает самый низкий средний WER среди протестированных Sarvam моделей.
- Индийские языки: На наборе Vistaar Sarvam сообщает о результатах для 10 индийских языков с использованием как WER, так и LLM-WER. LLM-WER добавляет семантическую проверку. Он отделяет реальные ошибки в значении от несущественных вариантов написания или форматирования, часто встречающихся в индийских письменностях.
- Зашумленный звук: На наборе Kathbath Noisy, измеренном с помощью LLM-WER, Sarvam утверждает, что уровень ошибок Saaras V4 менее чем вдвое ниже, чем у Deepgram Nova-3 и GPT-4o Transcribe. Набор включает сжатые, обрезанные и содержащие много фонового шума записи.
- Определение языка: На проверенных высказываниях из IndicVoices ошибка определения языка составляет 2,9% для 10 наиболее распространенных индийских языков. Для всех 22 языков этот показатель составляет 5,22%.
Важно отметить, что все приведенные выше цифры предоставлены производителем. Независимое воспроизведение результатов пока не опубликовано.
5 режимов вывода из 1 модели
Одна и та же аудиозапись может возвращать 5 представлений, выбираемых с помощью параметра mode:
- transcribe (по умолчанию): оригинальная письменность с нормализованными числами и датами.
- verbatim: каждое слово в том виде, как оно было произнесено, включая слова-паразиты и произнесенные числа.
- codemix: оригинальная письменность, при этом английские слова остаются на английском.
- translit: вся фраза в латинской транслитерации.
- translate: перевод на английский с нормализованными числами.
Аргумент Sarvam прост. Обработка этих вариантов внутри модели устраняет этапы постобработки, на которых ошибки могут накапливаться.
Подсказки с ключевыми терминами
Подсказки с ключевыми терминами появились в V4 и работают только с saaras:v4. В параметре keyterms передается список JSON, содержащий до 50 терминов длиной до 64 символов каждый. Ключевые термины влияют на распознавание, но не гарантируют появление в результате. Используйте режим codemix, если такой бренд, как PhonePe, должен оставаться написанным латиницей.
На наборе IndicContextEval (статья, Interspeech 2026) Saaras V4 показывает WER 16,03% в сценарии L5 с подсказками по ключевым словам. Sarvam утверждает, что это лучший результат в данном тестировании.
Потоковая передача, длинные аудиозаписи и цены
- Потоковая передача: WebSocket с промежуточными результатами и временем до первого токена менее 150 мс.
- REST: синхронная расшифровка фрагментов длительностью до 30 секунд.
- Пакетная обработка: асинхронные задания для файлов длительностью до 2 часов с возможностью диаризации говорящих.
- SDK: Python 3.9+ и Node.js 18+, а также интеграции с LiveKit Agents, Pipecat и Vercel AI SDK.
- Цена: Sarvam указывает стоимость преобразования речи в текст на уровне ₹30 в час для режима реального времени, потоковой и пакетной обработки и ₹45 в час при использовании диаризации.
Saaras v3 остается моделью по умолчанию. V4 использует ту же структуру запроса, поэтому переход требует изменения одной строки.
Saaras V4 в сравнении с ближайшими конкурентами
Ниже представлены 3 системы, с которыми Sarvam сравнивала свою модель. Данные взяты из открытой документации и страниц с ценами каждого поставщика и проверены 26 сентября 2026 года.
| Характеристика | Sarvam Saaras V4 | Deepgram Nova-3 | ElevenLabs Scribe v2 | OpenAI GPT-4o Transcribe |
|---|---|---|---|---|
| Индийские официально признанные языки (из 22) | 22 | 11 | 14 | Не указано для каждого языка |
| Общее количество языков | 23 (22 индийских + английский) | 45+ | 90+ | Мультиязычная |
| Влияние ключевых терминов | До 50 терминов | Да, платное дополнение | До 1 000 (пакетная обработка), 50 (режим реального времени), платное дополнение | Текстовый prompt |
| Встроенные режимы вывода | 5 (transcribe, verbatim, codemix, translit, translate) | Расшифровка и Smart Formatting | Verbatim или no_verbatim | Расшифровка |
| Потоковая передача в реальном времени | WebSocket, менее 150 мс TTFT (заявление производителя) | Да (WebSocket) | Scribe v2 Realtime, около 150 мс | Потоковая передача файлов; в реальном времени через Realtime API |
| Диаризация говорящих | Batch API | Да | До 32 говорящих | Отдельная модель gpt-4o-transcribe-diarize |
| Прейскурантная цена | ₹30/час | $0,0052/мин (мультиязычная модель, предварительно записанная речь) | $0,22/час (пакетная обработка) | ~$0,006/мин |
| Самостоятельное размещение | Пока недоступно для V4 (v3 в SageMaker) | Да | Облачный API | Облачный API |
Основные выводы
- Saaras V4 охватывает все 22 индийских языка и глобальный английский в рамках 1 модели.
- За аудиоэнкодером находится гибридный декодер с пространством состояний и 3 млрд параметров, обученный с нуля.
- Подсказки с ключевыми терминами поддерживают до 50 терминов и показали WER 16,03% на уровне L5 набора IndicContextEval.
- 5 режимов вывода и TTFT потоковой передачи менее 150 мс обеспечиваются одной и той же моделью.
- Сегодня модель доступна только через API по цене ₹30 в час; документация по самостоятельному размещению по-прежнему охватывает v3.
Ознакомьтесь с техническими подробностями. Вся заслуга принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с аудиторией более 150 тысяч участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.