Sarvam AI пуска Saaras V4: модел за преобразуване на реч в текст за всичките 22 индийски езика и глобален английски
Sarvam AI пусна Saaras V4, най-новото поколение на своя модел за разпознаване на реч. Той обхваща всичките 22 официално признати индийски езика плюс английски, като вече включва и глобални английски акценти. Sarvam съобщава за най-висока точност в индустрията и при 22-те езика.
Може ли да бъде внедрен? Да, чрез API на Sarvam още днес, използвайки model="saaras:v4". Теглата не са публични, а документацията на Sarvam за самостоятелно хостване в SageMaker към момента обхваща само Saaras v3.
Какво съдържа Saaras V4
Saaras V4 е система тип енкодер-декодер. Аудио енкодер преобразува вълновата форма във вграждания, които съдържат фонетични и акустични детайли. След това адаптер за времево намаляване на дискретизацията скъсява тази последователност и я проектира в пространството на вгражданията на езиковия модел. Това позволява на дългите записи да останат в рамките на контекста на декодера.
Декодерът е Sarvam-3B — хибриден езиков модел с пространство на състоянията и 3 милиарда параметъра, обучен от нулата вътрешно в компанията. Той обработва аудио характеристиките заедно с текстова подкана. След това генерира транскрипцията авторегресивно, като подава всеки токен обратно като вход за следващия.
Резултати от бенчмарковете
- Английски: Sarvam е оценила 7 набора от данни на английски език. Шест от тях са от Open ASR Leaderboard на Hugging Face: AMI, GigaSpeech, LibriSpeech clean, LibriSpeech other, SPGISpeech и VoxPopuli. Седмият е Svarah на AI4Bharat, съдържащ английски с индийски акцент. Оценяването следва кода за нормализация на класацията. Saaras V4 постига най-ниския среден WER сред моделите, сравнени от Sarvam.
- Индийски езици: При Vistaar Sarvam съобщава резултати за 10 индийски езика, използвайки както WER, така и LLM-WER. LLM-WER включва семантична проверка. Той разграничава реалните грешки в значението от безобидните варианти на изписване или форматиране, често срещани в индийските писмености.
- Шумен звук: При Kathbath Noisy, измерено чрез LLM-WER, Sarvam заявява, че процентът на грешките на Saaras V4 е по-малко от половината от този на Deepgram Nova-3 и GPT-4o Transcribe. Наборът включва компресирани, клипирани и записи с много фонов шум.
- Идентификация на езика: При проверени изказвания от IndicVoices грешката при идентифицирането на езика е 2,9% за 10-те водещи индийски езика. За всичките 22 езика тя е 5,22%.
Важно е да се отбележи, че всички числа по-горе са предоставени от доставчика. Все още няма публикувана независима възпроизводимост на резултатите.
5 режима на извеждане от 1 модел
Един и същ аудиозапис може да върне 5 представяния, избрани чрез параметъра mode:
- transcribe (по подразбиране): оригинална писменост с нормализирани числа и дати.
- verbatim: всяка дума така, както е произнесена, със запазени запълващи думи и произнесени числа.
- codemix: оригинална писменост, като английските думи остават на английски.
- translit: цялото изказване на латиница.
- translate: превод на английски с нормализирани числа.
Аргументът на Sarvam е прост. Обработването на тези варианти вътре в модела премахва стъпките за последваща обработка, които могат да натрупват грешки.
Подсказване с ключови термини
Подсказването с ключови термини е ново във V4 и работи само с saaras:v4. Подавате JSON списък под keyterms, съдържащ до 50 термина с дължина до 64 знака всеки. Ключовите термини влияят върху разпознаването, но не гарантират появата си в резултата. Използвайте режим codemix, когато марка като PhonePe трябва да остане на латиница.
При IndicContextEval (публикация, Interspeech 2026) Saaras V4 отчита 16,03% WER в настройката L5 за подсказване с ключови думи. Sarvam заявява, че това е най-ниският резултат в бенчмарка.
Поточно предаване, дълги аудиозаписи и ценообразуване
- Поточно предаване: WebSocket с частични резултати и време до първия токен под 150 ms.
- REST: синхронна транскрипция за клипове с продължителност до 30 секунди.
- Пакетна обработка: асинхронни задачи за файлове с продължителност до 2 часа, с опционално диаризиране на говорителите.
- SDK: Python 3.9+ и Node.js 18+, както и интеграции с LiveKit Agents, Pipecat и Vercel AI SDK.
- Цена: Sarvam посочва цена за преобразуване на реч в текст от ₹30 на час за работа в реално време, поточно предаване и пакетна обработка, и ₹45 на час с диаризиране.
Saaras v3 остава моделът по подразбиране. V4 използва същата структура на заявката, така че преминаването към него изисква промяна само на 1 ред.
Saaras V4 спрямо най-близките конкуренти
Това са 3-те системи, спрямо които Sarvam е направила сравнение. Данните са от публичната документация и страниците с цени на всеки доставчик, проверени на 26 септември 2026 г.
| Функция | Sarvam Saaras V4 | Deepgram Nova-3 | ElevenLabs Scribe v2 | OpenAI GPT-4o Transcribe |
|---|---|---|---|---|
| Официални индийски езици (от 22) | 22 | 11 | 14 | Не е посочено по език |
| Общ брой езици | 23 (22 индийски + английски) | 45+ | 90+ | Многоезичен |
| Влияние на ключови термини | До 50 термина | Да, платена добавка | До 1000 (пакетна обработка), 50 (в реално време), платена добавка | Текстова prompt |
| Вградени режими на извеждане | 5 (transcribe, verbatim, codemix, translit, translate) | Транскрипция плюс Smart Formatting | Verbatim или no_verbatim | Транскрипция |
| Поточно предаване в реално време | WebSocket, под 150 ms TTFT (твърдение на доставчика) | Да (WebSocket) | Scribe v2 Realtime, около 150 ms | Поточно предаване на файлове; на живо чрез Realtime API |
| Диаризиране на говорители | Batch API | Да | До 32 говорители | Отделен модел gpt-4o-transcribe-diarize |
| Каталожна цена | ₹30/час | $0,0052/мин (многоезичен, предварително записан) | $0,22/час (пакетна обработка) | ~$0,006/мин |
| Самостоятелно хостване | Все още не за V4 (v3 в SageMaker) | Да | Облачен API | Облачен API |
Основни изводи
- Saaras V4 обхваща всичките 22 индийски езика плюс глобален английски в 1 модел.
- Зад аудио енкодера стои хибриден декодер с пространство на състоянията и 3 милиарда параметъра, обучен от нулата.
- Подсказването с ключови термини приема до 50 термина и постига 16,03% WER при L5 в IndicContextEval.
- 5 режима на извеждане и TTFT при поточно предаване под 150 ms идват от един и същ модел.
- Днес е достъпен само чрез API на цена ₹30 на час; документацията за самостоятелно хостване все още обхваща v3.
Вижте Техническите подробности. Всички заслуги са за изследователя на този проект. Също така, можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия 150k+ ML SubReddit и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ издание на продукт ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.