Sarvam AI випускає Saaras V4: модель перетворення мовлення на текст для всіх 22 індійських мов і глобальної англійської
Sarvam AI випустила Saaras V4, нове покоління своєї моделі розпізнавання мовлення. Вона охоплює всі 22 офіційні мови Індії, а також англійську, включно з глобальними англомовними акцентами. Sarvam повідомляє про найвищу точність серед аналогів для всіх 22 мов.
Чи можна її розгорнути? Так, уже сьогодні через API Sarvam, використовуючи model="saaras:v4". Ваги моделі не оприлюднені, а документація Sarvam щодо самостійного хостингу в SageMaker наразі охоплює лише Saaras v3.
Що всередині Saaras V4
Saaras V4 — це система типу енкодер—декодер. Аудіоенкодер перетворює форму сигналу на ембеддинги, що містять фонетичні й акустичні характеристики. Потім адаптер із часовим зменшенням дискретизації скорочує цю послідовність і проєктує її в простір ембеддингів мовної моделі. Це дає змогу утримувати довгі записи в межах контекстного бюджету декодера.
Декодером є Sarvam-3B — гібридна мовна модель із простором станів на 3 млрд параметрів, навчена з нуля власною командою. Вона опрацьовує аудіоознаки разом із текстовим запитом. Потім модель авторегресійно генерує транскрипт, подаючи кожен токен назад як вхідний для наступного.
Результати тестування
- Англійська: Sarvam оцінила модель на 7 англомовних наборах даних. Шість із них походять із відкритого рейтингу ASR Hugging Face: AMI, GigaSpeech, LibriSpeech clean, LibriSpeech other, SPGISpeech і VoxPopuli. Сьомий — це Svarah від AI4Bharat із записами з індійськими акцентами. Оцінювання здійснюється відповідно до коду нормалізації рейтингу. Saaras V4 демонструє найнижчий середній WER серед моделей, протестованих Sarvam.
- Індійські мови: На Vistaar Sarvam повідомляє про результати для 10 індійських мов із використанням як WER, так і LLM-WER. LLM-WER додає семантичну перевірку. Вона відокремлює справжні помилки у значенні від нешкідливих варіантів написання або форматування, поширених в індійських писемностях.
- Зашумлене аудіо: На Kathbath Noisy, де вимірювання проводилося за допомогою LLM-WER, Sarvam заявляє, що рівень помилок Saaras V4 менш ніж удвічі нижчий, ніж у Deepgram Nova-3 і GPT-4o Transcribe. Набір містить стиснені, обрізані записи та записи зі значним фоновим шумом.
- Визначення мови: На перевірених висловлюваннях IndicVoices помилка визначення мови становить 2,9% для 10 основних індійських мов. Для всіх 22 мов цей показник становить 5,22%.
Важливо зазначити, що всі наведені вище цифри повідомлені постачальником. Незалежне відтворення результатів ще не опубліковане.
5 режимів виведення з 1 моделі
Те саме аудіо може повертатися у 5 представленнях, які обираються за допомогою параметра mode:
- transcribe (за замовчуванням): оригінальна писемність із нормалізованими числами та датами.
- verbatim: кожне слово відтворюється так, як було вимовлено, зі збереженням слів-паразитів і вимовлених чисел.
- codemix: оригінальна писемність, а англійські слова залишаються англійською.
- translit: усе висловлювання латинською абеткою.
- translate: переклад англійською з нормалізованими числами.
Аргумент Sarvam простий. Обробка цих аспектів безпосередньо в моделі усуває етапи постобробки, які можуть накопичувати помилки.
Підказування ключових термінів
Підказування ключових термінів — нова функція у V4, яка працює лише з saaras:v4. Потрібно передати список JSON у параметрі keyterms, що містить до 50 термінів довжиною до 64 символів кожен. Ключові терміни впливають на розпізнавання, але не гарантують їх появу у вихідних даних. Використовуйте режим codemix, якщо такий бренд, як PhonePe, має залишатися латиницею.
На IndicContextEval (стаття, Interspeech 2026) Saaras V4 демонструє WER 16,03% у сценарії L5 з підказуванням ключових слів. Sarvam стверджує, що це найнижчий результат у цьому тестуванні.
Потокова обробка, довгі аудіозаписи та ціни
- Потокова обробка: WebSocket із проміжними результатами та часом до першого токена менше ніж 150 мс.
- REST: синхронна транскрипція фрагментів тривалістю до 30 секунд.
- Пакетна обробка: асинхронні завдання для файлів тривалістю до 2 годин із можливістю додати діаризацію мовців.
- SDK: Python 3.9+ і Node.js 18+, а також інтеграції з LiveKit Agents, Pipecat і Vercel AI SDK.
- Ціна: Sarvam вказує вартість перетворення мовлення на текст на рівні ₹30 за годину для режимів реального часу, потокової та пакетної обробки, а також ₹45 за годину з діаризацією.
Saaras v3 залишається моделлю за замовчуванням. V4 використовує таку саму структуру запиту, тому перехід потребує зміни лише одного рядка.
Saaras V4 у порівнянні з найближчими конкурентами
Це 3 системи, з якими Sarvam порівнювала свою модель. Дані взято з публічної документації та сторінок із цінами кожного постачальника й перевірено 26 вересня 2026 року.
| Функція | Sarvam Saaras V4 | Deepgram Nova-3 | ElevenLabs Scribe v2 | OpenAI GPT-4o Transcribe |
|---|---|---|---|---|
| Офіційні індійські мови (з 22) | 22 | 11 | 14 | Не вказано для кожної мови |
| Загальна кількість мов | 23 (22 індійські + англійська) | 45+ | 90+ | Мультимовна |
| Вплив ключових термінів | До 50 термінів | Так, платне доповнення | До 1 000 (пакетна обробка), 50 (реальний час), платне доповнення | Текстове поле prompt |
| Вбудовані режими виведення | 5 (transcribe, verbatim, codemix, translit, translate) | Транскрипт і Smart Formatting | Verbatim або no_verbatim | Транскрипт |
| Потокова обробка в реальному часі | WebSocket, TTFT менше 150 мс (заявлено постачальником) | Так (WebSocket) | Scribe v2 Realtime, близько 150 мс | Потокова передача файлів; у реальному часі через Realtime API |
| Діаризація мовців | Batch API | Так | До 32 мовців | Окрема модель gpt-4o-transcribe-diarize |
| Базова ціна | ₹30/год | $0.0052/хв (мультимовна, попередньо записана мова) | $0.22/год (пакетна обробка) | ~$0.006/хв |
| Самостійний хостинг | Ще недоступний для V4 (v3 у SageMaker) | Так | Хмарний API | Хмарний API |
Основні висновки
- Saaras V4 охоплює всі 22 індійські мови та глобальну англійську в 1 моделі.
- В основі моделі лежить гібридний декодер із простором станів на 3 млрд параметрів, навчений з нуля, та аудіоенкодер.
- Підказування ключових термінів підтримує до 50 термінів і показало WER 16,03% на IndicContextEval L5.
- 5 режимів виведення та TTFT потокової обробки менш ніж 150 мс доступні в одній моделі.
- Сьогодні доступна лише через API за ціною ₹30 за годину; документація щодо самостійного хостингу все ще охоплює v3.
Ознайомтеся з технічними деталями. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту 150k+ ML та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібна співпраця з нами для просування вашого репозиторію GitHub АБО сторінки на Hugging Face, АБО релізу продукту, АБО вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.