Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Sarvam AI випускає Saaras V4: модель перетворення мовлення на текст для всіх 22 індійських мов і глобальної англійської

Sarvam AI випустила Saaras V4, нове покоління своєї моделі розпізнавання мовлення. Вона охоплює всі 22 офіційні мови Індії, а також англійську, включно з глобальними англомовними акцентами. Sarvam повідомляє про найвищу точність серед аналогів для всіх 22 мов.

Чи можна її розгорнути? Так, уже сьогодні через API Sarvam, використовуючи model="saaras:v4". Ваги моделі не оприлюднені, а документація Sarvam щодо самостійного хостингу в SageMaker наразі охоплює лише Saaras v3.

Що всередині Saaras V4

Saaras V4 — це система типу енкодер—декодер. Аудіоенкодер перетворює форму сигналу на ембеддинги, що містять фонетичні й акустичні характеристики. Потім адаптер із часовим зменшенням дискретизації скорочує цю послідовність і проєктує її в простір ембеддингів мовної моделі. Це дає змогу утримувати довгі записи в межах контекстного бюджету декодера.

Декодером є Sarvam-3B — гібридна мовна модель із простором станів на 3 млрд параметрів, навчена з нуля власною командою. Вона опрацьовує аудіоознаки разом із текстовим запитом. Потім модель авторегресійно генерує транскрипт, подаючи кожен токен назад як вхідний для наступного.

Результати тестування

  • Англійська: Sarvam оцінила модель на 7 англомовних наборах даних. Шість із них походять із відкритого рейтингу ASR Hugging Face: AMI, GigaSpeech, LibriSpeech clean, LibriSpeech other, SPGISpeech і VoxPopuli. Сьомий — це Svarah від AI4Bharat із записами з індійськими акцентами. Оцінювання здійснюється відповідно до коду нормалізації рейтингу. Saaras V4 демонструє найнижчий середній WER серед моделей, протестованих Sarvam.
  • Індійські мови: На Vistaar Sarvam повідомляє про результати для 10 індійських мов із використанням як WER, так і LLM-WER. LLM-WER додає семантичну перевірку. Вона відокремлює справжні помилки у значенні від нешкідливих варіантів написання або форматування, поширених в індійських писемностях.
  • Зашумлене аудіо: На Kathbath Noisy, де вимірювання проводилося за допомогою LLM-WER, Sarvam заявляє, що рівень помилок Saaras V4 менш ніж удвічі нижчий, ніж у Deepgram Nova-3 і GPT-4o Transcribe. Набір містить стиснені, обрізані записи та записи зі значним фоновим шумом.
  • Визначення мови: На перевірених висловлюваннях IndicVoices помилка визначення мови становить 2,9% для 10 основних індійських мов. Для всіх 22 мов цей показник становить 5,22%.

Важливо зазначити, що всі наведені вище цифри повідомлені постачальником. Незалежне відтворення результатів ще не опубліковане.

5 режимів виведення з 1 моделі

Те саме аудіо може повертатися у 5 представленнях, які обираються за допомогою параметра mode:

  • transcribe (за замовчуванням): оригінальна писемність із нормалізованими числами та датами.
  • verbatim: кожне слово відтворюється так, як було вимовлено, зі збереженням слів-паразитів і вимовлених чисел.
  • codemix: оригінальна писемність, а англійські слова залишаються англійською.
  • translit: усе висловлювання латинською абеткою.
  • translate: переклад англійською з нормалізованими числами.

Аргумент Sarvam простий. Обробка цих аспектів безпосередньо в моделі усуває етапи постобробки, які можуть накопичувати помилки.

Підказування ключових термінів

Підказування ключових термінів — нова функція у V4, яка працює лише з saaras:v4. Потрібно передати список JSON у параметрі keyterms, що містить до 50 термінів довжиною до 64 символів кожен. Ключові терміни впливають на розпізнавання, але не гарантують їх появу у вихідних даних. Використовуйте режим codemix, якщо такий бренд, як PhonePe, має залишатися латиницею.

На IndicContextEval (стаття, Interspeech 2026) Saaras V4 демонструє WER 16,03% у сценарії L5 з підказуванням ключових слів. Sarvam стверджує, що це найнижчий результат у цьому тестуванні.

Потокова обробка, довгі аудіозаписи та ціни

  • Потокова обробка: WebSocket із проміжними результатами та часом до першого токена менше ніж 150 мс.
  • REST: синхронна транскрипція фрагментів тривалістю до 30 секунд.
  • Пакетна обробка: асинхронні завдання для файлів тривалістю до 2 годин із можливістю додати діаризацію мовців.
  • SDK: Python 3.9+ і Node.js 18+, а також інтеграції з LiveKit Agents, Pipecat і Vercel AI SDK.
  • Ціна: Sarvam вказує вартість перетворення мовлення на текст на рівні ₹30 за годину для режимів реального часу, потокової та пакетної обробки, а також ₹45 за годину з діаризацією.

Saaras v3 залишається моделлю за замовчуванням. V4 використовує таку саму структуру запиту, тому перехід потребує зміни лише одного рядка.

Saaras V4 у порівнянні з найближчими конкурентами

Це 3 системи, з якими Sarvam порівнювала свою модель. Дані взято з публічної документації та сторінок із цінами кожного постачальника й перевірено 26 вересня 2026 року.

ФункціяSarvam Saaras V4Deepgram Nova-3ElevenLabs Scribe v2OpenAI GPT-4o Transcribe
Офіційні індійські мови (з 22)221114Не вказано для кожної мови
Загальна кількість мов23 (22 індійські + англійська)45+90+Мультимовна
Вплив ключових термінівДо 50 термінівТак, платне доповненняДо 1 000 (пакетна обробка), 50 (реальний час), платне доповненняТекстове поле prompt
Вбудовані режими виведення5 (transcribe, verbatim, codemix, translit, translate)Транскрипт і Smart FormattingVerbatim або no_verbatimТранскрипт
Потокова обробка в реальному часіWebSocket, TTFT менше 150 мс (заявлено постачальником)Так (WebSocket)Scribe v2 Realtime, близько 150 мсПотокова передача файлів; у реальному часі через Realtime API
Діаризація мовцівBatch APIТакДо 32 мовцівОкрема модель gpt-4o-transcribe-diarize
Базова ціна₹30/год$0.0052/хв (мультимовна, попередньо записана мова)$0.22/год (пакетна обробка)~$0.006/хв
Самостійний хостингЩе недоступний для V4 (v3 у SageMaker)ТакХмарний APIХмарний API

Основні висновки

  • Saaras V4 охоплює всі 22 індійські мови та глобальну англійську в 1 моделі.
  • В основі моделі лежить гібридний декодер із простором станів на 3 млрд параметрів, навчений з нуля, та аудіоенкодер.
  • Підказування ключових термінів підтримує до 50 термінів і показало WER 16,03% на IndicContextEval L5.
  • 5 режимів виведення та TTFT потокової обробки менш ніж 150 мс доступні в одній моделі.
  • Сьогодні доступна лише через API за ціною ₹30 за годину; документація щодо самостійного хостингу все ще охоплює v3.

Ознайомтеся з технічними деталями. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту 150k+ ML та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Потрібна співпраця з нами для просування вашого репозиторію GitHub АБО сторінки на Hugging Face, АБО релізу продукту, АБО вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини