Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Sarvam AI пуска Saaras V4: модел за преобразуване на реч в текст за всичките 22 индийски езика и глобален английски

Sarvam AI пусна Saaras V4, най-новото поколение на своя модел за разпознаване на реч. Той обхваща всичките 22 официално признати индийски езика плюс английски, като вече включва и глобални английски акценти. Sarvam съобщава за най-висока точност в индустрията и при 22-те езика.

Може ли да бъде внедрен? Да, чрез API на Sarvam още днес, използвайки model="saaras:v4". Теглата не са публични, а документацията на Sarvam за самостоятелно хостване в SageMaker към момента обхваща само Saaras v3.

Какво съдържа Saaras V4

Saaras V4 е система тип енкодер-декодер. Аудио енкодер преобразува вълновата форма във вграждания, които съдържат фонетични и акустични детайли. След това адаптер за времево намаляване на дискретизацията скъсява тази последователност и я проектира в пространството на вгражданията на езиковия модел. Това позволява на дългите записи да останат в рамките на контекста на декодера.

Декодерът е Sarvam-3B — хибриден езиков модел с пространство на състоянията и 3 милиарда параметъра, обучен от нулата вътрешно в компанията. Той обработва аудио характеристиките заедно с текстова подкана. След това генерира транскрипцията авторегресивно, като подава всеки токен обратно като вход за следващия.

Резултати от бенчмарковете

  • Английски: Sarvam е оценила 7 набора от данни на английски език. Шест от тях са от Open ASR Leaderboard на Hugging Face: AMI, GigaSpeech, LibriSpeech clean, LibriSpeech other, SPGISpeech и VoxPopuli. Седмият е Svarah на AI4Bharat, съдържащ английски с индийски акцент. Оценяването следва кода за нормализация на класацията. Saaras V4 постига най-ниския среден WER сред моделите, сравнени от Sarvam.
  • Индийски езици: При Vistaar Sarvam съобщава резултати за 10 индийски езика, използвайки както WER, така и LLM-WER. LLM-WER включва семантична проверка. Той разграничава реалните грешки в значението от безобидните варианти на изписване или форматиране, често срещани в индийските писмености.
  • Шумен звук: При Kathbath Noisy, измерено чрез LLM-WER, Sarvam заявява, че процентът на грешките на Saaras V4 е по-малко от половината от този на Deepgram Nova-3 и GPT-4o Transcribe. Наборът включва компресирани, клипирани и записи с много фонов шум.
  • Идентификация на езика: При проверени изказвания от IndicVoices грешката при идентифицирането на езика е 2,9% за 10-те водещи индийски езика. За всичките 22 езика тя е 5,22%.

Важно е да се отбележи, че всички числа по-горе са предоставени от доставчика. Все още няма публикувана независима възпроизводимост на резултатите.

5 режима на извеждане от 1 модел

Един и същ аудиозапис може да върне 5 представяния, избрани чрез параметъра mode:

  • transcribe (по подразбиране): оригинална писменост с нормализирани числа и дати.
  • verbatim: всяка дума така, както е произнесена, със запазени запълващи думи и произнесени числа.
  • codemix: оригинална писменост, като английските думи остават на английски.
  • translit: цялото изказване на латиница.
  • translate: превод на английски с нормализирани числа.

Аргументът на Sarvam е прост. Обработването на тези варианти вътре в модела премахва стъпките за последваща обработка, които могат да натрупват грешки.

Подсказване с ключови термини

Подсказването с ключови термини е ново във V4 и работи само с saaras:v4. Подавате JSON списък под keyterms, съдържащ до 50 термина с дължина до 64 знака всеки. Ключовите термини влияят върху разпознаването, но не гарантират появата си в резултата. Използвайте режим codemix, когато марка като PhonePe трябва да остане на латиница.

При IndicContextEval (публикация, Interspeech 2026) Saaras V4 отчита 16,03% WER в настройката L5 за подсказване с ключови думи. Sarvam заявява, че това е най-ниският резултат в бенчмарка.

Поточно предаване, дълги аудиозаписи и ценообразуване

  • Поточно предаване: WebSocket с частични резултати и време до първия токен под 150 ms.
  • REST: синхронна транскрипция за клипове с продължителност до 30 секунди.
  • Пакетна обработка: асинхронни задачи за файлове с продължителност до 2 часа, с опционално диаризиране на говорителите.
  • SDK: Python 3.9+ и Node.js 18+, както и интеграции с LiveKit Agents, Pipecat и Vercel AI SDK.
  • Цена: Sarvam посочва цена за преобразуване на реч в текст от ₹30 на час за работа в реално време, поточно предаване и пакетна обработка, и ₹45 на час с диаризиране.

Saaras v3 остава моделът по подразбиране. V4 използва същата структура на заявката, така че преминаването към него изисква промяна само на 1 ред.

Saaras V4 спрямо най-близките конкуренти

Това са 3-те системи, спрямо които Sarvam е направила сравнение. Данните са от публичната документация и страниците с цени на всеки доставчик, проверени на 26 септември 2026 г.

ФункцияSarvam Saaras V4Deepgram Nova-3ElevenLabs Scribe v2OpenAI GPT-4o Transcribe
Официални индийски езици (от 22)221114Не е посочено по език
Общ брой езици23 (22 индийски + английски)45+90+Многоезичен
Влияние на ключови терминиДо 50 терминаДа, платена добавкаДо 1000 (пакетна обработка), 50 (в реално време), платена добавкаТекстова prompt
Вградени режими на извеждане5 (transcribe, verbatim, codemix, translit, translate)Транскрипция плюс Smart FormattingVerbatim или no_verbatimТранскрипция
Поточно предаване в реално времеWebSocket, под 150 ms TTFT (твърдение на доставчика)Да (WebSocket)Scribe v2 Realtime, около 150 msПоточно предаване на файлове; на живо чрез Realtime API
Диаризиране на говорителиBatch APIДаДо 32 говорителиОтделен модел gpt-4o-transcribe-diarize
Каталожна цена₹30/час$0,0052/мин (многоезичен, предварително записан)$0,22/час (пакетна обработка)~$0,006/мин
Самостоятелно хостванеВсе още не за V4 (v3 в SageMaker)ДаОблачен APIОблачен API

Основни изводи

  • Saaras V4 обхваща всичките 22 индийски езика плюс глобален английски в 1 модел.
  • Зад аудио енкодера стои хибриден декодер с пространство на състоянията и 3 милиарда параметъра, обучен от нулата.
  • Подсказването с ключови термини приема до 50 термина и постига 16,03% WER при L5 в IndicContextEval.
  • 5 режима на извеждане и TTFT при поточно предаване под 150 ms идват от един и същ модел.
  • Днес е достъпен само чрез API на цена ₹30 на час; документацията за самостоятелно хостване все още обхваща v3.

Вижте Техническите подробности. Всички заслуги са за изследователя на този проект. Също така, можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия 150k+ ML SubReddit и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ издание на продукт ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини