Google AI представи Gemini 3.5 Transcribe: модел за преобразуване на реч в текст със среден WER от 2,6% на над 85 езика
Google пусна Gemini 3.5 Transcribe, модел за преобразуване на реч в текст в реално време и за записан звук. Той се предлага като два крайни интерфейса, а не като един. gemini-3.5-transcribe обработва предварително записани файлове чрез Interactions API. gemini-3.5-transcribe-live обработва двупосочно поточно предаване чрез Live API. Google отчита среден процент грешки на думите от 4,0% при поточно предаване и 2,6% при непоточно предаване според измерванията на Artificial Analysis. Времето до финалната транскрипция е с 70% по-добро в сравнение с Chirp 3, предишния модел. Автоматичното откриване обхваща над 85 езика, включително превключване между езици в рамките на едно изречение. Разделението между двата крайни интерфейса е частта, която си струва да бъде взета предвид при планирането. Те не споделят един и същ набор от функции, ограничения или цена.
Може ли да бъде внедрен?
Да, но само чрез API. Няма отворени тегла и няма възможност за самостоятелно хостване. Това е решение за управлявана услуга, а не за инфраструктура.
- Ниво на компанията: Всякакъв. Самостоятелни разработчици и стартъпи могат да започнат с безплатното ниво на Gemini API чрез Google AI Studio. Средните компании преминават към платеното ниво за по-високи ограничения на заявките. Платеното ниво също така гарантира, че съдържанието няма да бъде използвано за подобряване на продуктите на Google. Регулираните предприятия използват Gemini Enterprise Agent Platform, която добавя осигурена пропускателна способност, средства за контрол на съответствието и отстъпки за обем. И двете направления — за разработчици и за предприятия — са в публичен предварителен преглед, така че съобразете съответно ангажиментите си за продукционна употреба.
- Индустрии: Контактни центрове и CX платформи, клинична документация, субтитриране и локализация на медии, приемане на заявления в правния и застрахователния сектор, инструменти за срещи и инструменти за разработчици, управлявани чрез глас.
- Приложения: Гласови агенти в реално време, субтитри в реално време, конвейери за анализ след разговори, транскрипция на срещи с идентифициране на говорителите, диктовка и интерфейси, управлявани чрез глас.
Два API интерфейса, два различни продукта
Live API осигурява непрекъсната транскрипция с латентност под една секунда. Той изпраща interim_input_transcription за предварителни частични резултати, докато човекът все още говори, а след това input_transcription, когато ходът на разговора приключи. Аудиото се подава като необработен 16-битов PCM формат при 16kHz моно, на фрагменти от 100 ms. Поддържа автоматично, хибридно и ръчно откриване на гласова активност. Ефимерните токени позволяват на мобилни и уеб клиенти да предават поточно данни, без да съхраняват API ключ.
Ограниченията са реални. Live сесиите са ограничени до 10 минути непрекъснато поточно предаване. Диаризацията на говорителите не се поддържа. Клеймата за време на ниво дума не се поддържат.
Interactions API покрива това, което поточното предаване не може. Той предлага диаризация на говорителите, начални и крайни отмествания на ниво дума и настройване чрез персонализиран речник. Списъкът с речникови термини може да съдържа до 1000 термина, като най-добрите резултати са при под 100. Стандартните заявки приемат до един час аудио. Това се намалява до 30 минути, когато са активирани диаризация или времеви клейма на ниво дума.
Действителният дизайнерски избор е между дословен и интелигентен режим
И двата крайни интерфейса предлагат два режима. verbatim е режимът по подразбиране и връща всичко, включително паразитни думи, повторения и фалстартове. smart премахва неуместните прекъсвания, разрешава устните самокорекции директно в текста и прилага структурирано форматиране.
Собственият документиран пример на Google: „Ъм, за срещата мисля, че трябва, ъъ, да поканим Алис и, чакай, не, Боб и Карол.“ Дословният режим запазва всичко. Интелигентният връща „За срещата мисля, че трябва да поканим Боб и Карол.“
Интелигентният режим не може да се комбинира с времеви клейма или диаризация. Това е компромисът, който трябва да бъде взет предвид при планирането. Четимото обобщение и проверимият транскрипт вече са две различни API заявки.
Производителност
Според измерванията на Artificial Analysis Google отчита среден процент грешки на думите от 4,0% при поточно предаване и 2,6% при непоточно предаване. При многоезичния бенчмарк FLEURS, за набор от водещи езици и локали, моделът отчита 5,50% при поточно предаване и 5,04% при непоточно предаване.
В сравнение с Chirp 3, предишния модел за транскрипция на Google, времето до финалната транскрипция е подобрено със 70%. Езиковото покритие обхваща над 85 локала с автоматично откриване и превключване между езици без необходимост от конфигуриране.
Екосистема
Live API вече е интегриран с LiveKit, Pipecat, Agora, Fishjam, Vercel и Vision Agents. От потребителска страна моделът захранва Rambler на Android, приложението Gemini за macOS и Google Antigravity. Chrome е посочен като предстоящ.
Основни изводи
- Два крайни интерфейса, а не един: поточното предаване жертва диаризацията и времевите клейма на ниво дума в полза на латентност под една секунда.
- Отчетеният процент грешки на думите е 4,0% при поточно предаване и 2,6% при непоточно предаване според Artificial Analysis.
- Интелигентният режим не може да се комбинира с времеви клейма или диаризация — изберете едно от тях за всяка заявка.
- Смесената цена е около 0,005 щ.д./минута за пакетна обработка и 0,009 щ.д./минута за Live; няма отворени тегла.
- Твърди ограничения: 10-минутни Live сесии, файлове до 1 час и 30 минути при активирана диаризация.
Вижте техническите подробности тук. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit с над 150 хил. членове за машинно обучение и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Имате нужда да си партнирате с нас за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово издание, уебинар и др.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.