Gemini 3.5 Transcribe від Google перетворює мовлення на текст 85 мовами, автоматично виправляючи обмовки
Google запустила Gemini 3.5 Transcribe — модель перетворення мовлення на текст для транскрибування в реальному часі. Вона автоматично розпізнає понад 85 мов, вилучає слова-паразити на кшталт «ем», виправляє обмовки та самостійно форматує текст. За даними Google, рівень помилок у словах становить 4,0 відсотка для потокового аудіо та 2,6 відсотка для записаного аудіо, а затримка на 70 відсотків нижча, ніж у попередньої моделі Chirp 3. За допомогою «виклику функцій» модель може передавати такі завдання, як генерація зображень або вебпошук, іншим моделям Gemini.
Модель постачається з двома інтерфейсами.API Live API забезпечує потокову передачу в реальному часі з дуже низькою затримкою (gemini-3.5-transcribe-live), тоді як Interactions API обробляє записане аудіо із зазначенням мовців і часовими мітками (gemini-3.5-transcribe). Модель уже доступна в Google AI Studio і на Gemini Enterprise Agent Platform. Вона вже інтегрована в Gboard для Android (через «Rambler») і застосунок Gemini для macOS, а підтримка Chrome з’явиться найближчим часом.
Новини про ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний шість разів на рік звіт про передові розробки «AI Radar», повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.