Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

Google AI випустила Gemini 3.5 Transcribe: модель перетворення мовлення на текст із середнім WER 2,6% для понад 85 мов

Google випустила Gemini 3.5 Transcribe — модель перетворення мовлення на текст для голосових інтерфейсів у реальному часі та записаного аудіо. Вона постачається у вигляді двох кінцевих точок, а не однієї. gemini-3.5-transcribe обробляє попередньо записані файли через Interactions API. gemini-3.5-transcribe-live забезпечує двонапрямну потокову передачу через Live API. За даними Google, середній рівень помилок у словах становить 4,0% для потокового режиму та 2,6% для непотокового, за вимірюваннями Artificial Analysis. Час до отримання фінальної транскрипції скоротився на 70% порівняно з Chirp 3, попередньою моделлю. Автоматичне визначення охоплює понад 85 мов, зокрема перемикання мов посеред речення. Саме розподіл між двома кінцевими точками потребує окремого планування. Вони мають різні набори функцій, обмеження та ціни.

Чи придатна вона для розгортання?

Так, але лише через API. Відкритих ваг і можливості самостійного розгортання немає. Це рішення щодо керованого сервісу, а не інфраструктури.

  • Рівень компанії: Будь-який. Індивідуальні розробники та стартапи можуть почати з безкоштовного рівня Gemini API через Google AI Studio. Команди середнього бізнесу переходять на платний рівень заради вищих лімітів запитів. Платний рівень також гарантує, що контент не використовуватиметься для вдосконалення продуктів Google. Регульовані підприємства працюють через Gemini Enterprise Agent Platform, яка додає виділену пропускну здатність, засоби контролю відповідності вимогам і знижки за обсяг. Обидва напрямки — для розробників і підприємств — перебувають у публічній попередній версії, тому відповідні зобов’язання щодо використання у продакшені слід оцінювати з урахуванням цього.
  • Галузі: Контакт-центри та CX-платформи, клінічна документація, субтитрування й локалізація медіа, юридичний та страховий прийом заявок, інструменти для зустрічей і голосові інструменти для розробників.
  • Застосунки: Голосові агенти в реальному часі, субтитрування наживо, конвеєри аналітики після дзвінків, транскрибування зустрічей із зазначенням спікерів, диктування та інтерфейси з голосовим керуванням.

Дві поверхні API, два різні продукти

Live API забезпечує безперервне транскрибування із затримкою менше секунди. Він надсилає interim_input_transcription для попередніх часткових результатів, поки людина ще говорить, а потім input_transcription, коли репліка завершується. Аудіо надходить як необроблений 16-бітний PCM у форматі моно з частотою 16 кГц, фрагментами по 100 мс. Підтримуються автоматичне, гібридне та ручне визначення голосової активності. Ефемерні токени дають змогу мобільним і вебклієнтам передавати дані без зберігання ключа API.

Обмеження є суттєвими. Тривалість безперервної потокової передачі в сеансах Live обмежена 10 хвилинами. Діаризація спікерів не підтримується. Позначки часу на рівні слів не підтримуються.

Interactions API охоплює те, чого не може потокова передача. Він пропонує діаризацію спікерів, початкові та кінцеві зміщення на рівні слів, а також налаштування словника користувача. Список словника може містити до 1 000 термінів, хоча найкращі результати дають списки до 100 термінів. Стандартні запити приймають аудіо тривалістю до однієї години. Якщо ввімкнено діаризацію або часові позначки слів, цей ліміт зменшується до 30 хвилин.

Дослівний і інтелектуальний режими — ось справжнє дизайнерське рішення

Обидві кінцеві точки підтримують два режими. verbatim є режимом за замовчуванням і повертає все, зокрема слова-паразити, повтори та незавершені фрази. smart видаляє мовні запинки, безпосередньо виправляє усні самовиправлення та застосовує структуроване форматування.

Власний приклад Google: «Ем, отже, щодо зустрічі, я думаю, нам варто, е-е, запросити Алісу і, ні, зачекайте, Боба та Керол». Дослівний режим зберігає все це. Інтелектуальний повертає «Щодо зустрічі, я думаю, нам варто запросити Боба та Керол».

Інтелектуальний режим не можна поєднувати з часовими позначками слів або діаризацією. Саме це обмеження слід враховувати під час планування. Читабельний підсумок і придатна для аудиту транскрипція тепер потребують двох різних викликів API.

Продуктивність

За вимірюваннями Artificial Analysis, Google повідомляє про середній рівень помилок у словах 4,0% для потокового режиму та 2,6% для непотокового. У багатомовному тесті FLEURS на наборі основних мов і локалей модель демонструє показники 5,50% у потоковому режимі та 5,04% у непотоковому.

Порівняно з Chirp 3, попередньою моделлю транскрибування Google, час до отримання фінальної транскрипції скоротився на 70%. Покриття мов охоплює понад 85 локалей, а автоматичне визначення та перемикання мов працюють без додаткового налаштування.

Екосистема

Live API вже інтегровано з LiveKit, Pipecat, Agora, Fishjam, Vercel і Vision Agents. На споживчому рівні модель працює в Rambler на Android, у застосунку Gemini для macOS і в Google Antigravity. Для Chrome інтеграція зазначена як така, що з’явиться незабаром.

Ключові висновки

  • Дві кінцеві точки, а не одна: потоковий режим обмінює діаризацію та часові позначки слів на затримку менше секунди.
  • Заявлений WER становить 4,0% для потокового режиму та 2,6% для непотокового, за даними Artificial Analysis.
  • Інтелектуальний режим не можна поєднувати з часовими позначками або діаризацією — для кожного виклику потрібно обрати щось одне.
  • Сукупна вартість становить приблизно $0,005 за хвилину пакетної обробки та $0,009 за хвилину в реальному часі; відкритих ваг немає.
  • Жорсткі обмеження: 10-хвилинні сеанси Live, файли тривалістю до 1 години, 30 хвилин із увімкненою діаризацією.

Ознайомтеся з технічними подробицями тут. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання з понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібно стати нашим партнером для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини