Google AI выпустила Gemini 3.5 Transcribe: модель преобразования речи в текст со средним WER 2,6% для более чем 85 языков
Google выпустила Gemini 3.5 Transcribe — модель преобразования речи в текст для голосовых интерфейсов в реальном времени и записанного аудио. Она поставляется в виде двух эндпоинтов, а не одного. gemini-3.5-transcribe обрабатывает предварительно записанные файлы через Interactions API. gemini-3.5-transcribe-live поддерживает двунаправленную потоковую передачу через Live API. По данным Google, средний показатель ошибок распознавания слов составляет 4,0% для потокового режима и 2,6% для непотокового — согласно измерениям Artificial Analysis. Время до получения окончательной расшифровки улучшилось на 70% по сравнению с Chirp 3, предыдущей моделью. Автоматическое определение поддерживает более 85 языков, включая переключение языков внутри предложения. Разделение на два эндпоинта — ключевой момент, который следует учитывать при планировании. У них разные наборы функций, ограничения и цены.
Можно ли это развернуть?
Да, но только через API. Открытых весов и возможности самостоятельного хостинга нет. Это решение об управляемом сервисе, а не об инфраструктуре.
- Размер компании: любой. Отдельные разработчики и стартапы могут начать работу с бесплатного уровня Gemini API через Google AI Studio. Компании среднего размера переходят на платный уровень для увеличения лимитов запросов. Платный уровень также гарантирует, что контент не будет использоваться для улучшения продуктов Google. Регулируемые предприятия работают через Gemini Enterprise Agent Platform, которая добавляет выделенную пропускную способность, средства контроля соответствия требованиям и скидки за объем. Оба направления — для разработчиков и предприятий — находятся в стадии публичного предварительного просмотра, поэтому соответствующим образом оценивайте обязательства по использованию в продакшене.
- Отрасли: контакт-центры и CX-платформы, клиническая документация, создание субтитров и локализация медиаконтента, прием обращений в юридической и страховой сферах, инструменты для встреч и голосовые инструменты для разработчиков.
- Применения: голосовые агенты в реальном времени, субтитры в реальном времени, конвейеры постобработки данных после звонков, расшифровка встреч с атрибуцией говорящих, диктовка и интерфейсы с голосовым управлением.
Две поверхности API — два разных продукта
Live API обеспечивает непрерывную расшифровку с задержкой менее секунды. Он отправляет interim_input_transcription для предварительных частичных результатов, пока человек еще говорит, а затем input_transcription, когда реплика завершается. Аудио передается в формате необработанного 16-битного PCM с частотой 16 кГц, моно, фрагментами по 100 мс. Поддерживаются автоматическое, гибридное и ручное определение голосовой активности. Эфемерные токены позволяют мобильным и веб-клиентам передавать данные без хранения ключа API.
Ограничения существенные. Продолжительность непрерывной потоковой передачи в сеансе Live ограничена 10 минутами. Диаризация говорящих не поддерживается. Временные метки на уровне слов не поддерживаются.
Interactions API охватывает то, что недоступно в потоковом режиме. Он поддерживает диаризацию говорящих, смещения начала и конца слов и настройку приоритетов пользовательского словаря. Список словаря может содержать до 1 000 терминов, однако наилучшие результаты достигаются при количестве менее 100. Стандартные запросы принимают до одного часа аудио. При включении диаризации или временных меток слов этот показатель снижается до 30 минут.
Действительный текст или интеллектуальная обработка — вот настоящее решение при проектировании
Оба эндпоинта поддерживают два режима. verbatim используется по умолчанию и возвращает всё, включая слова-паразиты, повторы и незаконченные фразы. smart удаляет речевые запинки, обрабатывает самокоррекции непосредственно в тексте и применяет структурированное форматирование.
Собственный пример Google: «Эм, итак, насчет встречи: думаю, нам следует, э-э, пригласить Алису и… нет, подождите, Боба и Кэрол». В режиме Verbatim сохраняется всё. В режиме Smart результат будет таким: «Насчет встречи: думаю, нам следует пригласить Боба и Кэрол».
Режим Smart нельзя использовать одновременно с временными метками слов или диаризацией. Именно этот компромисс следует учитывать при планировании. Читаемое резюме и проверяемая расшифровка теперь требуют двух разных вызовов API.
Производительность
Согласно измерениям Artificial Analysis, Google сообщает о среднем показателе ошибок распознавания слов 4,0% для потокового режима и 2,6% для непотокового. На многоязычном бенчмарке FLEURS, на наборе основных языков и локалей, модель показывает 5,50% в потоковом режиме и 5,04% в непотоковом.
По сравнению с Chirp 3, предыдущей моделью Google для расшифровки, время до получения окончательной расшифровки улучшилось на 70%. Языковое покрытие включает более 85 локалей, при этом автоматическое определение и переключение языков обрабатываются без настройки.
Экосистема
Live API уже интегрирован с LiveKit, Pipecat, Agora, Fishjam, Vercel и Vision Agents. В потребительском сегменте модель используется в Rambler на Android, приложении Gemini для macOS и Google Antigravity. Для Chrome поддержка заявлена в ближайшем будущем.
Основные выводы
- Два эндпоинта, а не один: потоковый режим жертвует диаризацией и временными метками слов ради задержки менее секунды.
- Заявленный WER составляет 4,0% для потокового режима и 2,6% для непотокового, согласно Artificial Analysis.
- Режим Smart нельзя использовать одновременно с временными метками или диаризацией — для каждого вызова нужно выбрать что-то одно.
- Смешанная стоимость составляет примерно 0,005 доллара за минуту в пакетном режиме и 0,009 доллара за минуту в режиме реального времени; открытых весов нет.
- Жесткие ограничения: 10-минутные сеансы Live, файлы длительностью до 1 часа и до 30 минут при включенной диаризации.
Ознакомьтесь с техническими подробностями здесь. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.
Хотите стать нашим партнером для продвижения своего репозитория GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.