Gemini 3.5 Transcribe от Google преобразует речь в текст на 85 языках, автоматически исправляя оговорки
Google запустила Gemini 3.5 Transcribe — модель преобразования речи в текст для транскрибирования в реальном времени. Она автоматически распознаёт более 85 языков, удаляет слова-паразиты вроде «э-э», исправляет оговорки и самостоятельно форматирует текст. Google сообщает о доле ошибок в словах на уровне 4,0 процента для потоковой передачи и 2,6 процента для записанного аудио, а также о задержке на 70 процентов ниже, чем у предшественницы Chirp 3. Благодаря «вызову функций» модель может передавать такие задачи, как генерация изображений или поиск в интернете, другим моделям Gemini.
Модель поставляется с двумя интерфейсами. Live API обеспечивает потоковую передачу в реальном времени с очень низкой задержкой (gemini-3.5-transcribe-live), а Interactions API обрабатывает записанное аудио, определяя говорящих и добавляя временные метки (gemini-3.5-transcribe). Модель уже доступна в Google AI Studio и на Gemini Enterprise Agent Platform. Она уже встроена в Gboard для Android (через «Rambler») и в приложение Gemini для macOS, а поддержка Chrome появится в ближайшее время.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ и наш эксклюзивный аналитический отчёт о передовых разработках «AI Radar» шесть раз в год, иметь полный доступ к архиву и разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.