Интеллектуальная транскрипция с Gemini 3.5 Transcribe
26 авг. 2026 г.
|Наша новейшая модель преобразования речи в текст, разработанная для точной и интеллектуальной транскрибации в реальном времени.
Диего Мелендо Касадо
Старший директор по разработке, Gemini Audio
Люк Леонхард
Руководитель аппарата, Gemini Audio, от имени команды Gemini Audio
Сегодня мы представляем Gemini 3.5 Transcribe — нашу самую точную на данный момент модель преобразования речи в текст, разработанную для интеллектуального голосового взаимодействия. В отличие от обычных моделей распознавания речи, которым трудно справляться с фоновым шумом, сложной терминологией и устранением речевых запинок, Gemini 3.5 Transcribe преобразует необработанное аудио непосредственно в точный, отредактированный и отформатированный текст.
В таких продуктах, как приложение Gemini и Android, мы видим, что пользователи уже получают преимущества этой модели транскрибации благодаря новым голосовым возможностям, таким как Rambler на Android и приложение Gemini для macOS. Теперь разработчики могут создавать аналогичные возможности с Gemini 3.5 Transcribe в Gemini API в Google AI Studio и на корпоративной платформе агентов Gemini.
Мы создали 3.5 Transcribe так, чтобы она легко интегрировалась в рабочие процессы разработчиков — независимо от того, создаёте ли вы голосовых агентов, инструменты субтитрирования в реальном времени или конвейеры аналитики после звонков. Модель доступна через два отдельных API:
- Потоковая передача в реальном времени: обеспечивает непрерывную двунаправленную потоковую передачу с задержкой менее секунды для интерактивных голосовых приложений через Live API с использованием
gemini-3.5-transcribe-live. - Обработка предварительно записанного аудио: транскрибирует записи, встречи, журналы звонков и другие материалы, указывая говорящих и временные метки для каждого слова, через Interactions API с использованием
gemini-3.5-transcribe.
Более точная и интеллектуальная транскрибация
Gemini 3.5 Transcribe разработана для сохранения естественной манеры вашей речи, чтобы лучше понимать ваши намерения и распознавать пользовательскую лексику, позволяя выполнять задачи с помощью голоса.
- Интеллектуальная транскрибация: легко обрабатывает самокоррекции (например, «давайте встретимся во вторник — нет, в среду»), удаляет слова-паразиты («э-э» и «эм»), автоматически форматирует текст.
- Вызов функций: модель может передавать сложные задачи (например, генерацию изображений и анализ файлов) другим моделям Gemini с помощью вызовов функций. В настоящее время доступно в приложении Gemini для macOS.
- Более точная транскрибация: согласно измерениям Artificial Analysis, средняя частота ошибок в словах (WER) составляет 4,0% для потокового режима и 2,6% для непотоковых сценариев. Модель демонстрирует высокую эффективность в шумной реальной среде, точно распознавая буквенно-цифровые сущности, такие как почтовые индексы и идентификаторы заказов.
- Пользовательский словарь: распознаёт специализированную терминологию и уникальные варианты написания, легко адаптируя транскрибацию к предоставленному вами пользовательскому словарю.
- Глобальная языковая поддержка: автоматически определяет и транскрибирует более 85 языков, легко обрабатывая региональные акценты и различные диалекты.
- Идентификация нескольких говорящих: точно определяет говорящих в предварительно записанном аудио и добавляет временные метки для каждого из максимум трёх говорящих (поддержка более трёх говорящих является экспериментальной).
Gemini 3.5 Transcribe обрабатывает переключение языков в реальном времени и обеспечивает плавную потоковую транскрибацию
Посмотрите, как Gemini 3.5 Transcribe устраняет речевые запинки благодаря интеллектуальной транскрибации.
3.5 Transcribe обеспечивает транскрибацию с указанием нескольких говорящих и временными метками для каждого слова.
Производительность Gemini 3.5 Transcribe представляет собой значительный шаг вперёд по сравнению с нашей предыдущей моделью транскрибации Chirp 3: появились новые возможности, улучшились показатели частоты ошибок в словах и значительно снизилась задержка. Согласно измерениям Artificial Analysis, например, время до получения итоговой транскрибации сократилось на 70%. В тесте FLEURS на наборе наиболее распространённых языков и локалей модель демонстрирует точную многоязычную работу, превосходя Chirp 3 и достигая WER 5,50% в потоковом режиме и 5,04% в непотоковых сценариях.
Интеллектуальная транскрибация и расширенная диктовка
Помимо Gemini API в Google AI Studio и корпоративной платформе агентов Gemini, 3.5 Transcribe выходит за рамки стандартного преобразования речи в текст, делая работу в экосистеме Google более естественной и интуитивной. Благодаря пониманию контекста непосредственно в повседневных интерфейсах — таких как Gboard, Antigravity, приложение Gemini и Chrome — модель легко распознаёт нюансы, намерения и встроенные правки.
- В Gboard на Android благодаря новой функции Rambler 3.5 Transcribe преобразует устную речь в хорошо отформатированный текст, удаляя слова-паразиты. Вы также можете использовать голос для редактирования, исправления опечаток и изменения стиля письма.
- В Google Antigravity 3.5 Transcribe с вашего разрешения сопоставляет контекст экрана и историю чата, обеспечивая предельно точную транскрибацию имён файлов, мыслей агента и открытых документов.
- В Google AI Studio вы можете использовать 3.5 Transcribe в режиме Build, чтобы на лету создавать приложения голосом в формате vibe coding.
- В приложении Gemini для macOS 3.5 Transcribe не только преобразует вашу свободную естественную речь в чистый отформатированный текст, но и позволяет использовать голосовые команды, которые легко сочетаются с контекстом экрана для выполнения сложных рабочих процессов. Вызывая в фоновом режиме другие модели Gemini для выполнения основной работы, модель позволяет без труда суммировать локальные файлы, переносить текст между приложениями или создавать изображения прямо в месте расположения курсора — используя только голос.
- Скоро в Chrome можно будет говорить для ввода текста в любое веб-поле — это упростит диктовку ответов, создание публикаций и естественное и удобное взаимодействие с Gemini в Chrome с помощью голоса.
Gemini 3.5 Transcribe позволяет анализировать файлы, создавать изображения и выполнять поиск в приложении Gemini для macOS, используя только голос.
Посмотрите, как Gemini 3.5 Transcribe использует Rambler на Android для автоматического удаления слов-паразитов и очистки речи.
Gemini 3.5 Transcribe использует контекст экрана в Google Antigravity для обеспечения точности транскрибации.
Первые отзывы
Используя Gemini Live API, платформы для разработчиков, такие как Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents, позволяют разработчикам с лёгкостью создавать и развёртывать высокопроизводительные интерфейсы с голосовым управлением. Эти платформы управляют сложной инфраструктурой потоковой передачи мультимедиа в реальном времени в фоновом режиме, позволяя разработчикам полностью сосредоточиться на создании пользовательского опыта.
Такие компании, как Vivo, Intellitek Health и Lingopal, также положительно отозвались о 3.5 Transcribe, отметив впечатляющие задержку и точность, а также широкую языковую поддержку.
Начните использовать 3.5 Transcribe уже сегодня
- Для разработчиков: общедоступная предварительная версия в Gemini API через Google AI Studio и Google Antigravity.
- Для компаний: общедоступная предварительная версия на корпоративной платформе агентов Gemini, а вскоре — в Gemini Enterprise для клиентского опыта.
- Для всех: в приложении Gemini для macOS на английском языке, Rambler на Android в отдельных странах и на отдельных языках, а вскоре — в Chrome.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.