Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

Интеллектуальная транскрипция с Gemini 3.5 Transcribe

Интеллектуальная транскрибация с Gemini 3.5 Transcribe

26 авг. 2026 г.

|

Наша новейшая модель преобразования речи в текст, разработанная для точной и интеллектуальной транскрибации в реальном времени.


Диего Мелендо Касадо

Старший директор по разработке, Gemini Audio

Люк Леонхард

Руководитель аппарата, Gemini Audio, от имени команды Gemini Audio


Текст «Gemini 3.5 Transcribe» рядом с искрой Gemini на синем фоне
Прослушать статью
[[duration]] мин.

Сегодня мы представляем Gemini 3.5 Transcribe — нашу самую точную на данный момент модель преобразования речи в текст, разработанную для интеллектуального голосового взаимодействия. В отличие от обычных моделей распознавания речи, которым трудно справляться с фоновым шумом, сложной терминологией и устранением речевых запинок, Gemini 3.5 Transcribe преобразует необработанное аудио непосредственно в точный, отредактированный и отформатированный текст.

В таких продуктах, как приложение Gemini и Android, мы видим, что пользователи уже получают преимущества этой модели транскрибации благодаря новым голосовым возможностям, таким как Rambler на Android и приложение Gemini для macOS. Теперь разработчики могут создавать аналогичные возможности с Gemini 3.5 Transcribe в Gemini API в Google AI Studio и на корпоративной платформе агентов Gemini.

Мы создали 3.5 Transcribe так, чтобы она легко интегрировалась в рабочие процессы разработчиков — независимо от того, создаёте ли вы голосовых агентов, инструменты субтитрирования в реальном времени или конвейеры аналитики после звонков. Модель доступна через два отдельных API:

  • Потоковая передача в реальном времени: обеспечивает непрерывную двунаправленную потоковую передачу с задержкой менее секунды для интерактивных голосовых приложений через Live API с использованием gemini-3.5-transcribe-live.
  • Обработка предварительно записанного аудио: транскрибирует записи, встречи, журналы звонков и другие материалы, указывая говорящих и временные метки для каждого слова, через Interactions API с использованием gemini-3.5-transcribe.

Более точная и интеллектуальная транскрибация

Gemini 3.5 Transcribe разработана для сохранения естественной манеры вашей речи, чтобы лучше понимать ваши намерения и распознавать пользовательскую лексику, позволяя выполнять задачи с помощью голоса.

  • Интеллектуальная транскрибация: легко обрабатывает самокоррекции (например, «давайте встретимся во вторник — нет, в среду»), удаляет слова-паразиты («э-э» и «эм»), автоматически форматирует текст.
  • Вызов функций: модель может передавать сложные задачи (например, генерацию изображений и анализ файлов) другим моделям Gemini с помощью вызовов функций. В настоящее время доступно в приложении Gemini для macOS.
  • Более точная транскрибация: согласно измерениям Artificial Analysis, средняя частота ошибок в словах (WER) составляет 4,0% для потокового режима и 2,6% для непотоковых сценариев. Модель демонстрирует высокую эффективность в шумной реальной среде, точно распознавая буквенно-цифровые сущности, такие как почтовые индексы и идентификаторы заказов.
  • Пользовательский словарь: распознаёт специализированную терминологию и уникальные варианты написания, легко адаптируя транскрибацию к предоставленному вами пользовательскому словарю.
  • Глобальная языковая поддержка: автоматически определяет и транскрибирует более 85 языков, легко обрабатывая региональные акценты и различные диалекты.
  • Идентификация нескольких говорящих: точно определяет говорящих в предварительно записанном аудио и добавляет временные метки для каждого из максимум трёх говорящих (поддержка более трёх говорящих является экспериментальной).

Gemini 3.5 Transcribe обрабатывает переключение языков в реальном времени и обеспечивает плавную потоковую транскрибацию

Посмотрите, как Gemini 3.5 Transcribe устраняет речевые запинки благодаря интеллектуальной транскрибации.

3.5 Transcribe обеспечивает транскрибацию с указанием нескольких говорящих и временными метками для каждого слова.

Производительность Gemini 3.5 Transcribe представляет собой значительный шаг вперёд по сравнению с нашей предыдущей моделью транскрибации Chirp 3: появились новые возможности, улучшились показатели частоты ошибок в словах и значительно снизилась задержка. Согласно измерениям Artificial Analysis, например, время до получения итоговой транскрибации сократилось на 70%. В тесте FLEURS на наборе наиболее распространённых языков и локалей модель демонстрирует точную многоязычную работу, превосходя Chirp 3 и достигая WER 5,50% в потоковом режиме и 5,04% в непотоковых сценариях.

График точности потокового распознавания речи
График точности потокового распознавания речи

Интеллектуальная транскрибация и расширенная диктовка

Помимо Gemini API в Google AI Studio и корпоративной платформе агентов Gemini, 3.5 Transcribe выходит за рамки стандартного преобразования речи в текст, делая работу в экосистеме Google более естественной и интуитивной. Благодаря пониманию контекста непосредственно в повседневных интерфейсах — таких как Gboard, Antigravity, приложение Gemini и Chrome — модель легко распознаёт нюансы, намерения и встроенные правки.

  • В Gboard на Android благодаря новой функции Rambler 3.5 Transcribe преобразует устную речь в хорошо отформатированный текст, удаляя слова-паразиты. Вы также можете использовать голос для редактирования, исправления опечаток и изменения стиля письма.
  • В Google Antigravity 3.5 Transcribe с вашего разрешения сопоставляет контекст экрана и историю чата, обеспечивая предельно точную транскрибацию имён файлов, мыслей агента и открытых документов.
  • В Google AI Studio вы можете использовать 3.5 Transcribe в режиме Build, чтобы на лету создавать приложения голосом в формате vibe coding.
  • В приложении Gemini для macOS 3.5 Transcribe не только преобразует вашу свободную естественную речь в чистый отформатированный текст, но и позволяет использовать голосовые команды, которые легко сочетаются с контекстом экрана для выполнения сложных рабочих процессов. Вызывая в фоновом режиме другие модели Gemini для выполнения основной работы, модель позволяет без труда суммировать локальные файлы, переносить текст между приложениями или создавать изображения прямо в месте расположения курсора — используя только голос.
  • Скоро в Chrome можно будет говорить для ввода текста в любое веб-поле — это упростит диктовку ответов, создание публикаций и естественное и удобное взаимодействие с Gemini в Chrome с помощью голоса.

Gemini 3.5 Transcribe позволяет анализировать файлы, создавать изображения и выполнять поиск в приложении Gemini для macOS, используя только голос.

Посмотрите, как Gemini 3.5 Transcribe использует Rambler на Android для автоматического удаления слов-паразитов и очистки речи.

Gemini 3.5 Transcribe использует контекст экрана в Google Antigravity для обеспечения точности транскрибации.

Первые отзывы

Используя Gemini Live API, платформы для разработчиков, такие как Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents, позволяют разработчикам с лёгкостью создавать и развёртывать высокопроизводительные интерфейсы с голосовым управлением. Эти платформы управляют сложной инфраструктурой потоковой передачи мультимедиа в реальном времени в фоновом режиме, позволяя разработчикам полностью сосредоточиться на создании пользовательского опыта.

Такие компании, как Vivo, Intellitek Health и Lingopal, также положительно отозвались о 3.5 Transcribe, отметив впечатляющие задержку и точность, а также широкую языковую поддержку.

Отзыв Vivo
Отзыв IntelliTek
Отзыв Lingopal
Отзыв Stream
Отзыв Agora
Отзыв fishjam

Начните использовать 3.5 Transcribe уже сегодня

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием DeepMind

Читать оригинал на DeepMind ↗

Текст и изображения принадлежат DeepMind и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости