Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

Новая ИИ-транскрипция Google убирает «ээ» и «эм»

Новая транскрипция Google на базе ИИ убирает ваши «э-э» и «м-м»

Мы получили аудиомодели Gemini, пока всё ещё ждём давно просроченный запуск Gemini 3.5 Pro.

Мы получили аудиомодели Gemini, пока всё ещё ждём давно просроченный запуск Gemini 3.5 Pro.

автор Джесс Уэзербед
26 авг. 2026 г., 17:00 UTC
Изображение: Кэт Вирджиния / The Verge
Jess Weatherbed
Джесс Уэзербед — автор новостей, специализирующаяся на творческих индустриях, вычислительной технике и интернет-культуре. Джесс начала карьеру в TechRadar, где писала о новостях и занималась обзорами оборудования.

Google обновила Gemini Audio, добавив несколько новых моделей Gemini 3.5 и представив новые возможности транскрипции, которые автоматически распознают специализированный жаргон и более 85 языков. Gemini 3.5 Live, 3.5 Live Experimental и 3.5 Transcribe призваны повысить точность голосовых функций ИИ Google, не испытывая проблем с фоновым шумом и перебиваниями речи.

Gemini 3.5 Transcribe — совершенно новое дополнение к семейству Gemini. Его появление происходит в то время, когда мы всё ещё ждём выпуска Google модели Gemini 3.5 Pro, которую компания обещала выпустить в июне. По словам Google, 3.5 Transcribe «представляет собой значительный шаг вперёд по сравнению с нашей предыдущей моделью транскрипции Chirp 3», особенно в плане работы с несколькими языками и частоты ошибок в формулировках.

По данным Google, модель транскрипции позволяет пользователям «естественно редактировать текст только с помощью голоса», а также автоматически форматирует текст и удаляет слова-паразиты вроде «э-э» и «м-м». Пользователи могут предоставить модели индивидуальный словарь, благодаря чему 3.5 Transcribe автоматически адаптирует транскрипцию к уникальным требованиям к написанию и специализированному жаргону, избавляя от необходимости редактировать эти слова вручную. Модель также может распределять реплики между тремя собеседниками в предварительно записанном аудио и предоставлять временные метки для каждого слова.

Transcribe запускается одновременно с 3.5 Live и 3.5 Live Experimental, которые развивают существующую технологию распознавания речи, лежащую в основе голосового режима Gemini. Gemini 3.5 Live лучше справляется с перебиваниями посреди фразы, распознаванием языков и обработкой визуальной информации в реальном времени, а Gemini 3.5 Live Experimental идёт ещё дальше: во время решения более сложных задач она в реальном времени пошагово озвучивает свой прогресс, выполняя рассуждения.

Эти обновления Gemini Audio начинают распространяться сегодня на английском языке среди всех пользователей приложения Gemini для macOS, а также в функции диктовки Rambler на Android в некоторых странах и на некоторых языках. Для разработчиков они также доступны в виде общедоступной предварительной версии Gemini API через AI Studio и Antigravity. Google сообщает, что поддержка Chrome появится вскоре.

Подписывайтесь на темы и авторов из этой статьи, чтобы видеть больше похожих материалов в персональной ленте на главной странице и получать обновления по электронной почте.
  • Джесс Уэзербед

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием The Verge

Читать оригинал на The Verge ↗

Текст и изображения принадлежат The Verge и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости