Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

Интелигентна транскрипция с Gemini 3.5 Transcribe

Интелигентна транскрипция с Gemini 3.5 Transcribe

26 авг. 2026 г.

|

Най-новият ни модел за преобразуване на говор в текст, създаден за прецизна и интелигентна транскрипция в реално време.


Диего Мелендо Касадо

Старши директор, инженеринг, Gemini Audio

Люк Леонхард

Началник на кабинета, Gemini Audio, от името на екипа на Gemini Audio


Текстът "Gemini 3.5 Transcribe" до искрата на Gemini, всичко на син фон
Слушайте статията
[[duration]] минути

Днес представяме Gemini 3.5 Transcribe — най-прецизния ни досега модел за преобразуване на говор в текст, създаден за интелигентни гласови взаимодействия. За разлика от конвенционалните модели за разпознаване на реч, които срещат затруднения с фоновия шум, сложния жаргон и почистването на речевите неясноти, Gemini 3.5 Transcribe преобразува необработеното аудио директно в точен, прецизиран и форматиран текст.

В нашите продукти като приложението Gemini и Android виждаме, че потребителите вече се възползват от този модел за транскрипция чрез нови гласови възможности като Rambler за Android и приложението Gemini за macOS. Сега разработчиците могат да създават подобни възможности с Gemini 3.5 Transcribe в Gemini API в Google AI Studio и Gemini Enterprise Agent Platform.

Създадохме 3.5 Transcribe така, че да се интегрира безпроблемно в работните процеси на разработчиците — независимо дали създавате гласови агенти, инструменти за субтитри в реално време или аналитични потоци за обработка след разговори. Моделът е достъпен чрез два отделни API:

  • Поточно предаване в реално време: Осигурява непрекъснато двупосочно поточно предаване със закъснение под една секунда за интерактивни гласови приложения чрез Live API, използвайки gemini-3.5-transcribe-live.
  • Обработка на предварително записано аудио: Транскрибира записи, срещи, дневници на разговори и други, като посочва говорещите и предоставя времеви маркери на ниво дума чрез Interactions API, използвайки gemini-3.5-transcribe.

Получете по-прецизна и интелигентна транскрипция

Gemini 3.5 Transcribe е създаден, за да улавя естествения ви начин на говорене, да разбира по-добре намеренията ви и да разпознава персонализиран речник, за да можете да изпълнявате задачи с гласа си.

  • Интелигентна транскрипция: Безпроблемно обработва самокорекции (например „нека се срещнем във вторник — не, в сряда“), премахва паразитните думи („ъ-ъ“ и „ами“), и форматира текста автоматично.
  • Извикване на функции: Моделът може да делегира сложни задачи (като генериране на изображения и анализ на файлове) на други модели Gemini чрез извиквания на функции. В момента е достъпно в приложението Gemini за macOS.
  • По-прецизна транскрипция: Според измерванията на Artificial Analysis постига среден процент грешки на думите (WER) от 4,0% при поточно предаване и 2,6% при непоточно предаване. Показва висока ефективност в шумни среди от реалния свят, като точно разпознава буквено-цифрови данни като пощенски кодове и идентификатори на поръчки.
  • Персонализиран речник: Разпознава специализиран жаргон и уникални изписвания, като безпроблемно адаптира транскрипциите към предоставения от вас персонализиран речник.
  • Глобална езикова поддръжка: Автоматично открива и транскрибира над 85 езика, като безпроблемно обработва регионални акценти и различни диалекти.
  • Идентифициране на множество говорещи: Точно приписва речта в предварително записано аудио и предоставя времеви маркери за до трима говорещи (поддръжката на повече от трима говорещи е експериментална).

Gemini 3.5 Transcribe обработва превключването между езици в реално време и осигурява безпроблемна поточна транскрипция

Вижте как Gemini 3.5 Transcribe премахва речевите неясноти с помощта на интелигентни възможности за транскрипция.

3.5 Transcribe предоставя транскрипция с приписване на множество говорещи и времеви маркери на ниво дума.

Производителността на Gemini 3.5 Transcribe представлява значителен напредък спрямо предишния ни модел за транскрипция Chirp 3, като предлага нови възможности, подобрена честота на грешки на думите и значително по-ниско закъснение. Според измерванията на Artificial Analysis например времето до финализиране на транскрипцията е подобрено със 70%. При теста FLEURS, проведен върху набор от водещи езици и локали, моделът осигурява прецизна многоезична производителност, превъзхожда Chirp 3 и постига WER от 5,50% в режим на поточно предаване и 5,04% при непоточно предаване.

Графика на точността при поточно разпознаване на реч
Графика на точността при поточно разпознаване на реч

Изпробвайте интелигентната транскрипция и усъвършенстваната диктовка

В допълнение към Gemini API в Google AI Studio и Gemini Enterprise Agent Platform, 3.5 Transcribe надхвърля стандартното преобразуване на говор в текст, за да направи работата в екосистемата на Google по-естествена и интуитивна. Като осигурява разбиране на контекста директно в ежедневни интерфейси като Gboard, Antigravity, приложението Gemini и Chrome, той лесно улавя нюанси, намерения и редакции в текста.

  • В Gboard за Android, чрез новата функция Rambler, 3.5 Transcribe преобразува изказаните мисли в добре форматиран текст, като премахва паразитните думи. Можете също да използвате гласа си, за да редактирате, коригирате правописни грешки и променяте стила на писане.
  • В Google Antigravity 3.5 Transcribe съчетава контекста от екрана и историята на разговорите, с ваше разрешение, за да осигури изключително точна транскрипция на имена на файлове, мисли на агента и активни документи.
  • В Google AI Studio можете да използвате 3.5 Transcribe в режим Build, за да създавате приложения с глас чрез vibe coding в движение.
  • В приложението Gemini за macOS 3.5 Transcribe не само преобразува естествената ви реч в чист, форматиран текст, но и позволява гласови команди, които безпроблемно могат да използват контекста от екрана за изпълнение на сложни работни процеси. Като извиква други модели Gemini във фонов режим, за да поемат тежката работа, моделът улеснява обобщаването на локални файлове, преработването на текст между приложения или генерирането на изображения директно до курсора — само с гласа ви.
  • Очаквайте скоро в Chrome: ще можете да говорите, за да пишете във всяко уеб поле — което ще улесни диктуването на отговори, съставянето на публикации или задаването на подкани към Gemini в Chrome по-естествено и лесно с гласа ви.

Gemini 3.5 Transcribe ви позволява да анализирате файлове, да генерирате изображения и да търсите в приложението Gemini за macOS само с гласа си.

Вижте как Gemini 3.5 Transcribe използва Rambler за Android, за да премахва автоматично паразитните думи и да пречиства речта.

Gemini 3.5 Transcribe използва контекста от екрана в Google Antigravity, за да осигури изключително точна транскрипция.

Прочетете първите отзиви

Като използват Gemini Live API, платформи за разработчици като Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents позволяват на разработчиците лесно да създават и внедряват високопроизводителни интерфейси, управлявани с глас. Тези платформи управляват сложната инфраструктура за поточно предаване на медии в реално време във фонов режим, което позволява на разработчиците да се съсредоточат изцяло върху създаването на потребителското изживяване.

Компании като Vivo, Intellitek Health и Lingopal също споделиха положителни отзиви за 3.5 Transcribe, като изтъкнаха впечатляващото му закъснение, точност и широка езикова поддръжка.

Отзив от vivo
Отзив от IntelliTek
Отзив от Lingopal
Отзив от Stream
Отзив от Agora
Отзив от fishjam

Започнете да използвате 3.5 Transcribe днес

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от DeepMind на

Прочетете оригинала в DeepMind ↗

Текстът и изображенията са собственост на DeepMind и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини