Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

Інтелектуальна транскрипція з Gemini 3.5 Transcribe

Інтелектуальна транскрипція з Gemini 3.5 Transcribe

26 серпня 2026 р.

|

Наша найновіша модель перетворення мовлення на текст, розроблена для точної та інтелектуальної транскрипції в реальному часі.


Diego Melendo Casado

Старший директор з інженерії Gemini Audio

Luke Leonhard

Керівник апарату Gemini Audio від імені команди Gemini Audio


Текст "Gemini 3.5 Transcribe" поруч із іскрою Gemini на синьому тлі
Прослухати статтю
[[duration]] хвилин

Сьогодні ми представляємо Gemini 3.5 Transcribe — нашу найточнішу модель перетворення мовлення на текст, розроблену для інтелектуальної голосової взаємодії. На відміну від звичайних моделей розпізнавання мовлення, які мають труднощі з фоновим шумом, складною термінологією та очищенням від мовленнєвих запинок, Gemini 3.5 Transcribe безпосередньо перетворює необроблене аудіо на точний, відредагований і форматований текст.

У наших продуктах, як-от застосунок Gemini та Android, ми вже бачимо, як споживачі отримують переваги від цієї моделі транскрипції завдяки новим голосовим можливостям, таким як Rambler на Android і застосунок Gemini для macOS. Тепер розробники можуть створювати подібні можливості за допомогою Gemini 3.5 Transcribe у Gemini API в Google AI Studio і Gemini Enterprise Agent Platform.

Ми створили 3.5 Transcribe для безперешкодної інтеграції у ваші робочі процеси розробника — незалежно від того, чи створюєте ви голосових агентів, інструменти субтитрування в реальному часі або конвеєри аналітики після дзвінків. Модель доступна через два окремі API:

  • Потокове передавання в реальному часі: Забезпечує безперервне двонапрямне потокове передавання із затримкою менше секунди для інтерактивних голосових застосунків через Live API із використанням gemini-3.5-transcribe-live.
  • Обробка попередньо записаного аудіо: Транскрибує записане аудіо, зустрічі, журнали дзвінків тощо із зазначенням мовців і часовими мітками для кожного слова через Interactions API із використанням gemini-3.5-transcribe.

Отримуйте точнішу та інтелектуальнішу транскрипцію

Gemini 3.5 Transcribe розроблено для фіксації вашої природної манери мовлення, щоб краще розуміти ваші наміри та розпізнавати спеціальну лексику, даючи змогу виконувати завдання за допомогою голосу.

  • Інтелектуальна транскрипція: Безперешкодно обробляє самовиправлення (наприклад, «зустріньмося у вівторок — ні, у середу»), видаляє слова-паразити («ее» та «ем»), автоматично форматує текст.
  • Виклик функцій: Модель може делегувати складні завдання (наприклад, створення зображень і аналіз файлів) іншим моделям Gemini за допомогою викликів функцій. Наразі доступно в застосунку Gemini для macOS.
  • Точніша транскрипція: За даними Artificial Analysis, досягає середнього показника помилок у словах (WER) 4,0% для потокового передавання та 2,6% для непотокових сценаріїв використання. Модель демонструє високу ефективність у шумних умовах реального світу, точно фіксуючи буквено-цифрові дані, як-от поштові індекси та ідентифікатори замовлень.
  • Спеціальна лексика: Розпізнає спеціалізовану термінологію та унікальні варіанти написання, безперешкодно адаптуючи транскрипції до наданої вами спеціальної лексики.
  • Глобальна мовна підтримка: Автоматично виявляє та транскрибує понад 85 мов, безперешкодно обробляючи регіональні акценти й різноманітні діалекти.
  • Ідентифікація кількох мовців: Точно визначає мовців у попередньо записаному аудіо з часовими мітками для щонайбільше трьох мовців (підтримка понад трьох мовців є експериментальною).

Gemini 3.5 Transcribe обробляє перемикання мов у реальному часі та забезпечує безперебійну потокову транскрипцію

Перегляньте, як Gemini 3.5 Transcribe усуває мовленнєві запинки завдяки інтелектуальним можливостям транскрипції.

3.5 Transcribe забезпечує транскрипцію із зазначенням кількох мовців і часовими мітками для кожного слова.

Показники Gemini 3.5 Transcribe свідчать про значний прогрес порівняно з нашою попередньою моделлю транскрипції Chirp 3: нові можливості, покращені показники помилок у словах і значно менша затримка. За даними Artificial Analysis, наприклад, час до отримання остаточної транскрипції скоротився на 70%. На тесті FLEURS для набору основних мов і локалей модель забезпечує точні багатомовні результати, перевершуючи Chirp 3 і досягаючи WER 5,50% у потоковому режимі та 5,04% у непотокових сценаріях використання.

Графік точності потокового розпізнавання мовлення
Графік точності потокового розпізнавання мовлення

Оцініть інтелектуальну транскрипцію та розширену диктовку

Окрім Gemini API в Google AI Studio і Gemini Enterprise Agent Platform, 3.5 Transcribe виходить за межі стандартного перетворення мовлення на текст, роблячи роботу в екосистемі Google природнішою та інтуїтивнішою. Завдяки контекстному розумінню, безпосередньо інтегрованому в повсякденні інтерфейси, як-от Gboard, Antigravity, застосунок Gemini і Chrome, модель легко фіксує нюанси, наміри та вбудовані виправлення.

  • У Gboard на Android завдяки новій функції Rambler 3.5 Transcribe перетворює висловлені думки на добре відформатований текст, видаляючи слова-паразити. Ви також можете використовувати голос для редагування, виправлення помилок у написанні та зміни стилю тексту.
  • У Google Antigravity 3.5 Transcribe поєднує контекст екрана та історію чатів, за вашим дозволом, щоб забезпечити максимально точну транскрипцію назв файлів, думок агента й активних документів.
  • У Google AI Studio ви можете отримати доступ до 3.5 Transcribe у режимі Build, щоб створювати застосунки за допомогою голосу на льоту.
  • У застосунку Gemini для macOS 3.5 Transcribe не лише перетворює вашу вільну природну мову на чистий форматований текст, а й дає змогу використовувати голосові команди, які можуть безперешкодно поєднуватися з контекстом екрана для виконання складних робочих процесів. Викликаючи у фоновому режимі інші моделі Gemini для виконання складної роботи, модель дає змогу легко підсумовувати локальні файли, адаптувати текст у різних застосунках або створювати зображення безпосередньо біля курсора — лише за допомогою голосу.
  • Незабаром у Chrome ви зможете говорити для введення тексту в будь-якому вебполі — легко диктувати відповіді, створювати чернетки дописів або природніше й простіше задавати запити Gemini у Chrome за допомогою голосу.

Gemini 3.5 Transcribe дає змогу аналізувати файли, створювати зображення та здійснювати пошук у застосунку Gemini для macOS лише за допомогою голосу.

Перегляньте, як Gemini 3.5 Transcribe використовує Rambler на Android для автоматичного видалення слів-паразитів і очищення мовлення.

Gemini 3.5 Transcribe використовує контекст екрана в Google Antigravity, щоб забезпечити точну транскрипцію.

Ознайомтеся з першими відгуками

Завдяки Gemini Live API платформи для розробників, як-от Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel і Vision Agents дають змогу розробникам легко створювати й розгортати високопродуктивні голосові інтерфейси. Ці платформи керують складною інфраструктурою потокового передавання медіа в реальному часі у фоновому режимі, даючи розробникам змогу повністю зосередитися на створенні взаємодії з користувачем.

Такі компанії, як Vivo, Intellitek Health і Lingopal, також позитивно відгукнулися про 3.5 Transcribe, відзначивши вражаючу затримку, точність і широку мовну підтримку.

Відгук Vivo
Відгук IntelliTek
Відгук Lingopal
Відгук Stream
Відгук Agora
Відгук Fishjam

Почніть користуватися 3.5 Transcribe вже сьогодні

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням DeepMind

Читати оригінал на DeepMind ↗

Текст і зображення належать DeepMind і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини