Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

Нова ШІ-транскрипція Google прибирає «ем» і «ее»

Новий ШІ Google для транскрипції вилучає ваші «ем» і «а»

Ми отримали аудіомоделі Gemini, поки все ще чекаємо на давно прострочений запуск Gemini 3.5 Pro.

Ми отримали аудіомоделі Gemini, поки все ще чекаємо на давно прострочений запуск Gemini 3.5 Pro.

автор Джесс Везербед
26 серпня 2026 р., 17:00 UTC
Зображення: Кет Вірджинія / The Verge
Jess Weatherbed
Джесс Везербед — авторка новин, яка пише про креативні індустрії, комп’ютери та інтернет-культуру. Джесс розпочала кар’єру в TechRadar, висвітлюючи новини та огляди обладнання.

Google оновила Gemini Audio кількома новими моделями Gemini 3.5, додавши нові можливості транскрипції, які автоматично розпізнають спеціалізовану термінологію та понад 85 мов. Gemini 3.5 Live, 3.5 Live Experimental і 3.5 Transcribe створені для підвищення точності голосових функцій ШІ Google, не втрачаючи якості через фоновий шум або переривання мовлення.

Gemini 3.5 Transcribe — це абсолютно нове доповнення до сімейства Gemini, і його представлення відбувається в той час, коли ми все ще чекаємо, поки Google випустить модель Gemini 3.5 Pro, яку компанія обіцяла запустити в червні. Google заявляє, що 3.5 Transcribe «є значним удосконаленням порівняно з нашою попередньою моделлю транскрипції Chirp 3», особливо щодо багатомовної роботи та частоти помилок у формулюваннях.

За словами Google, модель транскрипції дає змогу користувачам «редагувати природно, лише за допомогою голосу», а також автоматично форматувати текст і вилучати слова-паразити на кшталт «ем» і «а». Користувачі можуть надати моделі спеціалізований словник, що дає змогу 3.5 Transcribe автоматично адаптувати транскрипцію до унікальних вимог написання та спеціалізованої термінології, щоб ці слова не доводилося редагувати вручну. Модель також може розпізнавати репліки до трьох мовців у попередньо записаному аудіо й додавати часові позначки на рівні окремих слів.

Transcribe запускається разом із 3.5 Live та 3.5 Live Experimental, які розвивають наявну технологію розпізнавання мовлення, що забезпечує голосовий режим чату Gemini. Gemini 3.5 Live краще обробляє переривання посеред речення, розпізнавання мов і візуальну обробку в реальному часі, тоді як Gemini 3.5 Live Experimental іде ще далі, покроково озвучуючи свій прогрес у реальному часі під час розв’язання складніших завдань, що потребують міркувань.

Ці оновлення Gemini Audio починають розгортатися вже сьогодні англійською мовою для всіх користувачів застосунку Gemini на macOS, а також для функції диктування Rambler на Android в окремих країнах і мовах. Вони також доступні розробникам у форматі публічного попереднього перегляду в Gemini API через AI Studio та Antigravity. Google заявляє, що підтримка Chrome з’явиться незабаром.

Стежте за темами й авторами цієї статті, щоб бачити більше схожих матеріалів у персоналізованій стрічці на головній сторінці та отримувати оновлення електронною поштою.
  • Джесс Везербед

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням The Verge

Читати оригінал на The Verge ↗

Текст і зображення належать The Verge і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини