Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

Новата AI транскрипция на Google премахва „ъъ“ и „ами“

Новата AI транскрипция на Google премахва вашите „ъъ“ и „ами“

Получихме аудио моделите Gemini, докато все още чакаме просроченото представяне на Gemini 3.5 Pro.

Получихме аудио моделите Gemini, докато все още чакаме просроченото представяне на Gemini 3.5 Pro.

от Джес Уедърбид
26 авг. 2026 г., 17:00 ч. UTC
Изображение: Кат Вирджиния / The Verge
Jess Weatherbed
Джес Уедърбид е новинарски автор, фокусиран върху творческите индустрии, компютрите и интернет културата. Джес започва кариерата си в TechRadar, където отразява новини и прави ревюта на хардуер.

Google обнови Gemini Audio с няколко нови модела Gemini 3.5, въвеждайки нови възможности за транскрипция, които автоматично разпознават специализиран жаргон и повече от 85 езика. Gemini 3.5 Live, 3.5 Live Experimental и 3.5 Transcribe са създадени, за да осигурят по-добра прецизност за гласово управляваните AI функции на Google, без да се затрудняват от фонов шум или прекъсвания по време на речта.

Gemini 3.5 Transcribe е напълно ново допълнение към семейството Gemini, а представянето му се случва, докато все още чакаме Google да пусне модела Gemini 3.5 Pro, който компанията обеща да представи през юни. Google заявява, че 3.5 Transcribe „представлява значителен напредък спрямо предишния ни модел за транскрипция, Chirp 3“, особено по отношение на многоезичната работа и процента грешки при думите.

Според Google моделът за транскрипция позволява на потребителите „да редактират естествено само с гласа си“ и може автоматично да форматира текста и да премахва паразитни думи като „ъм“ и „ъъ“. Потребителите могат да предоставят персонализиран речник на модела, което позволява на 3.5 Transcribe автоматично да се адаптира към специфични изисквания за изписване и специализиран жаргон, за да не се налага тези думи да бъдат редактирани ръчно. Моделът може също да разпознава репликите на до трима говорители в предварително записано аудио, както и да предоставя времеви маркери за всяка дума.

Transcribe стартира заедно с 3.5 Live и 3.5 Live Experimental, които надграждат съществуващата технология за разпознаване на реч, захранваща режима за гласов чат на Gemini. Gemini 3.5 Live се справя по-добре с прекъсванията по средата на изречението, разпознаването на езици и обработката на визуална информация в реално време, докато Gemini 3.5 Live Experimental отива още по-далеч, като описва напредъка си стъпка по стъпка в реално време, докато изпълнява разсъждения по по-сложни задачи.

Тези обновления на Gemini Audio започват да се разпространяват днес на английски език за всички потребители на приложението Gemini за macOS, както и за функцията за диктовка Rambler в Android в избрани държави и на избрани езици. Те са достъпни и за разработчици в публична тестова версия чрез Gemini API в AI Studio и Antigravity. Google заявява, че поддръжката за Chrome предстои скоро.

Следвайте теми и автори от тази статия, за да виждате повече подобно съдържание в персонализирания си канал на началната страница и да получавате обновления по имейл.
  • Джес Уедърбид

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от The Verge на

Прочетете оригинала в The Verge ↗

Текстът и изображенията са собственост на The Verge и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини