Gemini 3.5 Transcribe на Google превръща речта в текст на 85 езика, като автоматично коригира словесните грешки
Google представи Gemini 3.5 Transcribe — модел за преобразуване на реч в текст в реално време. Той автоматично разпознава над 85 езика, премахва паразитни думи като „ъъ“, коригира грешки при говорене и самостоятелно форматира текста. Google отчита процент грешки при думите от 4,0% при поточно предаване и 2,6% при записан звук, както и 70% по-ниска латентност спрямо предшественика му Chirp 3. Чрез „извикване на функции“ моделът може да прехвърля задачи като генериране на изображения или търсене в мрежата към други модели Gemini.
Моделът се предлага с два интерфейса. Live API обработва поточно предаване в реално време с много ниска латентност (gemini-3.5-transcribe-live), докато Interactions API обработва записан звук с идентифициране на говорителите и времеви маркери (gemini-3.5-transcribe). Моделът вече е наличен в Google AI Studio и в Gemini Enterprise Agent Platform. Той вече е интегриран в Gboard за Android (чрез „Rambler“) и в приложението Gemini за macOS, а поддръжката на Chrome предстои.
Новини за изкуствения интелект без излишен шум – подбрани от хора
Абонирайте се за THE DECODER и получете четене без реклами, седмичен бюлетин за изкуствения интелект, нашия ексклузивен тримесечен доклад „AI Radar“ за водещите разработки, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.