Новите Flash TTS модели на Google ви позволяват да създавате AI гласове от нулата чрез текстови описания
Основни моменти
- Google пусна два нови модела за преобразуване на текст в реч — Gemini 3.8 Flash TTS и Flash-Lite TTS, които поддържат повече от 100 езика. Flash TTS може да създава нови гласове от текстови описания, а функцията за клониране на глас изгражда гласови профили от 30-секундни аудиозаписи.
- Flash TTS е насочен към творчески приложения като подкасти, аудиокниги и герои в игри, докато Flash-Lite TTS е предназначен за евтино генериране на реч в голям мащаб за дублаж, аудиосъдържание и гласови агенти.
- И двата модела поддържат сценични указания за всеки ред, диалог с два гласа и невербални звуци като смях и въздишки. Те се внедряват чрез Gemini API и Google AI Studio, а достъпът през Gemini Enterprise API ще последва.
Google представя Gemini 3.8 Flash TTS и Flash-Lite TTS — два нови модела за генериране на реч. Flash TTS може да създава нови гласове от текстови описания, а и двата модела поддържат повече от 100 езика и позволяват на потребителите да добавят сценични указания към отделни реплики от диалога.
Gemini 3.8 Flash TTS е предназначен за творчески проекти като герои в игри, аудиокниги и подкасти, докато Gemini 3.8 Flash-Lite TTS се фокусира върху евтино генериране на реч в голям мащаб за дублаж, аудиосъдържание и гласови агенти, според Google.
Flash TTS позволява на потребителите да създават гласове от текстови описания
С Gemini 3.8 Flash TTS потребителите могат да проектират гласове от нулата. Според Google текстова подкана може да определи ролята, акцента и вокалните характеристики на гласа на широк спектър от езици и диалекти. За потребителите, които не искат да започват от нулата, Google предлага библиотека с повече от 2000 предварително зададени гласа, включително регионални варианти като мексикански испански, квебекски френски и шотландски английски.
Функция за клониране на глас може да изгради гласов профил от 30-секунден аудиозапис. За да се използва, човекът, чийто глас се клонира, трябва да запише изречено изявление за съгласие, а гласът в този запис трябва да съвпада с гласа в записа-образец. Всеки клип, генериран от аудиомоделите Gemini, съдържа нечуваем воден знак SynthID, който помага за откриването на генерирана от AI реч, според Google.
Google също така обяви „Voice Remixing“ — функция, която ще позволи на потребителите да настройват тембъра, височината, темпото и акцента на гласовете от библиотеката, но тя все още не е достъпна.
Указанията в сценария дават на потребителите контрол върху диалога и начина на изпълнение
И двата модела позволяват на потребителите да записват указания за всеки ред или да оставят модела сам да интерпретира сценичните бележки в сценария. Google твърди, че моделите могат да генерират часове аудио с минимално „отклонение на говорещия“, което означава, че гласът почти не се променя с времето.
Режимът с два гласа генерира диалог от един-единствен сценарий, като запазва различията между гласовете, според компанията. Потребителите могат също да задават в сценария смях, въздишки и звуци като „мхм“, за да поставят реакциите и паузите точно там, където искат.
В два мои собствени теста използвах предварително зададен глас със стилова подкана, която го караше да имитира раздразнен берлинчанин, говорещ английски с плътен немски акцент. Контролите на стила създадоха убедителен акцент и интонация, но и в двата теста на моменти на заден план се чуваше високочестотно виене. В единия от тях гласът също се промени в края на клипа.
Стилова подкана: Роден германец от Берлин, който говори английски като чужд език, с плътен, недвусмислен немски акцент. Той очевидно не е носител на английския език: произнася английските думи по немски, като прилага немски ритъм и интонация към английските изречения. „Th“ се превръща в „z“ или „d“ („ze“, „sink“, „dat“), „w“ се превръща във „v“ („vat“, „vell“), а крайните съгласни стават по-твърди („goot“, „bat“ вместо „bad“). „R“ е гърлено и дълбоко, никога английското „r“. Гласните са плоски и кратки, без мекотата, характерна за американския или британския английски.
Гласът е назален и леко напрегнат, в средния регистър, с дрезгаво трептене и люлеене, подобно на Кърмит, но по-грубо и по-малко куклено. Звучи като уморен берлинчанин в 2 часа през нощта.
Изпълнение: бързо, отсечено, накъсано. Той се поколебава за кратко, когато търси английска дума, и понякога вмъква немската дума без превод и без промяна в интонацията. Периодични раздразнени прекъсвания с повишаване на тона. Сух, саркастичен, невпечатлен и леко раздразнен, че изобщо трябва да обяснява нещо — и още по-раздразнен, че трябва да го прави на английски.

Google започва внедряването на двата модела, а достъпът през корпоративния API ще последва
Google внедрява и двата модела чрез Gemini API и Google AI Studio. Flash TTS е достъпен и в Gemini Notebook, докато Flash-Lite TTS е достъпен в Google Vids. Google заявява, че достъпът чрез Gemini Enterprise API скоро ще бъде предоставен и за двата модела.
Платформи за разработчици, включително Agora, LiveKit, Pipecat и Vercel, вече поддържат интеграция чрез Gemini API. Google все още не е посочил регионални крайни точки за новите модели, въпреки че по-ранни модели за преобразуване на текст в реч предлагаха обработка на данни в ЕС.
Според Google данните от безплатния план се използват за подобряване на продуктите му, докато данните от платения план не се използват за тази цел. Цените на платения план са посочени в щатски долари за милион токени, като текстовите токени се таксуват за входа, а аудиотокените — за изхода.
| Таксуване | Flash TTS (до края на 2026 г.) | Flash TTS (от 2027 г.) | Flash-Lite TTS (до края на 2026 г.) | Flash-Lite TTS (от 2027 г.) |
|---|---|---|---|---|
| Входен текст | $0.50 | $1.00 | $0.50 | $1.00 |
| Изходно аудио | $9.00 | $18.00 | $6.00 | $12.00 |
Google заявява, че една секунда генерирано аудио се равнява на 25 аудиотокена, което означава 90 000 токена за един час. Това означава, че един час аудиоизход струва $0.81 с Flash TTS и $0.54 с Flash-Lite TTS до края на 2026 г. На 1 януари 2027 г. тези разходи ще нараснат съответно до $1.62 и $1.08, като входният текст се таксува отделно.
AI новини без сензацията — подбрани от хора
Абонирайте се за THE DECODER и получете четене без реклами, седмичен бюлетин за AI, ексклузивния ни шест пъти годишно доклад за водещите разработки „AI Radar“, достъп до целия архив и до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.