Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Новите Flash TTS модели на Google ви позволяват да създавате AI гласове от нулата чрез текстови описания

Новите Flash TTS модели на Google ви позволяват да проектирате AI гласове от нулата с помощта на текстови описания
Matthias Bastian
23 септември 2026 г.
Nano Banana Pro, подканен от THE DECODER

Основни моменти

  • Google пусна два нови модела за преобразуване на текст в реч — Gemini 3.8 Flash TTS и Flash-Lite TTS, които поддържат повече от 100 езика. Flash TTS може да създава нови гласове от текстови описания, а функцията за клониране на глас изгражда гласови профили от 30-секундни аудиозаписи.
  • Flash TTS е насочен към творчески приложения като подкасти, аудиокниги и герои в игри, докато Flash-Lite TTS е предназначен за евтино генериране на реч в голям мащаб за дублаж, аудиосъдържание и гласови агенти.
  • И двата модела поддържат сценични указания за всеки ред, диалог с два гласа и невербални звуци като смях и въздишки. Те се внедряват чрез Gemini API и Google AI Studio, а достъпът през Gemini Enterprise API ще последва.

Google представя Gemini 3.8 Flash TTS и Flash-Lite TTS — два нови модела за генериране на реч. Flash TTS може да създава нови гласове от текстови описания, а и двата модела поддържат повече от 100 езика и позволяват на потребителите да добавят сценични указания към отделни реплики от диалога.

Gemini 3.8 Flash TTS е предназначен за творчески проекти като герои в игри, аудиокниги и подкасти, докато Gemini 3.8 Flash-Lite TTS се фокусира върху евтино генериране на реч в голям мащаб за дублаж, аудиосъдържание и гласови агенти, според Google.

Flash TTS позволява на потребителите да създават гласове от текстови описания

С Gemini 3.8 Flash TTS потребителите могат да проектират гласове от нулата. Според Google текстова подкана може да определи ролята, акцента и вокалните характеристики на гласа на широк спектър от езици и диалекти. За потребителите, които не искат да започват от нулата, Google предлага библиотека с повече от 2000 предварително зададени гласа, включително регионални варианти като мексикански испански, квебекски френски и шотландски английски.

Функция за клониране на глас може да изгради гласов профил от 30-секунден аудиозапис. За да се използва, човекът, чийто глас се клонира, трябва да запише изречено изявление за съгласие, а гласът в този запис трябва да съвпада с гласа в записа-образец. Всеки клип, генериран от аудиомоделите Gemini, съдържа нечуваем воден знак SynthID, който помага за откриването на генерирана от AI реч, според Google.

Google също така обяви „Voice Remixing“ — функция, която ще позволи на потребителите да настройват тембъра, височината, темпото и акцента на гласовете от библиотеката, но тя все още не е достъпна.

Указанията в сценария дават на потребителите контрол върху диалога и начина на изпълнение

И двата модела позволяват на потребителите да записват указания за всеки ред или да оставят модела сам да интерпретира сценичните бележки в сценария. Google твърди, че моделите могат да генерират часове аудио с минимално „отклонение на говорещия“, което означава, че гласът почти не се променя с времето.

Режимът с два гласа генерира диалог от един-единствен сценарий, като запазва различията между гласовете, според компанията. Потребителите могат също да задават в сценария смях, въздишки и звуци като „мхм“, за да поставят реакциите и паузите точно там, където искат.

В два мои собствени теста използвах предварително зададен глас със стилова подкана, която го караше да имитира раздразнен берлинчанин, говорещ английски с плътен немски акцент. Контролите на стила създадоха убедителен акцент и интонация, но и в двата теста на моменти на заден план се чуваше високочестотно виене. В единия от тях гласът също се промени в края на клипа.


Стилова подкана: Роден германец от Берлин, който говори английски като чужд език, с плътен, недвусмислен немски акцент. Той очевидно не е носител на английския език: произнася английските думи по немски, като прилага немски ритъм и интонация към английските изречения. „Th“ се превръща в „z“ или „d“ („ze“, „sink“, „dat“), „w“ се превръща във „v“ („vat“, „vell“), а крайните съгласни стават по-твърди („goot“, „bat“ вместо „bad“). „R“ е гърлено и дълбоко, никога английското „r“. Гласните са плоски и кратки, без мекотата, характерна за американския или британския английски.

Гласът е назален и леко напрегнат, в средния регистър, с дрезгаво трептене и люлеене, подобно на Кърмит, но по-грубо и по-малко куклено. Звучи като уморен берлинчанин в 2 часа през нощта.

Изпълнение: бързо, отсечено, накъсано. Той се поколебава за кратко, когато търси английска дума, и понякога вмъква немската дума без превод и без промяна в интонацията. Периодични раздразнени прекъсвания с повишаване на тона. Сух, саркастичен, невпечатлен и леко раздразнен, че изобщо трябва да обяснява нещо — и още по-раздразнен, че трябва да го прави на английски.

Google твърди, че новите му модели са водещи в повечето категории на теста за преобразуване на текст в реч на Hume AI. | Изображение: Google

Google започва внедряването на двата модела, а достъпът през корпоративния API ще последва

Google внедрява и двата модела чрез Gemini API и Google AI Studio. Flash TTS е достъпен и в Gemini Notebook, докато Flash-Lite TTS е достъпен в Google Vids. Google заявява, че достъпът чрез Gemini Enterprise API скоро ще бъде предоставен и за двата модела.

Платформи за разработчици, включително Agora, LiveKit, Pipecat и Vercel, вече поддържат интеграция чрез Gemini API. Google все още не е посочил регионални крайни точки за новите модели, въпреки че по-ранни модели за преобразуване на текст в реч предлагаха обработка на данни в ЕС.

Според Google данните от безплатния план се използват за подобряване на продуктите му, докато данните от платения план не се използват за тази цел. Цените на платения план са посочени в щатски долари за милион токени, като текстовите токени се таксуват за входа, а аудиотокените — за изхода.

Таксуване Flash TTS (до края на 2026 г.) Flash TTS (от 2027 г.) Flash-Lite TTS (до края на 2026 г.) Flash-Lite TTS (от 2027 г.)
Входен текст $0.50 $1.00 $0.50 $1.00
Изходно аудио $9.00 $18.00 $6.00 $12.00

Google заявява, че една секунда генерирано аудио се равнява на 25 аудиотокена, което означава 90 000 токена за един час. Това означава, че един час аудиоизход струва $0.81 с Flash TTS и $0.54 с Flash-Lite TTS до края на 2026 г. На 1 януари 2027 г. тези разходи ще нараснат съответно до $1.62 и $1.08, като входният текст се таксува отделно.

AI новини без сензацията — подбрани от хора

Абонирайте се за THE DECODER и получете четене без реклами, седмичен бюлетин за AI, ексклузивния ни шест пъти годишно доклад за водещите разработки „AI Radar“, достъп до целия архив и до секцията за коментари.

Източник: Google

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от The Decoder на

Прочетете оригинала в The Decoder ↗

Текстът и изображенията са собственост на The Decoder и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини