Google пуска Gemini 3.8 Flash TTS и Flash-Lite TTS с дизайн на гласове чрез подкани
Google пусна Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS — 2 нови модела за преобразуване на текст в реч от семейството Gemini Audio. Google ги определя като най-изразителните си модели за генериране на аудио досега. Flash TTS е насочен към творческа режисура и гласове на персонажи. Flash-Lite TTS е предназначен за високoобемно и икономично производство. И двата модела позволяват на разработчиците да насочват изпълнението ред по ред чрез естествен език.
Могат ли да бъдат внедрени? Да, и двата модела вече се предоставят чрез Gemini API и Google AI Studio. Достъпът е само чрез API, без отворени тегла за самостоятелно хостване. Достъпът до корпоративния API чрез Gemini Enterprise е посочен като предстоящ.
Какво представи Google
Представянето разделя TTS на 2 нива със споделени контроли за насочване:
- Gemini 3.8 Flash TTS е създаден за задълбочена творческа режисура и дизайн на персонажи. Сред целевите приложения са видеоигри, завладяващи аудиокниги, подкасти и интерактивни медии. Той предлага детайлен контрол върху режисьорските указания, темпото, промените в диалекта и репликите за активно слушане.
- Gemini 3.8 Flash-Lite TTS е създаден за високoобемно и икономично мащабиране. Google го позиционира за дублаж, създаване на аудио съдържание и изразителни гласови агенти. Той предлага прецизен контрол върху тона, темпото и изразителните нюанси.
В AI Studio връзките към работната среда използват идентификаторите на моделите gemini-3.8-flash-tts и gemini-3.8-flash-lite-tts.
Дизайн на глас от текстова подкана
Предишните TTS модели Gemini предлагаха 30 оригинални гласа. Версия 3.8 преминава към значително по-голяма гласова система.
- Генеративен дизайн на гласове: Flash TTS създава нови гласове от подкани, описващи роля, акцент и характеристики на гласа. Това работи на повече от 100 езика и диалекта. Демонстрациите на Google включват диджей от Мелбърн, монотонен робот и японски дракон.
- Библиотека с гласове: Разработчиците получават над 2000 готови за производство гласа. Покритието включва регионални разновидности като мексикански испански, квебекски френски и шотландски английски.
- Запазване и мащабиране: Персонализираните гласове могат да бъдат запазвани и използвани повторно, с минимално отклонение между проектите.
- Ремиксиране на гласове (предстои): Потребителите ще могат да настройват тембъра, височината, темпото и акцента на глас от библиотеката чрез подкани.
Насочване на изпълнението
И двата модела приемат сценични указания, написани в сценария. Gemini може също да управлява изпълнението чрез естествени указания в сценария.
- Генериране на дълги форми: Качеството на гласа, темпото и тембърът се запазват в продължение на часове непрекъснато аудио.
- Естествено озвучаване на разговор между 2 говорители: Един сценарий управлява разговор с множество реплики и ясно разграничени гласове.
- Вокални изблици: Невербални сигнали като
<laughs>,<sigh>и<gasp>добавят разговорна текстура. - Реплики за активно слушане: Вметки като
|mhm|и|yeah|контролират реакциите и комедийния тайминг.
Възпроизвеждане на глас и контроли за безопасност
Възпроизвеждането на глас изгражда последователен вокален профил от 30-секундна аудиопроба. Пробата трябва да е вашият глас или глас, за който имате право да използвате. Възпроизвеждането изисква запис на словесно съгласие от собственика на гласа, съпоставен с референтния говорител.
Всеки клип от аудио моделите Gemini съдържа воден знак SynthID. Този незабележим знак е вграден директно в аудиоизхода. Възпроизведените гласове също съдържат идентификационни данни за съдържание C2PA. Google насочва към картата на модела Gemini 3.8 Audio за по-широкия си подход към безопасността.
Резултати от бенчмарковете
Google съобщава следните резултати за новите модели:
- Бенчмарк за дизайн на гласове на Hume AI: Flash TTS заема първо място като цяло с резултат 71,4 според Hume AI.
- Моделиране на акценти: Flash TTS води с резултат 60,8.
- Индекс за общо качество на Hume AI: Flash TTS заема първо място, а Flash-Lite TTS — второ.
- Сляпо предпочитание на Voice Arena: И двата модела заемат челни позиции при японски, бразилски португалски, виетнамски, съвременен стандартен арабски, мексикански испански и хинди.
Основни изводи
- Google пусна Gemini 3.8 Flash TTS за творческа работа и Flash-Lite TTS за мащабиране.
- Flash TTS проектира нови гласове от подкани на над 100 езика и диалекта.
- Разработчиците получават над 2000 готови за производство гласа спрямо първоначалните 30.
- Възпроизвеждането на глас изисква 30-секундна проба и съответстващ запис на съгласие.
- Flash TTS заема първо място в бенчмарка за дизайн на гласове на Hume AI с резултат 71,4.
Често задавани въпроси
- Какво представлява Gemini 3.8 Flash TTS? Това е моделът на Google за преобразуване на текст в реч, предназначен за творчески дизайн на гласове и насочване на изпълнението ред по ред. Той е достъпен чрез Gemini API и Google AI Studio.
- По какво се различава Flash-Lite TTS? Flash-Lite TTS е оптимизиран за високoобемни и икономични натоварвания като дублаж и гласови агенти. Той заема второ място в индекса за общо качество на Hume AI.
- Мога ли да клонирам собствения си глас? Да, с 30-секундна проба и запис на словесно съгласие. Функцията не е достъпна в AI Studio в няколко региона, включително Обединеното кралство, ЕИП и Индия.
Вижте техническия блог. Всички заслуги са за изследователя на този проект. Също така не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия 150k+ ML SubReddit и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризирането на вашето GitHub хранилище ИЛИ страница в Hugging Face, ИЛИ представяне на продукт, ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.