Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Google пуска Gemini 3.8 Flash TTS и Flash-Lite TTS с дизайн на гласове чрез подкани

Google пусна Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS — 2 нови модела за преобразуване на текст в реч от семейството Gemini Audio. Google ги определя като най-изразителните си модели за генериране на аудио досега. Flash TTS е насочен към творческа режисура и гласове на персонажи. Flash-Lite TTS е предназначен за високoобемно и икономично производство. И двата модела позволяват на разработчиците да насочват изпълнението ред по ред чрез естествен език.

Могат ли да бъдат внедрени? Да, и двата модела вече се предоставят чрез Gemini API и Google AI Studio. Достъпът е само чрез API, без отворени тегла за самостоятелно хостване. Достъпът до корпоративния API чрез Gemini Enterprise е посочен като предстоящ.

Какво представи Google

Представянето разделя TTS на 2 нива със споделени контроли за насочване:

  • Gemini 3.8 Flash TTS е създаден за задълбочена творческа режисура и дизайн на персонажи. Сред целевите приложения са видеоигри, завладяващи аудиокниги, подкасти и интерактивни медии. Той предлага детайлен контрол върху режисьорските указания, темпото, промените в диалекта и репликите за активно слушане.
  • Gemini 3.8 Flash-Lite TTS е създаден за високoобемно и икономично мащабиране. Google го позиционира за дублаж, създаване на аудио съдържание и изразителни гласови агенти. Той предлага прецизен контрол върху тона, темпото и изразителните нюанси.

В AI Studio връзките към работната среда използват идентификаторите на моделите gemini-3.8-flash-tts и gemini-3.8-flash-lite-tts.

Дизайн на глас от текстова подкана

Предишните TTS модели Gemini предлагаха 30 оригинални гласа. Версия 3.8 преминава към значително по-голяма гласова система.

  • Генеративен дизайн на гласове: Flash TTS създава нови гласове от подкани, описващи роля, акцент и характеристики на гласа. Това работи на повече от 100 езика и диалекта. Демонстрациите на Google включват диджей от Мелбърн, монотонен робот и японски дракон.
  • Библиотека с гласове: Разработчиците получават над 2000 готови за производство гласа. Покритието включва регионални разновидности като мексикански испански, квебекски френски и шотландски английски.
  • Запазване и мащабиране: Персонализираните гласове могат да бъдат запазвани и използвани повторно, с минимално отклонение между проектите.
  • Ремиксиране на гласове (предстои): Потребителите ще могат да настройват тембъра, височината, темпото и акцента на глас от библиотеката чрез подкани.

Насочване на изпълнението

И двата модела приемат сценични указания, написани в сценария. Gemini може също да управлява изпълнението чрез естествени указания в сценария.

  • Генериране на дълги форми: Качеството на гласа, темпото и тембърът се запазват в продължение на часове непрекъснато аудио.
  • Естествено озвучаване на разговор между 2 говорители: Един сценарий управлява разговор с множество реплики и ясно разграничени гласове.
  • Вокални изблици: Невербални сигнали като <laughs>, <sigh> и <gasp> добавят разговорна текстура.
  • Реплики за активно слушане: Вметки като |mhm| и |yeah| контролират реакциите и комедийния тайминг.

Възпроизвеждане на глас и контроли за безопасност

Възпроизвеждането на глас изгражда последователен вокален профил от 30-секундна аудиопроба. Пробата трябва да е вашият глас или глас, за който имате право да използвате. Възпроизвеждането изисква запис на словесно съгласие от собственика на гласа, съпоставен с референтния говорител.

Всеки клип от аудио моделите Gemini съдържа воден знак SynthID. Този незабележим знак е вграден директно в аудиоизхода. Възпроизведените гласове също съдържат идентификационни данни за съдържание C2PA. Google насочва към картата на модела Gemini 3.8 Audio за по-широкия си подход към безопасността.

Резултати от бенчмарковете

Google съобщава следните резултати за новите модели:

  • Бенчмарк за дизайн на гласове на Hume AI: Flash TTS заема първо място като цяло с резултат 71,4 според Hume AI.
  • Моделиране на акценти: Flash TTS води с резултат 60,8.
  • Индекс за общо качество на Hume AI: Flash TTS заема първо място, а Flash-Lite TTS — второ.
  • Сляпо предпочитание на Voice Arena: И двата модела заемат челни позиции при японски, бразилски португалски, виетнамски, съвременен стандартен арабски, мексикански испански и хинди.

Основни изводи

  • Google пусна Gemini 3.8 Flash TTS за творческа работа и Flash-Lite TTS за мащабиране.
  • Flash TTS проектира нови гласове от подкани на над 100 езика и диалекта.
  • Разработчиците получават над 2000 готови за производство гласа спрямо първоначалните 30.
  • Възпроизвеждането на глас изисква 30-секундна проба и съответстващ запис на съгласие.
  • Flash TTS заема първо място в бенчмарка за дизайн на гласове на Hume AI с резултат 71,4.

Често задавани въпроси

  1. Какво представлява Gemini 3.8 Flash TTS? Това е моделът на Google за преобразуване на текст в реч, предназначен за творчески дизайн на гласове и насочване на изпълнението ред по ред. Той е достъпен чрез Gemini API и Google AI Studio.
  2. По какво се различава Flash-Lite TTS? Flash-Lite TTS е оптимизиран за високoобемни и икономични натоварвания като дублаж и гласови агенти. Той заема второ място в индекса за общо качество на Hume AI.
  3. Мога ли да клонирам собствения си глас? Да, с 30-секундна проба и запис на словесно съгласие. Функцията не е достъпна в AI Studio в няколко региона, включително Обединеното кралство, ЕИП и Индия.

Вижте техническия блог. Всички заслуги са за изследователя на този проект. Също така не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия 150k+ ML SubReddit и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризирането на вашето GitHub хранилище ИЛИ страница в Hugging Face, ИЛИ представяне на продукт, ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини