Google пусна два гласови TTS модела Gemini 3.8 Flash
Google представи два гласови TTS модела Gemini 3.8 Flash, въвеждайки специализирани системи за генериране на реч, проектирани за директно скриптиране на изпълнения и широкомащабно производство на аудио. Двойното издание разделя задачите по синтез на глас между творческа режисура и разходно оптимизирана инфраструктура.
Gemini 3.8 Flash TTS е насочен към интерактивните развлечения, разработването на игри и дългите разкази, където студийните екипи изискват гласов дизайн, задаван чрез подсказки. Gemini 3.8 Flash-Lite TTS се фокусира върху автоматизирания дублаж на медийно съдържание, разговорните агенти, насочени към клиентите, и високопроизводителните преводачески процеси.
И двете системи разширяват утвърденото аудио портфолио на Google, което преди това включваше 3.5 Live Translate, 3.5 Transcribe, 3.8 Live и 3.8 Live Extended Thinking. Техническите екипи са разработили новите модели така, че да заменят фиксираните каталози от 30 наследени гласа.
Разработчиците вече могат да използват директория с над 2000 предварително изградени гласови профила, обхващащи регионални езикови разновидности като френския в Квебек, шотландския английски и мексиканския испански на повече от 100 езика. Предстоящ модул за ремиксиране на гласове ще позволи на аудиоинженерите да настройват тембъра, височината, темпото и характеристиките на акцента чрез директни текстови команди.
Тестовете на Hume AI сравняват ефективността на синтеза
Независими оценки поставят по-големия модел на върха на класациите за аудио на трети страни.
В бенчмарка Hume AI Voice Design Benchmark Gemini 3.8 Flash TTS регистрира общ резултат от 71.4, заедно с водеща в категорията оценка от 60.8 за моделиране на акцент.
В индекса Hume AI Overall Quality Index Gemini 3.8 Flash TTS зае първото място, докато Gemini 3.8 Flash-Lite TTS се класира втори, надминавайки по-ранните базови резултати, постигнати от Gemini 3.1 Flash TTS.
Двойно слепи изпитвания с хора, проведени чрез Voice Arena, потвърдиха предимството по отношение на предпочитанията при регионалните езици, включително японски, бразилски португалски, виетнамски, съвременен стандартен арабски, мексикански испански и хинди.
Сценичното оформление с множество говорители и продължителните синтезирани записи са основен фокус. Един-единствен скрипт управлява диалози между двама говорители, като запазва естественото редуване на репликите и разделянето на гласовете в продължителни разговори.
Качеството на аудиото и тембърът на персонажите остават стабилни при файлове с продължителност от няколко часа, което намалява влошаването на гласа при записи на аудиокниги и епизодични подкасти.
Авторите могат да вмъкват невербални акустични маркери директно в производствения текст, като добавят тагове като <laughs>, <sigh> или <gasp> в репликите, заедно с реактивни словесни междуметия като |mhm| и |yeah|, за да балансират темпото на разговора.
Контролите за безопасност на Google за гласовите модели Gemini 3.8 Flash TTS
Процесите за клониране на глас разчитат на задължителни проверки на самоличността, за да противодействат на рисковете от представяне за друго лице. За пресъздаването на гласов профил е необходим 30-секунден референтен запис, придружен от изричен аудиозапис на вербално съгласие, произнесено от първоначалния собственик на гласа. Google проверява акустичното съответствие между двата аудиозаписа, преди да обработи персонализираните профили.
Генерираните звукови файлове съдържат незабележими аудиоводни знаци SynthID и криптографски метаданни за произход C2PA, вградени директно в експортираната звукова вълна, което гарантира, че инструментите за последващо откриване могат да идентифицират синтетичните речеви активи.
Внедряването в корпоративни среди започна в множество софтуерни екосистеми. Разработчиците на софтуер могат да получат достъп до Flash TTS и Flash-Lite TTS чрез Google AI Studio и стандартния Gemini API, свързвайки се с разработвачески рамки, поддържани от Agora, LiveKit, Pipecat и Vercel. Ранните търговски интеграции обхващат Figma, HeyGen, Linguana, Wondercraft, 99.co и Ollang за регионален превод на медийно съдържание и автоматизация на обслужването на клиенти.
Крайните потребители получават Flash TTS директно в Gemini Notebook, докато Google Vids интегрира Flash-Lite TTS. Клиентите на Gemini Enterprise ще получат административен API достъп в рамките на предстояща вълна на внедряване.
Вижте също: U.S. TRANSCOM внедрява рандомизиран AI за защита на военната логистика

Искате ли да научите повече за AI и големите данни от лидери в индустрията? Посетете AI & Big Data Expo, което ще се проведе в Амстердам, Калифорния и Лондон. Всеобхватното събитие е част от TechEx и се провежда едновременно с други водещи технологични събития, включително IoT Tech Expo и Cyber Security & Cloud Expo. Кликнете тук за повече информация.
AI News се поддържа от TechForge Media. Разгледайте други предстоящи събития и уебинари за корпоративни технологии тук.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.