Google запустила голосові TTS-моделі Gemini 3.8 Flash
Google запустила дві голосові моделі Gemini 3.8 Flash TTS, представивши спеціалізовані системи генерації мовлення, розроблені для безпосереднього сценарного керування виконанням і великосерійного виробництва аудіо. Подвійний реліз розподіляє завдання голосового синтезу між творчим керуванням і інфраструктурою з контрольованими витратами.
Gemini 3.8 Flash TTS орієнтована на інтерактивні розваги, розробку ігор і довгі оповіді, де студійні команди потребують голосового дизайну на основі підказок. Gemini 3.8 Flash-Lite TTS призначена для автоматизованого дубляжу медіа, розмовних агентів, які взаємодіють із клієнтами, і високопродуктивних конвеєрів перекладу.
Обидві системи розширюють усталену аудіолінійку Google, до якої раніше увійшли 3.5 Live Translate, 3.5 Transcribe, 3.8 Live і 3.8 Live Extended Thinking. Технічні команди розробили нові моделі для заміни фіксованих каталогів із 30 застарілих голосів.
Тепер розробники можуть отримати доступ до каталогу, що містить понад 2 000 готових голосових профілів із регіональними мовними варіантами, зокрема квебекською французькою, шотландською англійською та мексиканською іспанською, більш ніж 100 мовами. Майбутній модуль ремікшування голосу дасть змогу аудіоінженерам налаштовувати тембр, висоту, темп і особливості акценту за допомогою прямих текстових команд.
Тести Hume AI оцінюють продуктивність синтезу
Незалежні оцінювання виводять більшу модель на перше місце в рейтингах сторонніх аудіосистем.
У тесті Hume AI Voice Design Benchmark Gemini 3.8 Flash TTS отримала загальний результат 71,4, а також провідну в категорії оцінку 60,8 за моделювання акцентів.
В індексі загальної якості Hume AI Gemini 3.8 Flash TTS посіла перше місце, тоді як Gemini 3.8 Flash-Lite TTS здобула друге, перевершивши попередні базові показники Gemini 3.1 Flash TTS.
Подвійні сліпі випробування за участю людей, проведені через Voice Arena, підтвердили перевагу в регіональних мовах, зокрема японській, бразильській португальській, в’єтнамській, сучасній стандартній арабській, мексиканській іспанській та гінді.
Ключовий акцент зроблено на постановці за участю кількох мовців і тривалих сеансах синтезу. Один сценарій керує діалогом двох мовців, зберігаючи природну почерговість реплік і розділення голосів упродовж тривалих діалогів.
Якість аудіо й тембр персонажів залишаються стабільними у багатогодинних файлах, зменшуючи погіршення голосу під час запису аудіокниг та епізодичних подкастів.
Автори можуть безпосередньо вставляти в текст для виробництва невербальні акустичні маркери, додаючи до реплік такі теги, як <laughs>, <sigh> або <gasp>, а також реактивні словесні вставки на кшталт |mhm| і |yeah| для врівноваження розмовного темпу.
Засоби безпеки Google для голосових моделей Gemini 3.8 Flash TTS
Конвеєри клонування голосу використовують обов’язкові перевірки особи, щоб протидіяти ризикам видавання себе за іншу людину. Для відтворення голосового профілю потрібен 30-секундний еталонний запис у супроводі окремої звукової доріжки з явною усною згодою, виголошеною власником оригінального голосу. Google перевіряє акустичну відповідність між обома аудіодоріжками перед обробкою користувацьких профілів.
Згенеровані звукові файли містять непомітні аудіоводяні знаки SynthID і криптографічні метадані походження C2PA, безпосередньо вбудовані в експортовану звукову хвилю, завдяки чому подальші інструменти виявлення можуть ідентифікувати синтетичні мовні матеріали.
Розгортання в корпоративних середовищах уже розпочалося в межах кількох програмних екосистем. Розробники програмного забезпечення можуть отримати доступ до Flash TTS і Flash-Lite TTS через Google AI Studio та стандартний Gemini API, підключаючись до фреймворків для розробників від Agora, LiveKit, Pipecat і Vercel. Серед перших комерційних інтеграцій — Figma, HeyGen, Linguana, Wondercraft, 99.co та Ollang для регіонального перекладу медіа й автоматизації обслуговування клієнтів.
Кінцеві користувачі отримують Flash TTS безпосередньо в Gemini Notebook, тоді як Google Vids інтегрує Flash-Lite TTS. Клієнти Gemini Enterprise отримають адміністративний доступ до API під час майбутньої хвилі розгортання.
Дивіться також: U.S. TRANSCOM розгортає рандомізований ШІ для захисту військової логістики

Хочете дізнатися більше про ШІ та великі дані від лідерів галузі? Відвідайте AI & Big Data Expo, що відбудеться в Амстердамі, Каліфорнії та Лондоні. Цей комплексний захід є частиною TechEx і проходитиме одночасно з іншими провідними технологічними заходами, зокрема IoT Tech Expo та Cyber Security & Cloud Expo. Натисніть тут, щоб отримати додаткову інформацію.
AI News працює завдяки TechForge Media. Ознайомтеся з іншими майбутніми заходами та вебінарами, присвяченими корпоративним технологіям, тут.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.