Google запустила голосовые TTS-модели Gemini 3.8 Flash
Google запустила две голосовые модели Gemini 3.8 Flash TTS, представив специализированные системы генерации речи, разработанные для непосредственного написания сценариев исполнения и крупномасштабного производства аудио. Две модели распределяют задачи синтеза голоса между творческой режиссурой и инфраструктурой с контролируемыми затратами.
Gemini 3.8 Flash TTS предназначена для интерактивных развлечений, разработки игр и длинных повествовательных записей, где студийным командам требуется проектирование голоса с помощью промптов. Gemini 3.8 Flash-Lite TTS ориентирована на автоматизированный дубляж медиаконтента, разговорных агентов, взаимодействующих с клиентами, и высокопроизводительные конвейеры перевода.
Обе системы расширяют существующий аудиоряд Google, в который ранее вошли 3.5 Live Translate, 3.5 Transcribe, 3.8 Live и 3.8 Live Extended Thinking. Технические команды разработали новые модели для замены фиксированного набора из 30 устаревших голосов.
Теперь разработчики могут обращаться к каталогу, содержащему более 2 000 готовых голосовых профилей с региональными языковыми особенностями, такими как французский Квебека, шотландский вариант английского и мексиканский испанский, более чем на 100 языках. В будущем модуль ремикширования голоса позволит аудиоинженерам изменять тембр, высоту, темп и особенности акцента с помощью прямых текстовых команд.
Тесты Hume AI оценивают производительность синтеза
Независимые оценки вывели более крупную модель на первое место в сторонних рейтингах аудио.
В тесте Hume AI Voice Design Benchmark Gemini 3.8 Flash TTS получила общий результат 71,4, а также лидирующую в своей категории оценку 60,8 за моделирование акцента.
В индексе общего качества Hume AI Overall Quality Index Gemini 3.8 Flash TTS заняла первое место, а Gemini 3.8 Flash-Lite TTS — второе, превзойдя прежние базовые показатели Gemini 3.1 Flash TTS.
Двойные слепые испытания с участием людей, проведённые через Voice Arena, подтвердили преимущества по предпочтениям пользователей в региональных языках, включая японский, бразильский португальский, вьетнамский, современный стандартный арабский, мексиканский испанский и хинди.
Ключевое внимание уделяется постановке сцен с несколькими говорящими и расширенным сеансам синтеза. Один сценарий управляет диалогами между двумя говорящими, сохраняя естественную смену реплик и разделение голосов в продолжительных разговорах.
Качество аудио и тембр персонажей остаются стабильными в многочасовых файлах, снижая ухудшение качества голоса при записи аудиокниг и эпизодических подкастов.
Авторы могут добавлять невербальные акустические маркеры непосредственно в производственный текст, вставляя в реплики такие теги, как <laughs>, <sigh> или <gasp>, а также реактивные речевые междометия вроде |mhm| и |yeah| для поддержания разговорного темпа.
Средства обеспечения безопасности Google для голосовых моделей Gemini 3.8 Flash TTS
Конвейеры клонирования голоса используют обязательные проверки личности для снижения рисков выдачи себя за другого человека. Для воссоздания голосового профиля требуется 30-секундная эталонная запись в сопровождении отдельной дорожки с явным устным согласием, произнесённым владельцем исходного голоса. Google проверяет акустическое соответствие обеих аудиодорожек перед обработкой пользовательских профилей.
Сгенерированные звуковые файлы содержат незаметные для человеческого слуха аудиоводяные знаки SynthID и криптографические метаданные происхождения C2PA, встроенные непосредственно в экспортируемую звуковую волну, благодаря чему инструменты последующего обнаружения могут идентифицировать синтетические речевые материалы.
Развёртывание в корпоративных средах уже началось сразу в нескольких программных экосистемах. Разработчики ПО могут получить доступ к Flash TTS и Flash-Lite TTS через Google AI Studio и стандартный Gemini API, подключаясь к средам разработки, работающим на базе Agora, LiveKit, Pipecat и Vercel. Первые коммерческие интеграции охватывают Figma, HeyGen, Linguana, Wondercraft, 99.co и Ollang для регионального перевода медиаконтента и автоматизации обслуживания клиентов.
Конечные пользователи получают прямой доступ к Flash TTS внутри Gemini Notebook, а Google Vids использует Flash-Lite TTS. Клиенты Gemini Enterprise получат административный доступ к API в рамках следующего этапа развёртывания.
См. также: Транспортное командование США внедряет рандомизированный ИИ для защиты военной логистики

Хотите узнать больше об ИИ и больших данных от лидеров отрасли? Посетите AI & Big Data Expo, которая проходит в Амстердаме, Калифорнии и Лондоне. Это масштабное мероприятие является частью TechEx и проводится одновременно с другими ведущими технологическими мероприятиями, включая IoT Tech Expo и Cyber Security & Cloud Expo. Нажмите здесь, чтобы узнать больше.
AI News работает при поддержке TechForge Media. Узнайте о других предстоящих мероприятиях и вебинарах, посвящённых корпоративным технологиям, здесь.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.