Google выпустила Gemini 3.8 Flash TTS и Flash-Lite TTS с созданием голосов по подсказкам
Google выпустила Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS — 2 новые модели преобразования текста в речь в семействе Gemini Audio. Google называет их своими самыми выразительными моделями генерации аудио на сегодняшний день. Flash TTS ориентирована на творческое управление и голоса персонажей. Flash-Lite TTS предназначена для высокопроизводительного и экономичного производства. Обе модели позволяют разработчикам управлять подачей построчно с помощью естественного языка.
Можно ли их развернуть? Да, обе модели уже постепенно становятся доступными через Gemini API и Google AI Studio. Доступ предоставляется только через API, открытых весов для самостоятельного хостинга нет. Доступ к API для корпоративных клиентов через Gemini Enterprise должен появиться в ближайшее время.
Что выпустила Google
Релиз разделяет TTS на 2 уровня с общими средствами управления подачей:
- Gemini 3.8 Flash TTS создана для глубокой творческой режиссуры и разработки персонажей. Целевые сценарии использования включают игры, иммерсивные аудиокниги, подкасты и интерактивные медиа. Модель предлагает детальный контроль над актёрскими указаниями, темпом, сменой диалектов и речевыми реакциями.
- Gemini 3.8 Flash-Lite TTS создана для высокопроизводительного и экономичного масштабирования. Google позиционирует её для дубляжа, создания аудиоконтента и выразительных голосовых агентов. Она обеспечивает тонкий контроль над интонацией, темпом и выразительными нюансами.
В AI Studio ссылки на песочницу используют идентификаторы моделей gemini-3.8-flash-tts и gemini-3.8-flash-lite-tts.
Разработка голоса с помощью текстового запроса
Предыдущие модели Gemini TTS предлагали 30 оригинальных голосов. В релизе 3.8 используется значительно более крупная голосовая система.
- Генеративная разработка голоса: Flash TTS создаёт новые голоса на основе запросов, описывающих роль, акцент и характеристики голоса. Это работает более чем со 100 языками и диалектами. Среди демонстрационных примеров Google — диджей из Мельбурна, монотонный робот и японский дракон.
- Библиотека голосов: Разработчики получают более 2 000 готовых к использованию в производстве голосов. Поддерживаются региональные варианты, такие как мексиканский испанский, квебекский французский и шотландский английский.
- Сохранение и масштабирование: Пользовательские голоса можно сохранять и использовать повторно, сохраняя минимальные расхождения между проектами.
- Ремикс голосов (скоро): Пользователи смогут с помощью запросов изменять тембр, высоту, темп и акцент голоса из библиотеки.
Управление исполнением
Обе модели принимают сценические указания, записанные в сценарии. Gemini также может управлять подачей на основе естественных подсказок в сценарии.
- Генерация длинных форматов: Качество голоса, темп и тембр сохраняются на протяжении нескольких часов непрерывного аудио.
- Встроенная постановка диалога двух говорящих: Один сценарий управляет многоходовым разговором с различимыми и раздельными голосами.
- Вокальные реакции: Невербальные указания, такие как
<laughs>,<sigh>и<gasp>, добавляют разговору живости. - Речевые реакции: Реплики активного слушания, такие как
|mhm|и|yeah|, управляют реакциями и комедийным таймингом.
Репликация голоса и средства безопасности
Репликация голоса формирует согласованный голосовой профиль на основе 30-секундного аудиосэмпла. Сэмпл должен содержать ваш голос или голос, на использование которого у вас есть права. Для репликации требуется запись устного согласия владельца голоса, сопоставленная с голосом эталонного диктора.
Каждый аудиофрагмент, созданный моделями Gemini Audio, содержит водяной знак SynthID. Эта незаметная отметка встраивается непосредственно в аудиовыход. Реплицированные голоса также содержат контентные учётные данные C2PA. Более подробная информация о подходе Google к безопасности приведена в карточке модели Gemini 3.8 Audio.
Результаты тестов
Google сообщает следующие результаты для новых моделей:
- Тест Voice Design Benchmark от Hume AI: Flash TTS занимает 1-е место в общем рейтинге с результатом 71,4, согласно данным Hume AI.
- Моделирование акцента: Flash TTS лидирует с результатом 60,8.
- Индекс общего качества Hume AI: Flash TTS занимает 1-е место, а Flash-Lite TTS — 2-е.
- Слепое тестирование предпочтений Voice Arena: Обе модели занимают ведущие позиции в японском, бразильском португальском, вьетнамском, современном стандартном арабском, мексиканском испанском и хинди.
Основные выводы
- Google выпустила Gemini 3.8 Flash TTS для творческих задач и Flash-Lite TTS для масштабирования.
- Flash TTS разрабатывает новые голоса на основе запросов для более чем 100 языков и диалектов.
- Разработчики получают более 2 000 готовых к использованию в производстве голосов вместо прежних 30 оригинальных.
- Для репликации голоса нужны 30-секундный сэмпл и соответствующая запись согласия.
- Flash TTS занимает 1-е место в Voice Design Benchmark от Hume AI с результатом 71,4.
Часто задаваемые вопросы
- Что такое Gemini 3.8 Flash TTS? Это модель Google для преобразования текста в речь, предназначенная для творческой разработки голосов и построчного управления исполнением. Она доступна через Gemini API и Google AI Studio.
- Чем отличается Flash-Lite TTS? Flash-Lite TTS оптимизирована для высокопроизводительных и экономичных задач, таких как дубляж и голосовые агенты. Она занимает 2-е место в индексе общего качества Hume AI.
- Могу ли я клонировать собственный голос? Да, для этого нужны 30-секундный сэмпл и запись устного согласия. В AI Studio эта функция недоступна в нескольких регионах, включая Великобританию, ЕЭЗ и Индию.
Ознакомьтесь с техническим блогом. Все заслуги принадлежат исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с аудиторией более 150 тысяч участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.