Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Google выпустила Gemini 3.8 Flash TTS и Flash-Lite TTS с созданием голосов по подсказкам

Google выпустила Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS — 2 новые модели преобразования текста в речь в семействе Gemini Audio. Google называет их своими самыми выразительными моделями генерации аудио на сегодняшний день. Flash TTS ориентирована на творческое управление и голоса персонажей. Flash-Lite TTS предназначена для высокопроизводительного и экономичного производства. Обе модели позволяют разработчикам управлять подачей построчно с помощью естественного языка.

Можно ли их развернуть? Да, обе модели уже постепенно становятся доступными через Gemini API и Google AI Studio. Доступ предоставляется только через API, открытых весов для самостоятельного хостинга нет. Доступ к API для корпоративных клиентов через Gemini Enterprise должен появиться в ближайшее время.

Что выпустила Google

Релиз разделяет TTS на 2 уровня с общими средствами управления подачей:

  • Gemini 3.8 Flash TTS создана для глубокой творческой режиссуры и разработки персонажей. Целевые сценарии использования включают игры, иммерсивные аудиокниги, подкасты и интерактивные медиа. Модель предлагает детальный контроль над актёрскими указаниями, темпом, сменой диалектов и речевыми реакциями.
  • Gemini 3.8 Flash-Lite TTS создана для высокопроизводительного и экономичного масштабирования. Google позиционирует её для дубляжа, создания аудиоконтента и выразительных голосовых агентов. Она обеспечивает тонкий контроль над интонацией, темпом и выразительными нюансами.

В AI Studio ссылки на песочницу используют идентификаторы моделей gemini-3.8-flash-tts и gemini-3.8-flash-lite-tts.

Разработка голоса с помощью текстового запроса

Предыдущие модели Gemini TTS предлагали 30 оригинальных голосов. В релизе 3.8 используется значительно более крупная голосовая система.

  • Генеративная разработка голоса: Flash TTS создаёт новые голоса на основе запросов, описывающих роль, акцент и характеристики голоса. Это работает более чем со 100 языками и диалектами. Среди демонстрационных примеров Google — диджей из Мельбурна, монотонный робот и японский дракон.
  • Библиотека голосов: Разработчики получают более 2 000 готовых к использованию в производстве голосов. Поддерживаются региональные варианты, такие как мексиканский испанский, квебекский французский и шотландский английский.
  • Сохранение и масштабирование: Пользовательские голоса можно сохранять и использовать повторно, сохраняя минимальные расхождения между проектами.
  • Ремикс голосов (скоро): Пользователи смогут с помощью запросов изменять тембр, высоту, темп и акцент голоса из библиотеки.

Управление исполнением

Обе модели принимают сценические указания, записанные в сценарии. Gemini также может управлять подачей на основе естественных подсказок в сценарии.

  • Генерация длинных форматов: Качество голоса, темп и тембр сохраняются на протяжении нескольких часов непрерывного аудио.
  • Встроенная постановка диалога двух говорящих: Один сценарий управляет многоходовым разговором с различимыми и раздельными голосами.
  • Вокальные реакции: Невербальные указания, такие как <laughs>, <sigh> и <gasp>, добавляют разговору живости.
  • Речевые реакции: Реплики активного слушания, такие как |mhm| и |yeah|, управляют реакциями и комедийным таймингом.

Репликация голоса и средства безопасности

Репликация голоса формирует согласованный голосовой профиль на основе 30-секундного аудиосэмпла. Сэмпл должен содержать ваш голос или голос, на использование которого у вас есть права. Для репликации требуется запись устного согласия владельца голоса, сопоставленная с голосом эталонного диктора.

Каждый аудиофрагмент, созданный моделями Gemini Audio, содержит водяной знак SynthID. Эта незаметная отметка встраивается непосредственно в аудиовыход. Реплицированные голоса также содержат контентные учётные данные C2PA. Более подробная информация о подходе Google к безопасности приведена в карточке модели Gemini 3.8 Audio.

Результаты тестов

Google сообщает следующие результаты для новых моделей:

  • Тест Voice Design Benchmark от Hume AI: Flash TTS занимает 1-е место в общем рейтинге с результатом 71,4, согласно данным Hume AI.
  • Моделирование акцента: Flash TTS лидирует с результатом 60,8.
  • Индекс общего качества Hume AI: Flash TTS занимает 1-е место, а Flash-Lite TTS — 2-е.
  • Слепое тестирование предпочтений Voice Arena: Обе модели занимают ведущие позиции в японском, бразильском португальском, вьетнамском, современном стандартном арабском, мексиканском испанском и хинди.

Основные выводы

  • Google выпустила Gemini 3.8 Flash TTS для творческих задач и Flash-Lite TTS для масштабирования.
  • Flash TTS разрабатывает новые голоса на основе запросов для более чем 100 языков и диалектов.
  • Разработчики получают более 2 000 готовых к использованию в производстве голосов вместо прежних 30 оригинальных.
  • Для репликации голоса нужны 30-секундный сэмпл и соответствующая запись согласия.
  • Flash TTS занимает 1-е место в Voice Design Benchmark от Hume AI с результатом 71,4.

Часто задаваемые вопросы

  1. Что такое Gemini 3.8 Flash TTS? Это модель Google для преобразования текста в речь, предназначенная для творческой разработки голосов и построчного управления исполнением. Она доступна через Gemini API и Google AI Studio.
  2. Чем отличается Flash-Lite TTS? Flash-Lite TTS оптимизирована для высокопроизводительных и экономичных задач, таких как дубляж и голосовые агенты. Она занимает 2-е место в индексе общего качества Hume AI.
  3. Могу ли я клонировать собственный голос? Да, для этого нужны 30-секундный сэмпл и запись устного согласия. В AI Studio эта функция недоступна в нескольких регионах, включая Великобританию, ЕЭЗ и Индию.

Ознакомьтесь с техническим блогом. Все заслуги принадлежат исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с аудиторией более 150 тысяч участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости