Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Новые модели Google Flash TTS позволяют создавать ИИ-голоса с нуля с помощью текстовых описаний

Новые модели Flash TTS от Google позволяют создавать ИИ-голоса с нуля с помощью текстовых описаний
Маттиас Бастиан
23 сен. 2026
Nano Banana Pro по запросу THE DECODER

Ключевые моменты

  • Google выпустила две новые модели преобразования текста в речь — Gemini 3.8 Flash TTS и Flash-Lite TTS, поддерживающие более 100 языков. Flash TTS может создавать новые голоса по текстовым описаниям, а функция клонирования голоса формирует голосовые профили на основе 30-секундных аудиосэмплов.
  • Flash TTS предназначена для творческих задач, таких как подкасты, аудиокниги и персонажи игр, тогда как Flash-Lite TTS разработана для недорогой генерации речи в больших масштабах — для дубляжа, аудиоконтента и голосовых агентов.
  • Обе модели поддерживают режиссёрские указания для каждой реплики, диалоги двух голосов и невербальные звуки, такие как смех и вздохи. Их внедрение идёт через Gemini API и Google AI Studio, а доступ к Gemini Enterprise API появится позднее.

Google представляет Gemini 3.8 Flash TTS и Flash-Lite TTS — две новые модели для генерации речи. Flash TTS может создавать новые голоса по текстовым описаниям, а обе модели поддерживают более 100 языков и позволяют добавлять режиссёрские указания к отдельным репликам диалога.

По данным Google, Gemini 3.8 Flash TTS предназначена для творческих проектов, таких как персонажи игр, аудиокниги и подкасты, тогда как Gemini 3.8 Flash-Lite TTS ориентирована на недорогую генерацию речи в больших масштабах — для дубляжа, аудиоконтента и голосовых агентов.

Flash TTS позволяет создавать голоса по текстовым описаниям

С помощью Gemini 3.8 Flash TTS пользователи могут создавать голоса с нуля. По данным Google, текстовый запрос может определять роль голоса, акцент и особенности речи для широкого спектра языков и диалектов. Для тех, кто не хочет начинать с нуля, Google предлагает библиотеку из более чем 2 000 готовых голосов, включая региональные варианты, такие как мексиканский испанский, квебекский французский и шотландский английский.

Функция клонирования голоса может создать голосовой профиль на основе 30-секундного аудиосэмпла. Для этого человек, чей голос клонируется, должен записать устное согласие, причём голос в этой записи должен совпадать с голосом в образце. Каждый аудиофрагмент, сгенерированный аудиомоделями Gemini, содержит неслышимый водяной знак SynthID, помогающий выявлять речь, созданную ИИ, сообщает Google.

Google также анонсировала функцию «Voice Remixing», которая позволит пользователям регулировать тембр, высоту, темп и акцент голосов из библиотеки, однако пока она недоступна.

Режиссёрские указания дают пользователям контроль над диалогом и манерой исполнения

Обе модели позволяют пользователям писать указания для каждой реплики или самостоятельно интерпретировать сценарные пометки. Google утверждает, что модели могут генерировать многочасовые аудиозаписи с минимальным «дрейфом голоса», то есть голос со временем практически не меняется.

По данным компании, режим с двумя голосами создаёт диалог по одному сценарию, сохраняя различия между голосами. Пользователи также могут прописывать смех, вздохи и звуки вроде «м-м», чтобы точно размещать реакции и паузы там, где нужно.

В двух собственных тестах я использовал готовый голос с указанием стиля, в котором просил имитировать раздражённого берлинца, говорящего по-английски с сильным немецким акцентом. Средства управления стилем создали убедительный акцент и интонацию, однако в обоих тестах в некоторые моменты на заднем плане был слышен высокочастотный скрип. В одном из них голос также изменился в конце аудиофрагмента.


Указание стиля: Носитель немецкого языка, мужчина из Берлина, говорящий по-английски как на иностранном языке с сильным, безошибочно узнаваемым немецким акцентом. Он явно не носитель английского языка: произносит английские слова по-немецки, применяя немецкий ритм и интонацию к английским предложениям. «Th» превращается в «z» или «d» («ze», «sink», «dat»), «w» — в «v» («vat», «vell»), а конечные согласные становятся более твёрдыми («goot», «bat» вместо «bad»). Звук «r» — гортанный и хриплый, никогда не английское «r». Гласные плоские и короткие, им не хватает мягкости, характерной для американского или британского английского.

Голос носовой и слегка напряжённый, среднего регистра, с хрипловатой дрожью и вибрацией, напоминающей голос Кермита, но более грубой и менее кукольной. Он звучит как уставший берлинец в два часа ночи.

Манера исполнения: быстрая, отрывистая, рубленая. Он ненадолго запинается, когда подбирает английское слово, и иногда ровным тоном вставляет немецкое слово, не переводя его. Периодические раздражённые скачки тона вверх. Сухой, саркастичный, невпечатлённый и слегка раздражённый необходимостью вообще что-либо объяснять — и ещё сильнее раздражённый тем, что делать это приходится по-английски.

Google утверждает, что её новые модели лидируют в большинстве категорий теста преобразования текста в речь Hume AI. | Изображение: Google

Google начинает внедрение обеих моделей, а доступ к корпоративному API появится позднее

Google внедряет обе модели через Gemini API и Google AI Studio. Flash TTS также доступна в Gemini Notebook, а Flash-Lite TTS доступна в Google Vids. Google сообщает, что доступ через Gemini Enterprise API для обеих моделей появится в ближайшее время.

Платформы для разработчиков, включая Agora, LiveKit, Pipecat и Vercel, уже поддерживают интеграцию через Gemini API. Google пока не указала региональные конечные точки для новых моделей, хотя предыдущие модели TTS предлагали обработку данных в ЕС.

По данным Google, данные из бесплатного тарифа используются для улучшения её продуктов, а данные из платного тарифа — нет. Стоимость платного тарифа указана в долларах США за миллион токенов: текстовые токены тарифицируются на входе, а аудиотокены — на выходе.

Тарификация Flash TTS (до конца 2026 года) Flash TTS (с 2027 года) Flash-Lite TTS (до конца 2026 года) Flash-Lite TTS (с 2027 года)
Входной текст $0.50 $1.00 $0.50 $1.00
Выходное аудио $9.00 $18.00 $6.00 $12.00

Google сообщает, что одна секунда сгенерированного аудио соответствует 25 аудиотокенам, то есть на час приходится 90 000 токенов. Это означает, что до конца 2026 года час выходного аудио стоит $0.81 при использовании Flash TTS и $0.54 при использовании Flash-Lite TTS. 1 января 2027 года эти расходы вырастут до $1.62 и $1.08 соответственно, а входной текст будет тарифицироваться отдельно.

Новости ИИ без шумихи — отобраны людьми

Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ и наш эксклюзивный обзор передовых разработок «AI Radar» шесть раз в год, иметь полный доступ к архиву и разделу комментариев.

Источник: Google

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием The Decoder

Читать оригинал на The Decoder ↗

Текст и изображения принадлежат The Decoder и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости