Новые модели Google Flash TTS позволяют создавать ИИ-голоса с нуля с помощью текстовых описаний
Ключевые моменты
- Google выпустила две новые модели преобразования текста в речь — Gemini 3.8 Flash TTS и Flash-Lite TTS, поддерживающие более 100 языков. Flash TTS может создавать новые голоса по текстовым описаниям, а функция клонирования голоса формирует голосовые профили на основе 30-секундных аудиосэмплов.
- Flash TTS предназначена для творческих задач, таких как подкасты, аудиокниги и персонажи игр, тогда как Flash-Lite TTS разработана для недорогой генерации речи в больших масштабах — для дубляжа, аудиоконтента и голосовых агентов.
- Обе модели поддерживают режиссёрские указания для каждой реплики, диалоги двух голосов и невербальные звуки, такие как смех и вздохи. Их внедрение идёт через Gemini API и Google AI Studio, а доступ к Gemini Enterprise API появится позднее.
Google представляет Gemini 3.8 Flash TTS и Flash-Lite TTS — две новые модели для генерации речи. Flash TTS может создавать новые голоса по текстовым описаниям, а обе модели поддерживают более 100 языков и позволяют добавлять режиссёрские указания к отдельным репликам диалога.
По данным Google, Gemini 3.8 Flash TTS предназначена для творческих проектов, таких как персонажи игр, аудиокниги и подкасты, тогда как Gemini 3.8 Flash-Lite TTS ориентирована на недорогую генерацию речи в больших масштабах — для дубляжа, аудиоконтента и голосовых агентов.
Flash TTS позволяет создавать голоса по текстовым описаниям
С помощью Gemini 3.8 Flash TTS пользователи могут создавать голоса с нуля. По данным Google, текстовый запрос может определять роль голоса, акцент и особенности речи для широкого спектра языков и диалектов. Для тех, кто не хочет начинать с нуля, Google предлагает библиотеку из более чем 2 000 готовых голосов, включая региональные варианты, такие как мексиканский испанский, квебекский французский и шотландский английский.
Функция клонирования голоса может создать голосовой профиль на основе 30-секундного аудиосэмпла. Для этого человек, чей голос клонируется, должен записать устное согласие, причём голос в этой записи должен совпадать с голосом в образце. Каждый аудиофрагмент, сгенерированный аудиомоделями Gemini, содержит неслышимый водяной знак SynthID, помогающий выявлять речь, созданную ИИ, сообщает Google.
Google также анонсировала функцию «Voice Remixing», которая позволит пользователям регулировать тембр, высоту, темп и акцент голосов из библиотеки, однако пока она недоступна.
Режиссёрские указания дают пользователям контроль над диалогом и манерой исполнения
Обе модели позволяют пользователям писать указания для каждой реплики или самостоятельно интерпретировать сценарные пометки. Google утверждает, что модели могут генерировать многочасовые аудиозаписи с минимальным «дрейфом голоса», то есть голос со временем практически не меняется.
По данным компании, режим с двумя голосами создаёт диалог по одному сценарию, сохраняя различия между голосами. Пользователи также могут прописывать смех, вздохи и звуки вроде «м-м», чтобы точно размещать реакции и паузы там, где нужно.
В двух собственных тестах я использовал готовый голос с указанием стиля, в котором просил имитировать раздражённого берлинца, говорящего по-английски с сильным немецким акцентом. Средства управления стилем создали убедительный акцент и интонацию, однако в обоих тестах в некоторые моменты на заднем плане был слышен высокочастотный скрип. В одном из них голос также изменился в конце аудиофрагмента.
Указание стиля: Носитель немецкого языка, мужчина из Берлина, говорящий по-английски как на иностранном языке с сильным, безошибочно узнаваемым немецким акцентом. Он явно не носитель английского языка: произносит английские слова по-немецки, применяя немецкий ритм и интонацию к английским предложениям. «Th» превращается в «z» или «d» («ze», «sink», «dat»), «w» — в «v» («vat», «vell»), а конечные согласные становятся более твёрдыми («goot», «bat» вместо «bad»). Звук «r» — гортанный и хриплый, никогда не английское «r». Гласные плоские и короткие, им не хватает мягкости, характерной для американского или британского английского.
Голос носовой и слегка напряжённый, среднего регистра, с хрипловатой дрожью и вибрацией, напоминающей голос Кермита, но более грубой и менее кукольной. Он звучит как уставший берлинец в два часа ночи.
Манера исполнения: быстрая, отрывистая, рубленая. Он ненадолго запинается, когда подбирает английское слово, и иногда ровным тоном вставляет немецкое слово, не переводя его. Периодические раздражённые скачки тона вверх. Сухой, саркастичный, невпечатлённый и слегка раздражённый необходимостью вообще что-либо объяснять — и ещё сильнее раздражённый тем, что делать это приходится по-английски.

Google начинает внедрение обеих моделей, а доступ к корпоративному API появится позднее
Google внедряет обе модели через Gemini API и Google AI Studio. Flash TTS также доступна в Gemini Notebook, а Flash-Lite TTS доступна в Google Vids. Google сообщает, что доступ через Gemini Enterprise API для обеих моделей появится в ближайшее время.
Платформы для разработчиков, включая Agora, LiveKit, Pipecat и Vercel, уже поддерживают интеграцию через Gemini API. Google пока не указала региональные конечные точки для новых моделей, хотя предыдущие модели TTS предлагали обработку данных в ЕС.
По данным Google, данные из бесплатного тарифа используются для улучшения её продуктов, а данные из платного тарифа — нет. Стоимость платного тарифа указана в долларах США за миллион токенов: текстовые токены тарифицируются на входе, а аудиотокены — на выходе.
| Тарификация | Flash TTS (до конца 2026 года) | Flash TTS (с 2027 года) | Flash-Lite TTS (до конца 2026 года) | Flash-Lite TTS (с 2027 года) |
|---|---|---|---|---|
| Входной текст | $0.50 | $1.00 | $0.50 | $1.00 |
| Выходное аудио | $9.00 | $18.00 | $6.00 | $12.00 |
Google сообщает, что одна секунда сгенерированного аудио соответствует 25 аудиотокенам, то есть на час приходится 90 000 токенов. Это означает, что до конца 2026 года час выходного аудио стоит $0.81 при использовании Flash TTS и $0.54 при использовании Flash-Lite TTS. 1 января 2027 года эти расходы вырастут до $1.62 и $1.08 соответственно, а входной текст будет тарифицироваться отдельно.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ и наш эксклюзивный обзор передовых разработок «AI Radar» шесть раз в год, иметь полный доступ к архиву и разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.