Нові моделі Google Flash TTS дають змогу створювати ШІ-голоси з нуля за допомогою текстових описів
Основні моменти
- Google випустила дві нові моделі перетворення тексту на мовлення — Gemini 3.8 Flash TTS і Flash-Lite TTS, які підтримують понад 100 мов. Flash TTS може створювати нові голоси за текстовими описами, а функція клонування голосу формує профілі голосів із 30-секундних аудіозаписів.
- Flash TTS призначена для творчих завдань, як-от подкасти, аудіокниги та персонажі відеоігор, тоді як Flash-Lite TTS розроблена для недорогого масштабного генерування мовлення для дубляжу, аудіоконтенту та голосових агентів.
- Обидві моделі підтримують сценічні вказівки для кожної репліки, діалоги двома голосами та невербальні звуки, як-от сміх і зітхання. Їх поступово впроваджують через Gemini API та Google AI Studio, а доступ до Gemini Enterprise API з’явиться згодом.
Google представляє Gemini 3.8 Flash TTS і Flash-Lite TTS — дві нові моделі для генерування мовлення. Flash TTS може створювати нові голоси за текстовими описами, а обидві моделі підтримують понад 100 мов і дають змогу користувачам додавати сценічні вказівки до окремих реплік діалогу.
Gemini 3.8 Flash TTS призначена для творчих проєктів, як-от персонажі відеоігор, аудіокниги та подкасти, тоді як Gemini 3.8 Flash-Lite TTS зосереджена на недорогому масштабному генеруванні мовлення для дубляжу, аудіоконтенту та голосових агентів, повідомляє Google.
Flash TTS дає змогу створювати голоси за текстовими описами
За допомогою Gemini 3.8 Flash TTS користувачі можуть створювати голоси з нуля. За словами Google, текстовий запит може визначати роль, акцент і вокальні характеристики голосу в широкому діапазоні мов і діалектів. Для користувачів, які не хочуть починати з нуля, Google пропонує бібліотеку з понад 2 000 готових голосів, зокрема регіональні варіанти, як-от мексиканська іспанська, квебекська французька та шотландська англійська.
Функція клонування голосу може створити профіль голосу на основі 30-секундного аудіозапису. Для цього людина, чий голос клонують, має записати усну заяву про згоду, причому голос у цьому записі має збігатися із зразком. Кожен фрагмент, згенерований аудіомоделями Gemini, містить нечутний водяний знак SynthID, який допомагає виявляти мовлення, створене ШІ, згідно з даними Google.
Google також анонсувала «Voice Remixing» — функцію, яка дасть змогу користувачам змінювати тембр, висоту, темп і акцент голосів із бібліотеки, але наразі вона недоступна.
Сценарні вказівки дають користувачам контроль над діалогом і манерою виконання
Обидві моделі дають змогу користувачам писати вказівки для кожної репліки або доручати моделі самостійно інтерпретувати сценарні позначки. Google стверджує, що моделі можуть генерувати години аудіо з мінімальним «дрейфом голосу», тобто голос майже не змінюється з часом.
За даними компанії, режим із двома голосами генерує діалог з одного сценарію, зберігаючи відмінність між голосами. Користувачі також можуть прописувати сміх, зітхання та звуки на кшталт «м-м-м», щоб розміщувати реакції й паузи саме там, де вони потрібні.
У двох власних тестах я використав готовий голос із запитом на стиль, попросивши його імітувати роздратованого берлінця, який говорить англійською з сильним німецьким акцентом. Засоби керування стилем створили переконливий акцент та інтонацію, але в обох тестах у деякі моменти на тлі було чути високий писк. В одному з них голос також змінився наприкінці фрагмента.
Запит на стиль: Німець, уродженець Берліна, говорить англійською як іноземною мовою з густим, безпомилково німецьким акцентом. Він явно не носій англійської: вимовляє англійські слова по-німецьки, застосовуючи німецький ритм та інтонацію до англійських речень. «Th» перетворюється на «z» або «d» («ze», «sink», «dat»), «w» — на «v» («vat», «vell»), а кінцеві приголосні стають твердішими («goot», «bat» замість «bad»). «R» гортанне й горлове, ніколи не англійське «r». Голосні пласкі та короткі, їм бракує м’якості, притаманної американській або британській англійській.
Голос носовий і трохи напружений, середнього діапазону, з хрипким тремтінням і тремтливою манерою, схожою на Керміта, але більш грубою та менш ляльковою. Він звучить як втомлений берлінець о другій ночі.
Манера виконання: швидка, уривчаста, рубана. Він ненадовго вагається, коли шукає англійське слово, і часом рівно вставляє німецьке слово, не перекладаючи його. Часом роздратована інтонація різко підвищується. Сухий, саркастичний, байдужий і трохи роздратований тим, що взагалі мусить щось пояснювати, — і ще більше роздратований тим, що мусить робити це англійською.

Google починає впровадження обох моделей, а доступ до корпоративного API з’явиться згодом
Google впроваджує обидві моделі через Gemini API та Google AI Studio. Flash TTS також доступна в Gemini Notebook, тоді як Flash-Lite TTS доступна в Google Vids. Google повідомляє, що доступ через Gemini Enterprise API для обох моделей з’явиться найближчим часом.
Платформи для розробників, зокрема Agora, LiveKit, Pipecat і Vercel, уже підтримують інтеграцію через Gemini API. Google поки не вказала регіональні кінцеві точки для нових моделей, хоча попередні моделі TTS пропонували обробку даних у ЄС.
За словами Google, дані з безкоштовного рівня використовуються для вдосконалення її продуктів, тоді як дані з платного рівня — ні. Тарифи для платного рівня вказані в доларах США за мільйон токенів: текстові токени тарифікуються для введення, а аудіотокени — для виведення.
| Тарифікація | Flash TTS (до кінця 2026 року) | Flash TTS (починаючи з 2027 року) | Flash-Lite TTS (до кінця 2026 року) | Flash-Lite TTS (починаючи з 2027 року) |
|---|---|---|---|---|
| Введення тексту | $0.50 | $1.00 | $0.50 | $1.00 |
| Виведення аудіо | $9.00 | $18.00 | $6.00 | $12.00 |
Google повідомляє, що одна секунда згенерованого аудіо дорівнює 25 аудіотокенам, тобто на годину припадає 90 000 токенів. Це означає, що до кінця 2026 року година виведення аудіо коштує $0.81 у Flash TTS і $0.54 у Flash-Lite TTS. 1 січня 2027 року ціни зростуть до $1.62 і $1.08 відповідно, а введення тексту тарифікуватиметься окремо.
Новини про ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний шість разів на рік звіт про передові технології «AI Radar», доступ до повного архіву та розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.