Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Google випустила Gemini 3.8 Flash TTS і Flash-Lite TTS зі створенням голосів за підказками

Google випустила Gemini 3.8 Flash TTS і Gemini 3.8 Flash-Lite TTS — 2 нові моделі перетворення тексту на мовлення у своєму сімействі Gemini Audio. Google називає їх своїми найвиразнішими моделями генерації аудіо на сьогодні. Flash TTS орієнтована на творче керування та голоси персонажів. Flash-Lite TTS призначена для високопродуктивного й економного виробництва. Обидві моделі дають змогу розробникам керувати подачею рядок за рядком за допомогою природної мови.

Чи можна їх розгорнути? Так, обидві моделі вже впроваджуються через Gemini API і Google AI Studio. Доступ надається лише через API, відкритих ваг для самостійного хостингу немає. Доступ до API для підприємств через Gemini Enterprise має з’явитися незабаром.

Що випустила Google

Реліз розділяє TTS на 2 рівні зі спільними засобами керування:

  • Gemini 3.8 Flash TTS створена для глибокого творчого керування та дизайну персонажів. Серед цільових сфер застосування — ігри, захопливі аудіокниги, подкасти та інтерактивні медіа. Вона забезпечує детальний контроль над акторськими вказівками, темпом, змінами діалекту та репліками активного слухання.
  • Gemini 3.8 Flash-Lite TTS створена для високопродуктивного й економного масштабування. Google позиціонує її для дубляжу, створення аудіоконтенту та виразних голосових агентів. Вона забезпечує точний контроль над тоном, темпом і виразними нюансами.

У AI Studio посилання на майданчик використовують ідентифікатори моделей gemini-3.8-flash-tts і gemini-3.8-flash-lite-tts.

Дизайн голосу за текстовим запитом

Попередні моделі Gemini TTS пропонували 30 оригінальних голосів. Реліз 3.8 переходить до значно масштабнішої голосової системи.

  • Генеративний дизайн голосу: Flash TTS створює нові голоси із запитів, що описують роль, акцент і характеристики голосу. Це працює більш ніж зі 100 мовами та діалектами. Серед демонстрацій Google — діджей із Мельбурна, монотонний робот і японський дракон.
  • Бібліотека голосів: Розробники отримують понад 2 000 готових до використання голосів. Серед доступних варіантів — регіональні різновиди, як-от мексиканська іспанська, квебекська французька та шотландська англійська.
  • Збереження та масштабування: Користувацькі голоси можна зберігати й повторно використовувати, зберігаючи мінімальні відмінності між проєктами.
  • Реміксинг голосів (незабаром): Користувачі зможуть змінювати тембр, висоту, темп і акцент голосу з бібліотеки за допомогою запитів.

Керування виконанням

Обидві моделі приймають сценічні вказівки, записані в сценарії. Gemini також може керувати подачею на основі природних підказок у сценарії.

  • Генерація довгих форм: Якість голосу, темп і тембр зберігаються протягом кількох годин безперервного аудіо.
  • Вбудована постановка для 2 співрозмовників: Один сценарій керує багатотуровою розмовою з різними, розділеними голосами.
  • Вокальні вставки: Невербальні підказки, як-от <laughs>, <sigh> і <gasp>, додають розмові природності.
  • Репліки активного слухання: Вставки на кшталт |mhm| і |yeah| керують реакціями та комедійним таймінгом.

Відтворення голосу та засоби безпеки

Відтворення голосу формує узгоджений вокальний профіль із 30-секундного аудіозразка. Зразок має бути вашим голосом або голосом, на використання якого ви маєте права. Для відтворення потрібен запис усної згоди власника голосу, зіставлений із голосом еталонного мовця.

Кожен аудіофрагмент, створений моделями Gemini Audio, містить водяний знак SynthID. Ця непомітна позначка безпосередньо вбудовується у вихідний аудіозапис. Відтворені голоси також містять облікові дані контенту C2PA. Google посилається на картку моделі Gemini 3.8 Audio, де описано ширший підхід до безпеки.

Результати тестування

Google повідомляє такі результати для нових моделей:

  • Тест Voice Design Benchmark від Hume AI: Flash TTS посідає 1-ше місце в загальному рейтингу з результатом 71,4, за даними Hume AI.
  • Моделювання акцентів: Flash TTS лідирує з результатом 60,8.
  • Індекс загальної якості Hume AI: Flash TTS посідає 1-ше місце, а Flash-Lite TTS — 2-ге.
  • Сліпе оцінювання Voice Arena: Обидві моделі посідають найвищі позиції в японській, бразильській португальській, в’єтнамській, сучасній стандартній арабській, мексиканській іспанській та гінді.

Основні висновки

  • Google запустила Gemini 3.8 Flash TTS для творчої роботи, а Flash-Lite TTS — для масштабування.
  • Flash TTS створює нові голоси за запитами більш ніж 100 мовами та діалектами.
  • Розробники отримують понад 2 000 готових до використання голосів замість початкових 30.
  • Для відтворення голосу потрібні 30-секундний зразок і відповідний запис згоди.
  • Flash TTS посідає 1-ше місце в Voice Design Benchmark від Hume AI з результатом 71,4.

Поширені запитання

  1. Що таке Gemini 3.8 Flash TTS? Це модель Google для перетворення тексту на мовлення, призначена для творчого дизайну голосу та керування виконанням рядок за рядком. Вона доступна через Gemini API і Google AI Studio.
  2. Чим відрізняється Flash-Lite TTS? Flash-Lite TTS оптимізована для високопродуктивних і економних завдань, як-от дубляж і голосові агенти. Вона посідає 2-ге місце в індексі загальної якості Hume AI.
  3. Чи можу я клонувати власний голос? Так, за допомогою 30-секундного зразка та запису усної згоди. У кількох регіонах, зокрема у Великій Британії, ЄЕЗ та Індії, ця функція недоступна в AI Studio.

Ознайомтеся з технічним блогом. Усі заслуги належать досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту 150k+ ML та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібна співпраця з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини