ШІ-генератор музики Suno тепер створює мовлення
Нова функція Speech створює синтетичні озвучення, доповнені фоновою музикою, згенерованою ШІ.
Нова функція Speech створює синтетичні озвучення, доповнені фоновою музикою, згенерованою ШІ.
Якщо ви купуєте щось за посиланням, The Verge може отримати комісію. Ознайомтеся з нашою етичною заявою.
Suno виходить за межі світу музики, створеної ШІ, запустивши нову функцію, яка генерує голоси на основі сценаріїв або описів у запитах. Speech уже доступна у відкритій бета-версії на вебплатформі та мобільних платформах Suno й дає змогу одночасно генерувати озвучення та фонову музику для них.
«Музика завжди буде в центрі Suno та того, що ми створюємо. Водночас наше бачення завжди поширювалося й на інші форми людського самовираження», — сказав у анонсі директор із продукту Suno Джек Броді. «Сьогодні ми розширюємо можливості Suno за допомогою Speech — першої аудіомоделі, яка генерує голос і музику разом як єдину цілісну композицію».
Мовлення, згенероване ШІ, аж ніяк не новинка — DeepMind уже десятиліття експериментує із синтезом мовлення на основі глибинного навчання, Adobe має інструмент перетворення тексту на мовлення, а ElevenLabs після запуску у 2023 році стала однією з найвідоміших платформ у цій сфері. Suno лише долучається до перегонів — імовірно, намагаючись диверсифікувати платформу, зважаючи на те, що її генератор музики привернув так багато позовів.
Поєднання музики, створеної ШІ, із згенерованими голосами — це варіація Suno на тему інструментів перетворення тексту на мовлення. Функція необов’язкова: якщо вам потрібне лише чисте мовлення, фонову музику можна легко вимкнути перемикачем. Однак задум полягає в тому, щоб доповнити певні сценарії використання генеративного усного мовлення — наприклад, створити заспокійливий саундтрек для віршів або щось більш енергійне для драматичних озвучень та мотивувальних промов.
Щоб скористатися функцією, виберіть вкладку «Create» і перейдіть до опції Speech. Доступні два режими: Simple, який дає змогу описати бажаний результат у спеціальному полі запиту (наприклад, «капітан-пірат, який підбадьорює свою команду»), і Advanced, де можна додати власний сценарій, якщо ви вже точно знаєте, що має бути сказано. Розширені налаштування також дають змогу змінити стать голосу ШІ, стиль мовлення та рівень різноманітності під час кожної генерації голосу. Максимальна тривалість мовлення становить приблизно вісім хвилин.
Suno визнає, що функція ще далека від досконалості, але обіцяє й надалі вдосконалювати Speech на основі відгуків користувачів. «Бета-версія справді означає бета-версію, — сказав Броді. — Іноді британські акценти можуть ненадовго перемандрувати до Австралії й назад. Драматичні паузи можуть бути дуже драматичними. Ви майже напевно знайдете цій функції застосування, яке нам навіть не спадало на думку».
- Джесс Везербед
Найпопулярніше
- Amazon випускає нові барвисті Kindle — і чохол із фізичними кнопками перегортання сторінок
- Жителі Юти проти Кевіна О’Лірі
- Відповідь HP на MacBook Neo тонша, легша й оснащена OLED-дисплеєм
- Усередині масштабного переосмислення Copilot від Microsoft
- Gears of War: E-Day — чудова гра, що виходить у жахливий час
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.
