Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

Gradium AI пуска нов TTS модел по подразбиране: 81,0% успеваемост при трудни случаи и 216 мс до първия звук

Гласовите агенти се провалят точно при частите от разговора, които са най-важни: номера на поръчката, цифрите за обратното обаждане, имейл адреса, който обаждащият се трябва да запише. Gradium AI пусна нов модел за преобразуване на текст в реч и го направи модел по подразбиране в своя API и Studio. Компанията отчита 81,0% оценена от хора успеваемост върху набор от 500 трудни изречения на пет езика, пред 75,1% за Cartesia Sonic 3.6 и 65,4% за ElevenLabs v3 Conversational. Времето до първия звук е 216 ms при P50 в Coval — със 170 ms по-бързо от модела, който заменя.

Може ли да бъде внедрен?

Да, още днес, без миграция. Gradium активира модела като модел по подразбиране в своя API и Studio на 31 август 2026 г. Съществуващите гласове, включително персонализираните клонинги, продължават да работят без промени.

Показателят за точност

Gradium създаде набор за оценка от 500 изречения и го публикува с отворен код в Hugging Face по лиценз CC BY 4.0: 100 елемента по 10 критерия на пет езика (EN, DE, FR, ES, PT). Седем атомарни критерия обхващат правопис, акроними, буквено-цифрови токени, дати, обикновени числа, големи и десетични числа и имейли. Три съставни критерия (Поръчки, IT билет, Искове) комбинират няколко от тях в един реалистичен ход на агента.

Оценяването се извършва от хора и е стриктно. Изречението се приема само ако независим оценител, който е носител на съответния език, чуе всеки елемент произнесен правилно и изцяло; една пропусната цифра е достатъчна за провал на изречението. Аудиото е нормализирано по сила на звука, редът е разбъркан, а оценителите са ограничени до 40 сравнения с наложена почивка.

Обобщено за десетте критерия и осреднено за петте езика с еднаква тежест: Gradium TTS 81,0%, Cartesia Sonic 3.6 75,1%, ElevenLabs v3 Conversational 65,4%, Fish Audio S2.1 Pro 49,5%, Inworld TTS 1.5 Max 46,5%. Всички са генерирани през август 2026 г. с настройки по подразбиране.

Показателят за латентност

Според TTS бенчмарка на Coval Gradium отчита 216 ms P50 време до първия звук — със 170 ms по-бързо от модела, който заменя. По-полезният показател е диапазонът: интерквартилен диапазон p75-p25 от 30 ms при 480 изпълнения, най-тесният сред петте тествани модела. Cartesia Sonic 3.6 е с медиана от 454 ms и диапазон от 165 ms — 36% от собствената му медиана, а обаждащите се усещат опашните стойности, а не медианите.

Gradium не е най-бързият модел в тази диаграма. Inworld TTS 2 отчита медиана от 166 ms; Fish Audio S2.1 Pro (291 ms) и ElevenLabs v3 Conversational (329 ms) изостават от Gradium. Твърдението е свързано с комбинираната позиция: най-нисък процент грешки при трудни случаи, първи звук под 250 ms и много малка вариация.

Първи стъпки

Съществуващите потребители не трябва да правят нищо. Новите екипи инсталират Python SDK, насочват се към TTS крайна точка през WebSocket и използват повторно съществуващите идентификатори на гласове. Gradium предлага 1 млн. кредита за пълни доклади за грешки при трудни случаи в своя Discord.

Основни изводи

  • Новият модел Gradium TTS е активен и е моделът по подразбиране от 31 август 2026 г.; не е необходима миграция.
  • 81,0% успеваемост, оценена от хора, върху 500 трудни изречения — пред Cartesia, ElevenLabs, Fish Audio и Inworld.
  • 216 ms P50 време до първия звук в Coval, с интерквартилен диапазон от 30 ms при 480 изпълнения.
  • Чете телефонни номера, имейли, IBAN-и и референтни кодове без необходимост от нормализиране на текста.
  • Бенчмарк, проведен от доставчика, но наборът за оценка от 500 изречения е отворен в Hugging Face по лиценз CC BY 4.0.

Разгледайте публикацията за пускането и набора от данни. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? сега можете да се присъедините към нас и в Telegram.

Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ представяне на продукт ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини