SpaceXAI пусна Grok Voice Transcribe 2.0: API за преобразуване на реч в текст с 2 пъти по-висока точност от 1.0 при $0,10 на час
SpaceXAI пусна Grok Voice Transcribe 2.0, най-новия си модел за преобразуване на реч в текст (STT). Екипът по разработката твърди, че той е два пъти по-точен от Grok Voice Transcribe 1.0 при същата цена. Моделът е предназначен за сложни аудиозаписи: шумни телефонни линии, едновременно говорещи хора, местни акценти и продиктувани идентификационни данни. Работи в пакетен режим и в режим на поточно предаване в реално време чрез Speech to Text API.
Може ли да бъде внедрен? Да, като хостван API. Той е достъпен още днес под идентификатора на модела grok-voice-transcribe-2.0. SpaceXAI не е обявила отворени тегла, така че самостоятелното хостване не е възможно.
Какво представлява Grok Voice Transcribe 2.0?
Grok Voice Transcribe 2.0 е изграден върху базовия аудио модел зад Grok Voice. Екипът на SpaceXAI посочва, че Grok Voice вече обработва десетки хиляди обаждания към центрове за обслужване на клиенти дневно. Той също така транскрибира милиони часове видеоразказ и управлява асистента Grok в автомобилите Tesla.
Обучаващите данни представляват реални, шумни, многоезични аудиозаписи, направени в разнообразни среди. След това SpaceXAI е усъвършенствала модела чрез допълнително обучение.
Бенчмаркове: какво отчита SpaceXAI
SpaceXAI отчита първо място по точност сред 32 поточни модела в публичната класация на Artificial Analysis. Този бенчмарк, AA-WER Streaming, използва около 8 часа аудио. Той приписва тежест 50% на AA-AgentTalk, 25% на VoxPopuli и 25% на Earnings22. Вижте методологията за подробности.
SpaceXAI измерва и процента грешки при думите (WER) в 4 вътрешни набора, съставени от производствен трафик:
- Телефония (8 kHz): разговори с клиенти на английски език
- Разговори: разговори на английски език с Grok
- Идентификационни данни: телефонни номера, имейли и адреси на английски език
- Кратки фрази: команди към гласови асистенти на 19 езика
Версия 2.0 показва подобрение спрямо 1.0 и в четирите набора. При телефония SpaceXAI заявява, че изпреварва всеки модел, тестван от компанията. Тези вътрешни резултати са предоставени от доставчика и не са независимо възпроизведени.
Многоезична транскрипция и превключване на езика
Моделът транскрибира десетки езици и автоматично разпознава езика. Той също така проследява превключванията между езиците по време на записа в един-единствен проход. Екипът на SpaceXAI определя многоезичната точност като най-голямото подобрение спрямо 1.0.
Кратките фрази, като например командите в автомобила, дават на модела малко контекст за идентифициране на езика. В този набор WER спада от 20,6% на 6,8%. Това означава приблизително 67% по-малко грешки при думите.
Документацията посочва 25 езика за форматиране в писмен вид на числа, валути и мерни единици.
Основни функции за разработчици
Всички функции по-долу са достъпни в един и същ API:
- Пакетна обработка и поточно предаване: транскрибирайте файлове и URL адреси или предавайте аудио чрез WebSocket на адрес
wss://api.x.ai/v1/stt - Времеви маркери на ниво дума: начални и крайни моменти, както и оценки за увереност за всяка дума
- Диаризация на говорещите: етикети на говорещите без допълнително заплащане
- Многоканална транскрипция: до 8 канала, транскрибирани независимо
- Приоритизиране на ключови термини: до 100 термина от конкретна област на заявка, всеки с дължина до 50 знака
- Форматиране на текста: числата, датите, валутите, телефонните номера и имейлите се връщат в писмен вид
- Премахване на паразитни думи: „ъм“ и „ъ-ъ“ се премахват по подразбиране
- Интелигентно разпознаване на края на репликата: ML модел предвижда края на репликата за гласови агенти
Крайният пункт за пакетна обработка приема файлове с размер до 500 MB в 12 аудиоформата. Поточното предаване приема и Opus с приблизително 4 KB/s в сравнение с 48 KB/s за необработен PCM при 24 kHz.
Ценообразуване
Цените са идентични с тези на версия 1.0. Пакетната транскрипция струва $0.10 на час аудио. Поточното предаване струва $0.20 на час. Диаризацията, времевите маркери и ключовите термини са включени. Това се равнява приблизително на $1.67 и $3.33 на 1000 минути.
Как се извиква
curl -X POST https://api.x.ai/v1/stt \
-H "Authorization: Bearer $XAI_API_KEY" \
-F model=grok-voice-transcribe-2.0 \
-F format=true \
-F language=en \
-F file=@audio.mp3Atlassian Loom внедрява Grok Voice Transcribe 2.0
Atlassian Loom вече използва Grok Voice Transcribe 2.0 за транскрибиране на всяко видео. Atlassian е установила, че той е по-точен от съществуващото ѝ решение.
Работният процес, описан от SpaceXAI, е записване, транскрибиране, след което кодиране. Потребителят записва план за действие в Loom. Транскрипцията се подава към Cursor, който извършва актуализациите на кода. Sanchan Saxena, старши вицепрезидент на Teamwork Collection в Atlassian, го описва като „затваряне на цикъла от контекста до кода“.
Основни изводи
- Grok Voice Transcribe 2.0 твърди, че е два пъти по-точен от 1.0 при непроменени цени.
- Пакетната обработка струва $0.10 на час аудио, а поточното предаване — $0.20.
- SpaceXAI отчита първо място сред 32 поточни модела в Artificial Analysis.
- WER за кратки фрази на 19 езика е спаднал от 20,6% на 6,8%.
- Той е достъпен само чрез API, затова засега изрично задайте
model=grok-voice-transcribe-2.0.
Разгледайте техническите подробности и документацията на API. Цялата заслуга е за изследователя на този проект. Също така, можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия 150k+ ML SubReddit и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.
Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ представяне на продукт ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.