SpaceXAI випустила Grok Voice Transcribe 2.0: API перетворення мовлення на текст із заявленою вдвічі вищою точністю, ніж у 1.0, за $0,10 на годину
SpaceXAI випустила Grok Voice Transcribe 2.0, свою найновішу модель перетворення мовлення на текст (STT). Команда розробників стверджує, що за тієї самої ціни вона вдвічі точніша за Grok Voice Transcribe 1.0. Модель призначена для роботи зі складним аудіо: зашумленими телефонними лініями, голосами, що перекриваються, місцевими акцентами та продиктованими обліковими даними. Вона працює у пакетному режимі та режимі потокової обробки в реальному часі через Speech to Text API.
Чи можна її розгорнути? Так, як розміщений API. Вона вже доступна під ідентифікатором моделі grok-voice-transcribe-2.0. SpaceXAI не оголошувала про відкриття ваг моделі, тож самостійне розміщення неможливе.
Що таке Grok Voice Transcribe 2.0?
Grok Voice Transcribe 2.0 побудована на базовій аудіомоделі, що лежить в основі Grok Voice. Команда SpaceXAI стверджує, що Grok Voice уже обробляє десятки тисяч дзвінків до служб підтримки щодня. Вона також транскрибує мільйони годин відеооповіді та запускає асистента Grok в автомобілях Tesla.
Навчальні дані — це живе, зашумлене багатомовне аудіо, записане в різноманітних середовищах. Потім SpaceXAI вдосконалила модель за допомогою додаткового навчання.
Бенчмарки: що повідомляє SpaceXAI
SpaceXAI повідомляє про перше місце за точністю серед 32 потокових моделей у публічному рейтингу Artificial Analysis. Цей бенчмарк, AA-WER Streaming, використовує близько 8 годин аудіо. Він надає AA-AgentTalk вагу 50%, VoxPopuli — 25%, а Earnings22 — 25%. Докладніше дивіться в методології.
SpaceXAI також вимірює частоту помилок у словах (WER) на 4 внутрішніх наборах, сформованих із виробничого трафіку:
- Телефонія (8 кГц): дзвінки англійською мовою до служб підтримки
- Розмови: розмови англійською мовою з Grok
- Облікові дані: номери телефонів, електронні адреси та адреси англійською мовою
- Короткі фрази: висловлювання для голосових асистентів 19 мовами
Версія 2.0 покращує результати версії 1.0 на всіх 4 наборах. Щодо телефонії SpaceXAI заявляє, що модель випереджає всі протестовані компанією моделі. Ці внутрішні результати надані постачальником і не були незалежно відтворені.
Багатомовна транскрипція та перемикання мов
Модель транскрибує десятки мов і автоматично визначає мову. Вона також обробляє перемикання мов посеред запису за один прохід. Команда SpaceXAI називає точність у багатомовній обробці найбільшим покращенням порівняно з версією 1.0.
Короткі фрази, наприклад команди в автомобілі, дають моделі мало контексту для визначення мови. У цьому наборі WER знижується з 20,6% до 6,8%. Це означає приблизно на 67% менше помилок у словах.
Документація містить перелік 25 мов для форматування чисел, валют і одиниць у письмовій формі.
Ключові функції для розробників
Усі наведені нижче функції доступні в одному API:
- Пакетна та потокова обробка: транскрибуйте файли й URL-адреси або передавайте аудіо потоково через WebSocket за адресою
wss://api.x.ai/v1/stt - Мітки часу на рівні слів: час початку й завершення, а також оцінки впевненості для кожного слова
- Діаризація мовців: мітки мовців без додаткової оплати
- Багатоканальна транскрипція: до 8 каналів, транскрибованих незалежно
- Пріоритезація ключових термінів: до 100 термінів предметної області на запит, кожен довжиною до 50 символів
- Форматування тексту: числа, дати, валюти, номери телефонів та електронні адреси повертаються у письмовій формі
- Видалення слів-паразитів: “ем” і “е” видаляються за замовчуванням
- Інтелектуальне визначення завершення репліки: ML-модель прогнозує завершення репліки для голосових агентів
Пакетна кінцева точка приймає файли обсягом до 500 МБ у 12 аудіоформатах. Потокова обробка також підтримує Opus зі швидкістю приблизно 4 КБ/с, порівняно з 48 КБ/с для необробленого PCM із частотою 24 кГц.
Ціни
Ціни ідентичні цінам версії 1.0. Пакетна транскрипція коштує $0,10 за годину аудіо. Потокова обробка коштує $0,20 за годину. Діаризація, мітки часу та ключові терміни включені у вартість. Це приблизно $1,67 і $3,33 за 1 000 хвилин відповідно.
Як це викликати
curl -X POST https://api.x.ai/v1/stt \
-H "Authorization: Bearer $XAI_API_KEY" \
-F model=grok-voice-transcribe-2.0 \
-F format=true \
-F language=en \
-F file=@audio.mp3Atlassian Loom впроваджує Grok Voice Transcribe 2.0
Atlassian Loom тепер використовує Grok Voice Transcribe 2.0 для транскрибування кожного відео. В Atlassian виявили, що вона точніша за їхнє наявне рішення.
Описаний SpaceXAI робочий процес такий: запис, транскрипція, потім код. Користувач записує план дій у Loom. Транскрипт передається в Cursor, який вносить зміни до коду. Sanchan Saxena, старший віцепрезидент Teamwork Collection в Atlassian, назвав це «замиканням циклу від контексту до коду».
Ключові висновки
- Grok Voice Transcribe 2.0 заявляє про вдвічі вищу точність, ніж версія 1.0, за незмінної ціни.
- Пакетна обробка коштує $0,10 за годину аудіо, а потокова — $0,20.
- SpaceXAI повідомляє про перше місце серед 32 потокових моделей у рейтингу Artificial Analysis.
- WER для коротких фраз 19 мовами знизився з 20,6% до 6,8%.
- Модель доступна лише через API, тому наразі явно вказуйте
model=grok-voice-transcribe-2.0.
Ознайомтеся з технічними деталями та документацією API. Уся подяка досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання зі 150 тис.+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.