Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

SpaceXAI выпустила Grok Voice Transcribe 2.0: API преобразования речи в текст с заявленной вдвое большей точностью, чем у 1.0, за $0,10 в час

SpaceXAI выпустила Grok Voice Transcribe 2.0 — свою новейшую модель преобразования речи в текст (STT). Команда разработчиков утверждает, что при той же цене она вдвое точнее Grok Voice Transcribe 1.0. Модель предназначена для работы со сложными аудиозаписями: зашумлёнными телефонными линиями, перекрывающимися голосами, местными акцентами и устными учётными данными. Она работает в пакетном режиме и режиме потоковой передачи в реальном времени через API преобразования речи в текст.

Можно ли её развернуть? Да, в качестве размещённого API. Она уже доступна под идентификатором модели grok-voice-transcribe-2.0. SpaceXAI не объявляла об открытых весах, поэтому самостоятельный хостинг невозможен.

Что такое Grok Voice Transcribe 2.0?

Grok Voice Transcribe 2.0 построена на базовой аудиомодели, лежащей в основе Grok Voice. Команда SpaceXAI утверждает, что Grok Voice уже обрабатывает десятки тысяч звонков в службу поддержки в день. Кроме того, модель расшифровывает миллионы часов видеоповествования и запускает ассистента Grok в автомобилях Tesla.

Данные для обучения — это живые, зашумлённые многоязычные аудиозаписи, сделанные в различных условиях. Затем SpaceXAI доработала модель с помощью постобучения.

Тесты: что сообщает SpaceXAI

SpaceXAI сообщает о первом месте по точности среди 32 потоковых моделей в общедоступном рейтинге Artificial Analysis. Этот тест, AA-WER Streaming, использует около 8 часов аудио. В нём AA-AgentTalk получает вес 50%, VoxPopuli — 25%, а Earnings22 — 25%. Подробности см. в разделе методологии.

SpaceXAI также измеряет долю ошибок в словах (WER) на 4 внутренних наборах, сформированных на основе производственного трафика:

  • Телефония (8 кГц): звонки в службу поддержки на английском языке
  • Разговорная речь: разговоры на английском языке с Grok
  • Учётные данные: номера телефонов, адреса электронной почты и почтовые адреса на английском языке
  • Короткие фразы: высказывания для голосовых ассистентов на 19 языках

Версия 2.0 превосходит версию 1.0 на всех 4 наборах. В телефонных разговорах SpaceXAI утверждает, что модель опережает все протестированные компанией модели. Эти внутренние результаты предоставлены поставщиком и не были независимо воспроизведены.

Многоязычная расшифровка и переключение языков

Модель расшифровывает десятки языков и автоматически определяет язык. Она также отслеживает переключение языков в середине записи за один проход. Команда SpaceXAI называет точность при работе с несколькими языками крупнейшим улучшением по сравнению с версией 1.0.

Короткие фразы, например команды в автомобиле, дают модели мало контекста для определения языка. В этом наборе WER снижается с 20,6% до 6,8%. Это означает примерно на 67% меньше ошибок в словах.

В документации перечислены 25 языков, для которых поддерживается форматирование чисел, валют и единиц измерения в письменной форме.

Ключевые возможности для разработчиков

Все перечисленные ниже возможности доступны в одном и том же API:

  • Пакетная обработка и потоковая передача: расшифровка файлов и URL либо передача аудио по WebSocket через wss://api.x.ai/v1/stt
  • Временные метки на уровне слов: время начала и окончания, а также показатели уверенности для каждого слова
  • Диаризация говорящих: метки говорящих без дополнительной платы
  • Расшифровка многоканального аудио: до 8 каналов с независимой расшифровкой
  • Приоритизация ключевых терминов: до 100 предметных терминов на запрос, каждый длиной до 50 символов
  • Форматирование текста: числа, даты, валюты, номера телефонов и адреса электронной почты возвращаются в письменной форме
  • Удаление слов-паразитов: «эм» и «э-э» удаляются по умолчанию
  • Интеллектуальное определение реплик: ML-модель прогнозирует окончание реплики для голосовых агентов

Пакетная конечная точка принимает файлы размером до 500 МБ в 12 аудиоформатах. Потоковая передача также поддерживает Opus со скоростью примерно 4 КБ/с по сравнению с 48 КБ/с для необработанного PCM при частоте 24 кГц.

Стоимость

Стоимость идентична версии 1.0. Пакетная расшифровка стоит $0,10 за час аудио. Потоковая передача стоит $0,20 за час. Диаризация, временные метки и ключевые термины включены в стоимость. Это соответствует примерно $1,67 и $3,33 за 1000 минут.

Как вызвать модель

Копировать кодСкопированоИспользуйте другой браузер
curl -X POST https://api.x.ai/v1/stt \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -F model=grok-voice-transcribe-2.0 \
  -F format=true \
  -F language=en \
  -F file=@audio.mp3

Atlassian Loom внедряет Grok Voice Transcribe 2.0

Atlassian Loom теперь использует Grok Voice Transcribe 2.0 для расшифровки каждого видео. В Atlassian обнаружили, что она точнее используемого ранее решения.

Описанный SpaceXAI рабочий процесс выглядит так: запись, расшифровка, затем написание кода. Пользователь записывает план действий в Loom. Транскрипция передаётся в Cursor, который вносит изменения в код. Санчан Саксена, старший вице-президент направления Teamwork Collection в Atlassian, описал это как «замыкание цикла от контекста к коду».

Главные выводы

  • Grok Voice Transcribe 2.0 заявляет о двукратном повышении точности по сравнению с версией 1.0 при неизменной цене.
  • Пакетная обработка стоит $0,10 за час аудио, а потоковая передача — $0,20.
  • SpaceXAI сообщает о первом месте среди 32 потоковых моделей в рейтинге Artificial Analysis.
  • WER для коротких фраз на 19 языках снизился с 20,6% до 6,8%.
  • Модель доступна только через API, поэтому пока явно указывайте model=grok-voice-transcribe-2.0.

Ознакомьтесь с техническими подробностями и документацией API. Все заслуги принадлежат исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с аудиторией более 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? Теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости