Sakhanda Wire
NVDA $216.85 -0.33% MSFT $481.15 -0.47% GOOGL $340.67 -1.17% META $545.83 -0.04% AMZN $260.11 -2.16%
← К новостям

Представляем S1-mini: 462-МБ нормализатор текста с открытыми весами от Superwhisper, превращающий необработанные транскрипции ASR в чистый письменный текст

Superwhisper выпустила семейство моделей S1: S1-Voice, S1-Language и S1-mini. S1-Voice — облачная модель преобразования речи в текст, а S1-Language — облачная модель, следующая инструкциям, для очистки и форматирования. Наибольший интерес за пределами приложения представляет S1-mini, выпущенная с открытыми весами на Hugging Face. S1-mini — это нормализатор текста с 0,6 млрд параметров, а не транскрибатор и не чат-модель. Она работает после автоматического распознавания речи и переписывает необработанные транскрипции в чистый письменный текст: удаляет слова-паразиты, устраняет самокоррекции, сохраняя итоговый вариант, расставляет знаки препинания и прописные буквы, а также преобразует произнесённые числа, даты, денежные суммы и адреса электронной почты в письменную форму. Модель дообучена на основе Qwen/Qwen3-0.6B, в версии 1 поддерживает только английский язык и полностью управляется строкой управления из трёх осей, размещённой перед транскрипцией. По данным Superwhisper, точность по токенам на отложенной выборке из 7519 случаев составляет 94,8%; измерение проводилось жадным декодированием на квантованной сборке.

Можно ли её развернуть?

Да, но только S1-mini. S1-mini опубликована на Hugging Face по лицензии Apache 2.0 с дополнительным пунктом об именовании. S1-Voice и S1-Language — сервисы, размещённые Superwhisper, поэтому их можно использовать, но нельзя размещать самостоятельно.

  • Уровень компании: Любой. Сборка GGUF Q4_K_M представляет собой файл размером 462 МБ, который работает на процессоре ноутбука. Независимые разработчики могут встроить её в настольное приложение. Компании могут запускать её за VPC, где аудиотранскрипции не покидают сеть.
  • Отрасли: Здравоохранение и клиническая документация, юриспруденция, финансовые услуги, клиентская поддержка, инструменты для разработчиков, доступность и субтитры в реальном времени.
  • Применения: Приложения для диктовки, инструменты для создания заметок по встречам, субтитры в реальном времени, редакторы с голосовым управлением, ввод данных в CRM с помощью голоса и любые конвейеры, преобразующие необработанный результат ASR в текст, который будет читать человек.

Что делает S1-mini

S1-mini — это нормализатор текста, а не транскрибатор и не чат-модель. Она работает после автоматического распознавания речи:

аудио → ASR (Whisper, Parakeet, …) → S1-mini → чистый текст

Она удаляет слова-паразиты, устраняет ложные начала и самокоррекции, сохраняя итоговый вариант, расставляет знаки препинания и прописные буквы, а также преобразует произнесённые числа, даты, время, денежные суммы и адреса электронной почты в письменную форму. Произнесите «support at superwhisper dot com» — и получите support@superwhisper.com.

Модель дообучена на основе Qwen/Qwen3-0.6B. Она содержит 596 млн уникальных параметров (0,44 млрд без параметров эмбеддингов), 28 слоёв, 16 головок запросов и 8 головок ключей/значений с GQA, а также веса BF16. На боковой панели Hub указано 0,8 млрд параметров, поскольку связанные эмбеддинги хранятся дважды; в описании карточки это расхождение объясняется напрямую. Версия 1 поддерживает только английский язык, а рекомендуемый объём входных данных составляет примерно 1000 токенов.

Строка управления — это весь интерфейс

S1-mini получает фиксированный системный запрос, затем строку управления и после неё необработанную транскрипцию:

Копировать кодСкопированоИспользовать другой браузер
[Styling: <value>] [Structure: <value>] [Context: <value>]
<raw transcript>

Styling принимает значения casual, semi-casual, semi-formal или formal. Structure принимает значения prose или lists. Context принимает значения general или email. Все три оси независимы, и модель обучалась на каждой комбинации. При передаче значений за пределами этих наборов или изменении формулировки системного запроса качество вывода может ухудшиться или результат может оказаться искажённым. Стоит отметить небольшое несоответствие: в приложении Superwhisper используется ползунок тона с пятью позициями, который добавляет пресет «balanced», тогда как в документации открытых весов указаны четыре обученных значения для Styling.

Модель также имеет предусмотренные ограничения. Она не добавляет контент, которого вы не произносили, не исправляет факты, не смягчает нецензурную лексику и не переписывает диалект. Если вход содержит только слова-паразиты, модель возвращает пустую строку; интеграции должны считать это допустимым результатом.

Две настройки, которые нарушают работу большинства интеграций

Во-первых, требуется enable_thinking=False. Шаблон чата — это неизменённый шаблон Qwen3, а в Qwen3 по умолчанию включён режим рассуждений. S1-mini обучалась с выключенным режимом рассуждений, поэтому ответ ассистента должен начинаться с пустого блока <think>. Если не указать этот флаг, обычно вообще не удаётся получить пригодный результат.

Во-вторых, используйте жадное декодирование. В файле generation_config.json указано do_sample: false. В сборках GGUF по-прежнему присутствуют унаследованные от Qwen3 метаданные temp = 0.6, top_p = 0.95 и top_k = 20, поэтому явно передавайте температуру 0 в каждом запросе. В llama.cpp используйте --jinja вместе с --chat-template-kwargs '{"enable_thinking":false}', а не --reasoning-budget 0, поскольку последний вариант ухудшает результат.

Заявленные результаты оценки

Superwhisper оценила S1-mini на отложенной выборке из 7519 случаев по 104 транскрипциям. Точность по токенам составляет 94,8%; измерение проводилось жадным декодированием на сборке Q4_K_M, а показатель ошибок редактирования текста составил 11,6%. В тексте, оформленном как электронное письмо, модель распознаёт строку приветствия в 99,3% случаев, а заключительную формулу — в 97,9%. Она правильно определяет структуру вывода — список или абзац — в 97,6% случаев и создаёт точные адреса электронной почты в 92% случаев. Менее чем в 1% генераций наблюдаются зацикливание или обрезание, а в случаях, когда ничего транскрибировать не следует, модель корректно удерживается от вывода в 98,6% случаев. Это показатели, заявленные поставщиком на внутреннем тестовом наборе, а не результаты сторонней оценки.

Две облачные модели

S1-Voice — размещённая модель преобразования речи в текст. Superwhisper сообщает о транскрибировании со скоростью до 46 раз выше скорости речи; большинство диктовок длительностью менее 30 секунд появляется через 0,32 секунды после окончания речи. На восьми наборах данных, включая записи встреч и звонков по публикации финансовых результатов, средняя частота ошибок слов составляет 6,8%, а на LibriSpeech снижается до 2,2%. Superwhisper утверждает, что средний показатель 6,8% был лучшим среди 15 протестированных моделей, а S1-Voice получила 83 балла из 100 по сводной метрике против 76 баллов у WisprFlow.

S1-Language — размещённая модель, следующая инструкциям, для очистки, форматирования и суммирования; она отображается в списке выбора моделей наряду с моделями Anthropic, OpenAI и Groq. Рекомендуемые настройки по умолчанию: Cohere Transcribe вместе с S1-mini в автономном режиме либо S1-Voice вместе с S1-Language в облаке.

Интерактивное объяснение

Встроенный ниже инструмент позволяет переключать каждую ось строки управления и наблюдать за изменением вывода. Каждая пара входных и выходных данных дословно взята из карточки модели.

Основные выводы

  • S1-mini — нормализатор текста с открытыми весами и 0,6 млрд параметров для результатов ASR, а не транскрибатор и не чат-модель.
  • GGUF Q4_K_M имеет размер 462 МБ и работает на процессоре ноутбука, поэтому развёртывание на устройстве вполне реально.
  • Единственный механизм управления — фиксированный системный запрос и строка управления из трёх осей.
  • enable_thinking=False и температура 0 обязательны; большинство ошибок интеграции связано именно с ними.

Ознакомьтесь с весами модели и техническими подробностями. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему субреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Постойте! Вы пользуетесь Telegram? теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости