Sakhanda Wire
NVDA $216.85 -0.33% MSFT $481.15 -0.47% GOOGL $340.67 -1.17% META $545.83 -0.04% AMZN $260.11 -2.16%
← Към новините

Представяме S1-mini: 462 MB нормализатор на текст с отворени тегла от Superwhisper, който превръща суровите ASR транскрипции в чист писмен текст

Superwhisper пусна семейството модели S1: S1-Voice, S1-Language и S1-mini. S1-Voice е облачен модел за преобразуване на реч в текст, а S1-Language е облачен модел за следване на инструкции, предназначен за почистване и форматиране. Моделът, който е доста интересен извън приложението, е S1-mini, публикуван с отворени тегла в Hugging Face. S1-mini е текстов нормализатор с 0.6B параметъра, а не транскрибиращ или чат модел. Той се използва след автоматичното разпознаване на реч и пренаписва необработените транскрипции като чист писмен текст: премахва паразитните думи, разрешава самокорекциите, като запазва последния вариант, избран от говорещия, добавя пунктуация и главни букви и преобразува изговорените числа, дати, валути и имейл адреси в писмен вид. Той е дообучен от Qwen/Qwen3-0.6B, във версия 1 поддържа само английски език и се управлява изцяло чрез контролен ред с три оси, поставен над транскрипцията. Superwhisper съобщава за 94,8% точност на токените върху отделен набор от 7519 случая, измерена чрез greedy декодиране върху квантизирания билд.

Може ли да бъде внедрен?

Да, но само S1-mini. S1-mini е публикуван в Hugging Face под лиценза Apache 2.0 с клауза за именуване. S1-Voice и S1-Language са услуги, хоствани от Superwhisper, така че могат да бъдат използвани, но не и хоствани самостоятелно.

  • Ниво на компанията: Всяко. GGUF билдът Q4_K_M е файл с размер 462 MB, който работи на процесор на лаптоп. Самостоятелните разработчици могат да го включат в настолно приложение. Предприятията могат да го стартират зад VPC, където аудиотранскрипциите не могат да напускат мрежата.
  • Индустрии: Здравеопазване и клинична документация, право, финансови услуги, поддръжка на клиенти, инструменти за разработчици, достъпност и субтитри в реално време.
  • Приложения: Приложения за диктовка, инструменти за бележки от срещи, субтитри в реално време, редактори с гласово управление, въвеждане на данни в CRM чрез глас и всеки процес, който превръща необработен изход от ASR в текст, който ще бъде прочетен от човек.

Какво прави S1-mini

S1-mini е текстов нормализатор, а не транскрибиращ или чат модел. Той се използва след автоматичното разпознаване на реч:

audio → ASR (Whisper, Parakeet, …) → S1-mini → clean text

Той премахва паразитните думи, разрешава фалшивите начала и самокорекциите, като запазва варианта, до който е стигнал говорещият, добавя пунктуация и главни букви и преобразува изговорените числа, дати, часове, валути и имейл адреси в писмен вид. Кажете „support at superwhisper dot com“ и ще получите support@superwhisper.com.

Моделът е дообучен от Qwen/Qwen3-0.6B. Той има 596 милиона уникални параметъра (0,44 милиарда без embedding параметрите), 28 слоя, 16 query глави и 8 key/value глави с GQA, както и BF16 тегла. Страничната лента на Hub показва 0,8 милиарда, тъй като обвързаният embedding се съхранява два пъти; в картата на модела това несъответствие е обяснено изрично. Версия 1 поддържа само английски език, а препоръчителният вход е приблизително 1000 токена.

Контролният ред е целият интерфейс

S1-mini приема фиксирана системна подкана, след това контролен ред и накрая необработената транскрипция:

Копиране на кодаКопираноИзползване на друг браузър
[Styling: <value>] [Structure: <value>] [Context: <value>]
<raw transcript>

Styling приема casual, semi-casual, semi-formal или formal. Structure приема prose или lists. Context приема general или email. И трите оси са независими и всяка комбинация е била използвана при обучението. Ако изпратите стойности извън тези набори или преформулирате системната подкана, изходът може да се влоши или да стане неразбираем. Заслужава да се отбележи едно малко несъответствие: приложението Superwhisper предлага плъзгач за тон с пет позиции, който добавя предварителна настройка „балансиран“, докато документацията за отворените тегла посочва четири обучени стойности за Styling.

Моделът е ограничен и по замисъл. Той не добавя съдържание, което не сте казали, не коригира факти, не смекчава ругатни и не пренаписва диалекта. Вход, състоящ се само от паразитни думи, връща празен низ, а интеграциите трябва да го приемат като валиден резултат.

Две настройки, които нарушават повечето интеграции

Първо, изисква се enable_thinking=False. Шаблонът за чат е този на Qwen3, без промени, а по подразбиране Qwen3 използва режим на мислене. S1-mini е обучен с изключен режим на мислене, така че ходът на асистента трябва да започва с празен блок <think>. Ако пропуснете флага, обикновено изобщо няма да получите използваем изход.

Второ, използвайте greedy декодиране. generation_config.json се доставя с do_sample: false. GGUF билдовете все още съдържат наследените от Qwen3 метаданни temp = 0.6, top_p = 0.95 и top_k = 20, затова задавайте изрично температура 0 при всяка заявка. В llama.cpp използвайте --jinja с --chat-template-kwargs '{"enable_thinking":false}', вместо --reasoning-budget 0, което влошава изхода.

Публикувана оценка

Superwhisper е оценил S1-mini върху отделен набор от 7519 случая в 104 транскрипции. Точността на токените е 94,8%, измерена чрез greedy декодиране върху билда Q4_K_M, а процентът на грешки при текстови редакции е 11,6%. При текст, форматиран като имейл, той идентифицира реда с поздрава в 99,3% от случаите и финалната формула в 97,9%. Той съвпада с правилната структура на изхода — списък или абзац — в 97,6% от случаите и генерира точни имейл адреси в 92% от случаите. По-малко от 1% от генерациите показват зацикляне или прекъсване, а моделът правилно не генерира изход в 98,6% от случаите, когато нищо не трябва да бъде транскрибирано. Това са числа, докладвани от доставчика върху вътрешен тестов набор, а не резултати от трети страни.

Двата облачни модела

S1-Voice е хостваният модел за преобразуване на реч в текст. Superwhisper съобщава за транскрибиране до 46 пъти по-бързо от времето за говорене, като повечето диктовки под 30 секунди се появяват 0,32 секунди след спирането. В осем набора от данни, включително аудио от срещи и разговори за финансови резултати, той постига среден процент на грешки в думите от 6,8%, който спада до 2,2% при LibriSpeech. Superwhisper твърди, че средната стойност от 6,8% е най-ниската от 15-те модела, които е тествал, и че S1-Voice е получил 83 от 100 точки по комбинирания им показател спрямо 76 за WisprFlow.

S1-Language е хостваният модел за следване на инструкции, предназначен за почистване, форматиране и обобщаване, и се появява в селектора на модели заедно с модели от Anthropic, OpenAI и Groq. Препоръчителните настройки по подразбиране са Cohere Transcribe плюс S1-mini офлайн или S1-Voice плюс S1-Language в облака.

Интерактивно обяснение

Вграденият по-долу инструмент ви позволява да превключвате всяка ос на контролния ред и да наблюдавате как се променя изходът. Всяка двойка вход/изход е взета дословно от картата на модела.

Основни изводи

  • S1-mini е текстов нормализатор с 0.6B параметъра и отворени тегла за изход от ASR, а не транскрибиращ или чат модел.
  • GGUF билдът Q4_K_M е 462 MB и работи на процесор на лаптоп, така че внедряването на устройството е реалистично.
  • Фиксирана системна подкана плюс контролен ред с три оси е единственият механизъм за управление.
  • enable_thinking=False и температура 0 са задължителни; повечето проблеми при интеграцията произтичат от тях.

Разгледайте теглата на модела и техническите подробности. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit с над 150 хиляди членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризирането на вашето GitHub хранилище, страница в Hugging Face, продуктова премиера, уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини