Представляємо S1-mini: 462-МБ нормалізатор тексту з відкритими вагами від Superwhisper, який перетворює необроблені транскрипції ASR на чистий письмовий текст
Superwhisper випустила сімейство моделей S1: S1-Voice, S1-Language і S1-mini. S1-Voice — це хмарна модель перетворення мовлення на текст, а S1-Language — хмарна модель дотримання інструкцій для очищення та форматування. Найцікавішою за межами застосунку є S1-mini, випущена з відкритими вагами на Hugging Face. S1-mini — це нормалізатор тексту на 0,6B, а не транскрибатор і не чат-модель. Вона працює після автоматичного розпізнавання мовлення та переписує необроблені транскрипції як чистий письмовий текст: прибирає слова-паразити, розв’язує самовиправлення відповідно до остаточного варіанта, додає пунктуацію та великі літери, а також подає усні числа, дати, грошові суми й адреси електронної пошти в письмовій формі. Модель донавчена на основі Qwen/Qwen3-0.6B, у версії 1 підтримує лише англійську мову та повністю керується рядком керування з трьома осями, розміщеним над транскрипцією. Superwhisper повідомляє про точність токенів 94,8% на відкладеній вибірці з 7 519 випадків, виміряну жадібним декодуванням у квантизованій збірці.
Чи можна її розгорнути?
Так, але лише S1-mini. S1-mini опублікована на Hugging Face за ліцензією Apache 2.0 із додатковим пунктом щодо найменування. S1-Voice і S1-Language — це сервіси, розміщені на інфраструктурі Superwhisper, тому ними можна користуватися, але їх не можна розгорнути самостійно.
- Рівень компанії: будь-який. Збірка GGUF Q4_K_M — це файл розміром 462 МБ, який працює на процесорі ноутбука. Незалежні розробники можуть вбудувати її в настільний застосунок. Підприємства можуть запускати її за VPC, де аудіотранскрипції не залишають межі мережі.
- Галузі: охорона здоров’я та клінічна документація, юриспруденція, фінансові послуги, підтримка клієнтів, інструменти для розробників, доступність і субтитрування в реальному часі.
- Застосунки: застосунки для диктування, інструменти для створення нотаток із зустрічей, субтитрування в реальному часі, редактори з голосовим керуванням, внесення даних у CRM голосом і будь-які конвеєри, що перетворюють необроблений результат ASR на текст, який читатиме людина.
Що робить S1-mini
S1-mini — це нормалізатор тексту, а не транскрибатор і не чат-модель. Вона працює після автоматичного розпізнавання мовлення:
аудіо → ASR (Whisper, Parakeet, …) → S1-mini → чистий текст
Вона прибирає слова-паразити, розв’язує помилкові початки та самовиправлення відповідно до остаточного варіанта, додає пунктуацію та великі літери, а також подає усні числа, дати, час, грошові суми й адреси електронної пошти в письмовій формі. Скажіть «support at superwhisper dot com» — і отримаєте support@superwhisper.com.
Модель донавчена на основі Qwen/Qwen3-0.6B. Вона має 596 млн унікальних параметрів (0,44 млрд без параметрів вбудовування), 28 шарів, 16 голів запитів і 8 голів ключів/значень із GQA, а також ваги BF16. На бічній панелі Hub зазначено 0,8 млрд, оскільки пов’язане вбудовування зберігається двічі; у картці цю розбіжність прямо пояснено. Версія 1 підтримує лише англійську мову, а рекомендований обсяг вхідних даних становить приблизно 1 000 токенів.
Рядок керування — це весь інтерфейс
S1-mini отримує фіксований системний запит, потім рядок керування, а після нього — необроблену транскрипцію:
[Styling: <value>] [Structure: <value>] [Context: <value>]
<raw transcript>Styling може набувати значень casual, semi-casual, semi-formal або formal. Structure може набувати значень prose або lists. Context може набувати значень general або email. Усі три осі є незалежними, і модель навчалася на кожній їхній комбінації. Якщо передати значення поза цими наборами або перефразувати системний запит, результат може погіршитися чи перетворитися на безладний текст. Варто знати про невелику розбіжність: у застосунку Superwhisper доступний повзунок тону з п’ятьма позиціями, який додає пресет «збалансований», тоді як документація відкритих ваг містить чотири навчені значення Styling.
Модель також має обмеження, закладені в її дизайн. Вона не додає контенту, якого ви не вимовляли, не виправляє факти, не пом’якшує ненормативну лексику й не переписує діалект. Вхідні дані, що складаються лише зі слів-паразитів, повертають порожній рядок, і інтеграції мають сприймати це як дійсний результат.
Два налаштування, які порушують роботу більшості інтеграцій
По-перше, необхідно встановити enable_thinking=False. Шаблон чату — це незмінений шаблон Qwen3, а Qwen3 за замовчуванням вмикає режим міркування. S1-mini навчали з вимкненим режимом міркування, тому відповідь асистента має починатися з порожнього блоку <think>. Якщо не вказати цей прапорець, зазвичай ви взагалі не отримаєте придатного для використання результату.
По-друге, декодуйте жадібно. У generation_config.json встановлено do_sample: false. Збірки GGUF досі містять успадковані метадані Qwen3 temp = 0.6, top_p = 0.95 і top_k = 20, тому в кожному запиті явно передавайте температуру 0. У llama.cpp використовуйте --jinja разом із --chat-template-kwargs '{"enable_thinking":false}', а не --reasoning-budget 0, який погіршує результат.
Заявлені результати оцінювання
Superwhisper оцінила S1-mini на відкладеній вибірці з 7 519 випадків у 104 транскрипціях. Точність токенів становить 94,8% — її вимірювали жадібним декодуванням на збірці Q4_K_M; частка помилок редагування тексту — 11,6%. Для тексту у форматі електронного листа модель визначає рядок привітання у 99,3% випадків, а прощальну формулу — у 97,9%. Вона правильно визначає структуру результату — список чи абзац — у 97,6% випадків і генерує точні адреси електронної пошти у 92% випадків. Менше ніж 1% генерацій демонструють зациклення або обрив, а модель правильно утримується від виведення у 98,6% випадків, коли нічого не слід транскрибувати. Це наведені постачальником показники, отримані на внутрішній тестовій вибірці, а не результати стороннього оцінювання.
Дві хмарні моделі
S1-Voice — це розміщена в хмарі модель перетворення мовлення на текст. Superwhisper повідомляє про транскрибування зі швидкістю до 46 разів вищою за швидкість мовлення; більшість диктувань тривалістю до 30 секунд з’являються через 0,32 секунди після завершення. На восьми наборах даних, зокрема із записами зустрічей і телефонних конференцій щодо фінансових результатів, середній показник помилок у словах становить 6,8%, а на LibriSpeech він знижується до 2,2%. Superwhisper стверджує, що середній показник 6,8% був найнижчим серед 15 протестованих нею моделей, а S1-Voice набрала 83 зі 100 за її комбінованою метрикою проти 76 у WisprFlow.
S1-Language — це розміщена в хмарі модель дотримання інструкцій для очищення, форматування та узагальнення; вона відображається у виборі моделей поряд із моделями Anthropic, OpenAI та Groq. Рекомендовані налаштування за замовчуванням: Cohere Transcribe разом із S1-mini офлайн або S1-Voice разом із S1-Language у хмарі.
Інтерактивне пояснення
Вбудований нижче інструмент дає змогу перемикати кожну вісь рядка керування та спостерігати, як змінюється результат. Кожну пару вхідних і вихідних даних дослівно взято з картки моделі.
Ключові висновки
- S1-mini — це нормалізатор тексту з відкритими вагами на 0,6B для результатів ASR, а не транскрибатор і не чат-модель.
- GGUF Q4_K_M має розмір 462 МБ і працює на процесорі ноутбука, тому розгортання на пристрої є цілком реалістичним.
- Фіксований системний запит і рядок керування з трьома осями — єдиний механізм керування моделлю.
enable_thinking=Falseі температура 0 є обов’язковими; більшість помилок інтеграції пов’язані саме з ними.
Перегляньте ваги моделі та технічні деталі. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання зі 150 тисячами+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.