Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

webAI выпустила TwIL-LM: семейство моделей формальной логики на 1,7 и 3 млрд параметров для автоформализации на локальном оборудовании

webAI выпустила TwIL-LMсемейство из двух моделей для рассуждений в формальной логике с 1,7 и 3 млрд параметров. Представитель семейства с 3 млрд параметров, TwIL-LM3, представляет собой объединённую дообученную версию SmolLM3-3B; версия с 1,7 млрд параметров — это адаптер PEFT LoRA для SmolLM2-1.7B-Instruct. Обе модели предназначены для автоформализации: перевода английского текста в логику первого порядка и проверки того, следует ли вывод из посылок. Обе запускаются локально: для версии 1.7B доступна квантованная сборка размером 1,06 ГБ, а для 3B — GGUF Q4_K_M размером 1,78 ГиБ. В анонсе webAI подчёркивает, что модель превосходит gpt-oss-120b на четырёх из пяти направлений формального рассуждения.

Готова ли модель к развертыванию?

Частично. На данный момент — только для некоммерческого использования.

Обе контрольные точки распространяются по лицензии webAI Non-Commercial License ver. 1.0. Для развертывания, приносящего доход, требуется отдельное соглашение с webAI.

  • Размер компании: любой. GGUF 3B Q4_K_M имеет размер 1,78 ГиБ и работает на CPU или при наличии 4 ГБ видеопамяти. Версия 1.7B Q4_K_M занимает 1,06 ГБ.
  • Отрасли: комплаенс и RegTech, финансовые услуги, здравоохранение и фармацевтика, юридические и контрактные операции, исследования в области формальных методов. webAI позиционирует локальное выполнение для сред, где данные не могут покидать устройство.
  • Применения: перевод в логику первого порядка (FOL), классификация логического следования по наборам посылок, преобразование естественного языка в структурированные запросы, подготовка и критика формализаций в Lean, а также уровень верификации, проверяющий вывод более крупной модели.

Как создавалась TwIL-LM3?

Поверх базовой модели были выполнены четыре этапа. Контролируемое дообучение LoRA на синтетическом корпусе по формальной логике. Слияние контрольных точек — усреднение промежуточных контрольных точек SFT в пространстве параметров. Интерполяция WiSE-FT обратно к предварительно обученной базовой модели при λ = 0,25. Затем MGPO — этап GRPO с энтропийным взвешиванием, выполненный с использованием программного верификатора. Опубликованная контрольная точка — шаг 2071.

Это значение λ имеет решающее значение: сохраняется лишь четверть разницы, полученной в результате дообучения. Соседняя версия, в которой интерполяция не применялась, показала более высокий результат внутри домена — 0,515 по макровому гейту, — но потеряла примерно двенадцать пунктов способности на отложенных данных. webAI не опубликовала эту версию.

Производительность

В анонсе webAI указаны следующие результаты: 96,4 для индукции правил, 87,6 для семантического парсинга, 64,6 для формализации в Lean, 52,0 для ответов в точном формате и 68,7 для маркировки логического следования.

Компания сообщает о двух направлениях тестирования. В направлении A, посвящённом формальной логике внутри домена, TwIL-LM3 набирает 0,4488 в среднем по шести направлениям и 0,4218 по макровому гейту — метрике, на которой основывается процесс обучения. Она превосходит все версии вплоть до LFM2.5-8B-A1B включительно по всем шести целевым направлениям: 0,4218 против 0,3757 при втрое меньшем числе параметров. Две крупнейшие версии она не превосходит. Qwen3-8B получает 0,5336 против 0,4218 по гейту, но большая часть этого результата приходится на оценивание по ослабленному совпадению; при строгом режиме strict-7 показатели составляют 0,2093 и 0,1971 соответственно. gpt-oss-120b получает 0,5192 против 0,4488 по среднему результату на шести направлениях.

Именно эффективность является сильной стороной модели, что однозначно отражено в карточке модели. TwIL-LM3 генерирует самые короткие ответы среди всех версий — 482 токена в направлении B — и поэтому выдаёт больше всего ответов в секунду: 32,9 против 4,2 у версии 120B.

Перенос на отложенные данные

TwIL-LM3 улучшает результат внутри домена на +26% относительно: показатель макрового гейта вырос с 0,336 до 0,422, при этом среднее значение на отложенном основном наборе также увеличилось на +0,022. В карточке модели она названа единственной версией в проекте, которая улучшает результаты в обоих направлениях. Результат на LogicBench вырос с 0,6467 до 0,7167. Показатель GSM8K немного снизился — с 0,8833 до 0,8733, а IFEval ухудшился с 0,6767 до 0,6433.

Версия 1.7B представляет собой иной компромисс. Её основной макровый показатель составляет 0,361 против 0,185 у базовой модели без адаптации. Результаты вне распределения неоднозначны: LogicBench BQA улучшился с 0,563 до 0,590, тогда как GSM8K снизился с 0,413 до 0,380, а ARC-C chain-of-thought — с 0,587 до 0,463.

Основные выводы

  • TwIL-LM3 (3B) и TwIL-LM (1.7B) предназначены для работы с формальной логикой; обе модели распространяются по некоммерческой лицензии.
  • Выпущенная TwIL-LM3 уступает gpt-oss-120b по среднему результату на шести направлениях: 0,4488 против 0,5192.
  • Её главное преимущество — эффективность: 32,9 ответа в секунду при генерации ответов длиной 482 токена.
  • Именно WiSE-FT при λ = 0,25 позволяет сохранить прирост внутри домена без ухудшения результатов на отложенных данных.

Ознакомьтесь с весами модели и техническими подробностями. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости