Fastino выпустила GLiNER2.5-Decide: модель принятия решений с открытыми весами и 340 млн параметров, работающая на CPU
Fastino Labs выпустила GLiNER2.5-Decide — модель принятия решений с открытыми весами и 340 млн параметров. Она получает текст и схему типизированных вопросов и возвращает структурированные ответы. Каждый ответ сопровождается распределением вероятностей, оценкой уверенности и метаданными о выполнимости ограничений. Модель предназначена для частых задач, требующих суждения, внутри конвейеров агентов: маршрутизации, триажа, выбора инструментов и применения защитных ограничений.
Можно ли её развернуть? Да, веса распространяются по лицензии Apache 2.0, а установка выполняется командой pip install gliner2. Модель работает на CPU, GPU или в изолированных средах без доступа к внешним сетям. Команда Fastino также предлагает размещённый инференс и дообучение через свой GLiNER API.
Что на самом деле делает GLiNER2.5-Decide
GLiNER2.5-Decide — это негenerative классификатор. Он использует энкодер DeBERTa-v3-large и дообучен на основе gliner2-large-v1. Модель не генерирует токены и не требует шаблона промпта.
Наборы меток передаются во время вызова. Каждый вопрос в схеме определяет допустимые ответы. Также указывается, ожидается ли один ответ, несколько ответов или упорядоченное значение. Схемы могут содержать инструкции, примеры, описания меток и правила, связывающие ответы на разные вопросы.
Конвейер состоит из 2 этапов. Энкодер одновременно считывает текст и схему и оценивает каждый допустимый ответ. Затем декодер с ограничениями ищет наиболее высокооценённое совместное назначение, разрешённое заданными правилами.
Fastino чётко обозначает область применения. Модель не рассуждает, не объясняет и не отвечает на открытые вопросы. Это специализированный инструмент для операционных решений.
Почему совместное декодирование важно
Команда Fastino иллюстрирует ценность этого подхода на примере защитного ограничения. При независимом декодировании модель обнаружила внедрение промпта с вероятностью 0.82. Она также пометила тот же промпт как безопасный с вероятностью 0.52. Атака была обнаружена, но 2 результата противоречили друг другу.
Совместное декодирование применяет правило, согласно которому любое обнаруженное вредоносное содержимое требует вердикта «небезопасно». После этого модель возвращает одновременно safety=unsafe и harm_type=prompt_injection. Нисходящий код может использовать эти оценки для блокировки, маршрутизации или эскалации.
Схемы могут выражать импликации, исключения, ограничения кардинальности и порядковые границы. Тот же энкодер также может извлекать сущности, отношения и структурированные записи с символьными смещениями за 1 прямой проход. Ответы классификации не возвращают диапазоны, содержащие подтверждающие данные.
Результаты бенчмарка для быстрых решений
Команда Fastino оценила модель на наборе Fast Decisions — внутреннем сгенерированном наборе отложенных данных. Он содержит 5 100 тестовых примеров в 17 наборах данных. Задачи охватывают клиентские операции, маршрутизацию по доменам (банковская сфера, клинические задачи, путешествия, льготы) и общее понимание контента. Используемая метрика — точность exact match: прогноз засчитывается только в том случае, если его набор меток в точности совпадает с эталонным.
| Модель | Тип | Средний результат |
|---|---|---|
| GLiNER2.5-Decide | Энкодер с 340 млн параметров | 60.1% |
| JevK5 | Декодер Qwen3.5 класса 4B | 57.5% |
| SemIf | Декодер Qwen3.5-4B | 56.4% |
| GLiFormer large-v1 | Однопроходный энкодер | 49.0% |
| Laya | Энкодер ModernBERT с 421 млн параметров | 46.6% |
GLiNER2.5-Decide заняла первое место в 9 из 17 наборов данных. Её сильнейшей областью стала маршрутизация намерений. Модель показала результат 75.3% для намерений обращений в службу поддержки и 64.3% для банковских намерений. Это на 18.6 и 8.6 процентного пункта выше результатов ближайших конкурентов.
Задержка: практичная работа на CPU
Команда Fastino провела сквозное тестирование контрольной точки при размере батча 1 со схемой из 2 голов и 15 меток. При 64 токенах задержка p50 составила:
- 167.3 мс на 48-vCPU Intel Xeon Platinum 8581C
- 43.6 мс на NVIDIA T4
- 43.4 мс на NVIDIA L4
- 38.3 мс на NVIDIA V100
- 47.3 мс на NVIDIA A100
В коротких запросах преобладают фиксированные накладные расходы на предварительную обработку и запуск ядер. Поэтому разница между GPU составляет не более 9 мс. При 1 024 токенах A100 выходит вперёд с результатом 52.6 мс против 75.6 мс на V100 и 131.4 мс на L4.
Использование в коде
Этот вызов с несколькими головами адаптирован из карточки модели:
from gliner2 import AutoExtractor
model = AutoExtractor.from_pretrained("fastino/GLiNER2.5-Decide")
model.classify_text(
"Please confirm the new retention rule is applied before Friday's audit.",
{
"intent": ["fyi", "request", "approval", "complaint"],
"urgency": ["low", "normal", "high", "critical"],
"route": ["support", "billing", "legal", "security"],
},
)Головки с одной меткой возвращают одну строку. Головки с несколькими метками возвращают все метки выше порога cls_threshold. Метки могут иметь описания, а порядковые шкалы передаются как обычные строки, например «0»–«10».
Варианты использования и семейство моделей
Fastino ориентируется на маршрутизацию моделей, вызов инструментов, работу с браузером и компьютером, защитные ограничения, сокращение контекста, LLM-as-a-judge и симуляции. Дообучение работает локально, полностью или с помощью LoRA, через тренер GLiNER2. Файл SKILL.md предоставляет агентам для написания кода доступ к размещённому рабочему процессу.
Fastino также опубликовала GLiNER2.5-Decide-1B, созданную на основе энкодера Ettin 1B. Она набирает 59.6% на том же наборе, немного уступая модели с 340 млн параметров. Для многоязычного ввода Fastino рекомендует GLiNER2.5-multi-Decide — модель с 287 млн параметров, набирающую 56.7%. Архитектура, лежащая в основе этих моделей, описана в статье о GLiNER2.
Основные выводы
- Энкодер с открытыми весами и 340 млн параметров, Apache 2.0, работает на CPU или в изолированной среде.
- Возвращает ответы, вероятности, оценку уверенности и метаданные о выполнимости.
- Совместное декодирование применяет правила к связанным ответам.
- Средний результат 60.1% на внутреннем наборе Fastino из 17 датасетов, первое место в 9 из них.
- Задержка p50 составляет 167.3 мс на CPU и 38.3 мс на V100 для коротких входных данных.
Ознакомьтесь с разделами Технические детали и Карточка модели. Вся заслуга принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите стать нашим партнёром для продвижения вашего репозитория GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.