Fastino пусна GLiNER2.5-Decide: модел за вземане на решения с отворени тегла и 340 млн. параметъра, който работи на CPU
Fastino Labs пусна GLiNER2.5-Decide — модел за вземане на решения с отворени тегла и 340 млн. параметъра. Той приема текст и схема от типизирани въпроси и връща структурирани отговори. Всеки отговор включва вероятностно разпределение, оценка на увереността и метаданни за изпълнимостта на ограниченията. Моделът е насочен към честите преценки в агентските конвейери: маршрутизиране, триаж, избор на инструменти и защитни механизми.
Може ли да бъде внедрен? Да, теглата се разпространяват под лиценз Apache 2.0 и се инсталират с pip install gliner2. Те работят на CPU, GPU или в среди без мрежова свързаност. Екипът на Fastino предлага също хоствано инфериране и дообучаване чрез своя GLiNER API.
Какво всъщност прави GLiNER2.5-Decide
GLiNER2.5-Decide е негenerиращ класификатор. Той използва енкодер DeBERTa-v3-large и е дообучен от gliner2-large-v1. Не генерира токени и не се нуждае от шаблон за промпт.
Наборите от етикети се подават при извикване. Всеки въпрос в схемата декларира разрешените си отговори. Той също така посочва дали очаква един отговор, множество отговори или подредена стойност. Схемите могат да съдържат инструкции, примери, описания на етикети и правила, свързващи отговорите на различни въпроси.
Конвейерът има 2 етапа. Енкодерът прочита текста и схемата заедно и оценява всеки разрешен отговор. След това декодер с ограничения търси съвместното разпределение с най-висока оценка, позволено от декларираните правила.
Fastino ясно определя обхвата. Моделът не разсъждава, не обяснява и не отговаря на отворени въпроси. Той е специализиран за оперативни решения.
Защо съвместното декодиране е важно
Екипът на Fastino илюстрира стойността му с пример за защитен механизъм. При независимо декодиране моделът отчита инжектиране на промпт с вероятност 0.82. Същевременно обозначава същия промпт като безопасен с вероятност 0.52. Атаката е открита, но 2-та изхода си противоречат.
Съвместното декодиране прилага правило, според което всяка открита вреда изисква присъда „небезопасно“. Тогава моделът връща едновременно safety=unsafe и harm_type=prompt_injection. Кодът надолу по веригата може да използва тези оценки, за да блокира, маршрутизира или ескалира.
Схемите могат да изразяват зависимости, изключвания, ограничения на кардиналността и граници на редните стойности. Същият енкодер може също да извлича обекти, релации и структурирани записи с отмествания на ниво символи в 1 прав проход. Отговорите от класификацията не връщат интервали с доказателства.
Резултати от бенчмарковете за бързи решения
Екипът на Fastino оцени модела върху Fast Decisions — вътрешно генериран набор от тестове, отделен от обучаващите данни. Той съдържа 5 100 тестови примера в 17 набора от данни. Задачите обхващат операции с клиенти, маршрутизиране по области (банкиране, клинична сфера, пътувания, социални придобивки) и общо разбиране на съдържание. Метриката е точност на точното съвпадение: дадена прогноза се брои само ако наборът ѝ от етикети съвпада напълно с референтния.
| Модел | Тип | Средна стойност |
|---|---|---|
| GLiNER2.5-Decide | Енкодер с 340 млн. параметъра | 60.1% |
| JevK5 | Декодер Qwen3.5 от клас 4B | 57.5% |
| SemIf | Декодер Qwen3.5-4B | 56.4% |
| GLiFormer large-v1 | Енкодер с един проход | 49.0% |
| Laya | Енкодер ModernBERT с 421 млн. параметъра | 46.6% |
GLiNER2.5-Decide води в 9 от 17-те набора от данни. Маршрутизирането по намерение е най-силната му област. Той постига 75.3% при намеренията за поддръжка и 64.3% при банковите намерения. Това е съответно с 18.6 и 8.6 процентни пункта повече от следващите най-добри модели.
Латентност: практична работа на CPU
Екипът на Fastino измери бенчмарка на чекпойнта от край до край при размер на пакета 1, със схема с 2 глави и 15 етикета. При 64 токена латентността p50 беше:
- 167.3 ms на Intel Xeon Platinum 8581C с 48 vCPU
- 43.6 ms на NVIDIA T4
- 43.4 ms на NVIDIA L4
- 38.3 ms на NVIDIA V100
- 47.3 ms на NVIDIA A100
При кратки заявки преобладават фиксираните разходи за предварителна обработка и стартиране на ядрата. Това задържа разликата между графичните процесори в рамките на 9 ms. При 1 024 токена A100 излиза напред с 52.6 ms спрямо 75.6 ms при V100 и 131.4 ms при L4.
Използване в код
Това извикване с множество глави е адаптирано от картата на модела:
from gliner2 import AutoExtractor
model = AutoExtractor.from_pretrained("fastino/GLiNER2.5-Decide")
model.classify_text(
"Please confirm the new retention rule is applied before Friday's audit.",
{
"intent": ["fyi", "request", "approval", "complaint"],
"urgency": ["low", "normal", "high", "critical"],
"route": ["support", "billing", "legal", "security"],
},
)Главите с един етикет връщат един низ. Главите с множество етикети връщат всеки етикет над cls_threshold. Етикетите могат да съдържат описания, а редните скали се подават като обикновени низове, например „0“ до „10“.
Случаи на употреба и семейство модели
Fastino насочва модела към маршрутизиране на модели, извикване на инструменти, използване на браузър и компютър, защитни механизми, съкращаване на контекста, LLM-as-a-judge и симулации. Дообучаването работи локално, изцяло или с LoRA, чрез обучаващия инструмент GLiNER2. Файлът SKILL.md предоставя хоствания работен процес на кодиращите агенти.
Fastino публикува също GLiNER2.5-Decide-1B, изграден върху енкодера Ettin 1B. Той постига 59.6% в същия набор от тестове — малко под модела с 340 млн. параметъра. За многоезичен вход Fastino посочва GLiNER2.5-multi-Decide — модел с 287 млн. параметъра, постигащ 56.7%. Архитектурата в основата е описана в статията за GLiNER2.
Основни изводи
- Енкодер с 340 млн. параметъра и отворени тегла, Apache 2.0, работи на CPU или в среда без мрежова свързаност.
- Връща отговори, вероятности, увереност и метаданни за изпълнимостта.
- Съвместното декодиране прилага правила между свързани отговори.
- 60.1% средна стойност във вътрешния набор на Fastino от 17 набора от данни, водещ в 9 от тях.
- 167.3 ms p50 на CPU, 38.3 ms на V100 при кратки входове.
Разгледайте техническите подробности и картата на модела. Всички заслуги принадлежат на изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit с над 150 хил. потребители и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.
Имате нужда да си партнирате с нас за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово издание, уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.