Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Fastino пусна GLiNER2.5-Decide: модел за вземане на решения с отворени тегла и 340 млн. параметъра, който работи на CPU

Fastino Labs пусна GLiNER2.5-Decide — модел за вземане на решения с отворени тегла и 340 млн. параметъра. Той приема текст и схема от типизирани въпроси и връща структурирани отговори. Всеки отговор включва вероятностно разпределение, оценка на увереността и метаданни за изпълнимостта на ограниченията. Моделът е насочен към честите преценки в агентските конвейери: маршрутизиране, триаж, избор на инструменти и защитни механизми.

Може ли да бъде внедрен? Да, теглата се разпространяват под лиценз Apache 2.0 и се инсталират с pip install gliner2. Те работят на CPU, GPU или в среди без мрежова свързаност. Екипът на Fastino предлага също хоствано инфериране и дообучаване чрез своя GLiNER API.

Какво всъщност прави GLiNER2.5-Decide

GLiNER2.5-Decide е негenerиращ класификатор. Той използва енкодер DeBERTa-v3-large и е дообучен от gliner2-large-v1. Не генерира токени и не се нуждае от шаблон за промпт.

Наборите от етикети се подават при извикване. Всеки въпрос в схемата декларира разрешените си отговори. Той също така посочва дали очаква един отговор, множество отговори или подредена стойност. Схемите могат да съдържат инструкции, примери, описания на етикети и правила, свързващи отговорите на различни въпроси.

Конвейерът има 2 етапа. Енкодерът прочита текста и схемата заедно и оценява всеки разрешен отговор. След това декодер с ограничения търси съвместното разпределение с най-висока оценка, позволено от декларираните правила.

Fastino ясно определя обхвата. Моделът не разсъждава, не обяснява и не отговаря на отворени въпроси. Той е специализиран за оперативни решения.

Защо съвместното декодиране е важно

Екипът на Fastino илюстрира стойността му с пример за защитен механизъм. При независимо декодиране моделът отчита инжектиране на промпт с вероятност 0.82. Същевременно обозначава същия промпт като безопасен с вероятност 0.52. Атаката е открита, но 2-та изхода си противоречат.

Съвместното декодиране прилага правило, според което всяка открита вреда изисква присъда „небезопасно“. Тогава моделът връща едновременно safety=unsafe и harm_type=prompt_injection. Кодът надолу по веригата може да използва тези оценки, за да блокира, маршрутизира или ескалира.

Схемите могат да изразяват зависимости, изключвания, ограничения на кардиналността и граници на редните стойности. Същият енкодер може също да извлича обекти, релации и структурирани записи с отмествания на ниво символи в 1 прав проход. Отговорите от класификацията не връщат интервали с доказателства.

Резултати от бенчмарковете за бързи решения

Екипът на Fastino оцени модела върху Fast Decisions — вътрешно генериран набор от тестове, отделен от обучаващите данни. Той съдържа 5 100 тестови примера в 17 набора от данни. Задачите обхващат операции с клиенти, маршрутизиране по области (банкиране, клинична сфера, пътувания, социални придобивки) и общо разбиране на съдържание. Метриката е точност на точното съвпадение: дадена прогноза се брои само ако наборът ѝ от етикети съвпада напълно с референтния.

МоделТипСредна стойност
GLiNER2.5-DecideЕнкодер с 340 млн. параметъра60.1%
JevK5Декодер Qwen3.5 от клас 4B57.5%
SemIfДекодер Qwen3.5-4B56.4%
GLiFormer large-v1Енкодер с един проход49.0%
LayaЕнкодер ModernBERT с 421 млн. параметъра46.6%

GLiNER2.5-Decide води в 9 от 17-те набора от данни. Маршрутизирането по намерение е най-силната му област. Той постига 75.3% при намеренията за поддръжка и 64.3% при банковите намерения. Това е съответно с 18.6 и 8.6 процентни пункта повече от следващите най-добри модели.

Латентност: практична работа на CPU

Екипът на Fastino измери бенчмарка на чекпойнта от край до край при размер на пакета 1, със схема с 2 глави и 15 етикета. При 64 токена латентността p50 беше:

  • 167.3 ms на Intel Xeon Platinum 8581C с 48 vCPU
  • 43.6 ms на NVIDIA T4
  • 43.4 ms на NVIDIA L4
  • 38.3 ms на NVIDIA V100
  • 47.3 ms на NVIDIA A100

При кратки заявки преобладават фиксираните разходи за предварителна обработка и стартиране на ядрата. Това задържа разликата между графичните процесори в рамките на 9 ms. При 1 024 токена A100 излиза напред с 52.6 ms спрямо 75.6 ms при V100 и 131.4 ms при L4.

Използване в код

Това извикване с множество глави е адаптирано от картата на модела:

Копиране на кодаКодът е копиранИзползвайте друг браузър
from gliner2 import AutoExtractor

model = AutoExtractor.from_pretrained("fastino/GLiNER2.5-Decide")

model.classify_text(
    "Please confirm the new retention rule is applied before Friday's audit.",
    {
        "intent": ["fyi", "request", "approval", "complaint"],
        "urgency": ["low", "normal", "high", "critical"],
        "route": ["support", "billing", "legal", "security"],
    },
)

Главите с един етикет връщат един низ. Главите с множество етикети връщат всеки етикет над cls_threshold. Етикетите могат да съдържат описания, а редните скали се подават като обикновени низове, например „0“ до „10“.

Случаи на употреба и семейство модели

Fastino насочва модела към маршрутизиране на модели, извикване на инструменти, използване на браузър и компютър, защитни механизми, съкращаване на контекста, LLM-as-a-judge и симулации. Дообучаването работи локално, изцяло или с LoRA, чрез обучаващия инструмент GLiNER2. Файлът SKILL.md предоставя хоствания работен процес на кодиращите агенти.

Fastino публикува също GLiNER2.5-Decide-1B, изграден върху енкодера Ettin 1B. Той постига 59.6% в същия набор от тестове — малко под модела с 340 млн. параметъра. За многоезичен вход Fastino посочва GLiNER2.5-multi-Decide — модел с 287 млн. параметъра, постигащ 56.7%. Архитектурата в основата е описана в статията за GLiNER2.

Основни изводи

  • Енкодер с 340 млн. параметъра и отворени тегла, Apache 2.0, работи на CPU или в среда без мрежова свързаност.
  • Връща отговори, вероятности, увереност и метаданни за изпълнимостта.
  • Съвместното декодиране прилага правила между свързани отговори.
  • 60.1% средна стойност във вътрешния набор на Fastino от 17 набора от данни, водещ в 9 от тях.
  • 167.3 ms p50 на CPU, 38.3 ms на V100 при кратки входове.

Разгледайте техническите подробности и картата на модела. Всички заслуги принадлежат на изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit с над 150 хил. потребители и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.

Имате нужда да си партнирате с нас за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово издание, уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини