Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Fastino випустила GLiNER2.5-Decide: модель ухвалення рішень із відкритими вагами та 340 млн параметрів, що працює на CPU

Fastino Labs випустила GLiNER2.5-Decide — модель для ухвалення рішень із відкритими вагами та 340 млн параметрів. Вона отримує текст і схему типізованих запитань та повертає структуровані відповіді. Кожна відповідь містить розподіл імовірностей, показник упевненості та метадані щодо здійсненності обмежень. Модель орієнтована на типові рішення всередині конвеєрів агентів: маршрутизацію, тріаж, вибір інструментів і захисні механізми.

Чи придатна вона для розгортання? Так, ваги поширюються за ліцензією Apache 2.0, а встановлення виконується за допомогою pip install gliner2. Модель працює на CPU, GPU або в ізольованих від мережі середовищах. Команда Fastino також пропонує розміщений inference і донавчання через свій GLiNER API.

Що насправді робить GLiNER2.5-Decide

GLiNER2.5-Decide — це негenerative класифікатор. Він використовує енкодер DeBERTa-v3-large і донавчений на основі gliner2-large-v1. Модель не генерує токенів і не потребує шаблону промпту.

Набори міток передаються під час виклику. Кожне запитання у схемі визначає дозволені відповіді. Воно також визначає, чи очікує одну відповідь, кілька відповідей або впорядковане значення. Схеми можуть містити інструкції, приклади, описи міток і правила, що пов’язують відповіді між запитаннями.

Конвеєр має 2 етапи. Енкодер одночасно зчитує текст і схему та оцінює кожну дозволену відповідь. Потім декодер з обмеженнями шукає спільне призначення з найвищою оцінкою, яке допускають задані правила.

Fastino чітко визначає сферу застосування. Модель не міркує, не пояснює і не відповідає на відкриті запитання. Це спеціалізований інструмент для операційних рішень.

Чому спільне декодування має значення

Команда Fastino ілюструє цінність цього підходу на прикладі захисного механізму. Під час незалежного декодування модель виявила prompt injection з імовірністю 0,82. Водночас вона позначила той самий промпт як безпечний з імовірністю 0,52. Атаку було виявлено, але 2 результати суперечили один одному.

Спільне декодування застосовує правило, згідно з яким будь-яка виявлена шкода вимагає вердикту «небезпечно». Тоді модель повертає разом safety=unsafe і harm_type=prompt_injection. Наступний код може використовувати ці оцінки, щоб заблокувати, перенаправити або передати запит на ескалацію.

Схеми можуть виражати імплікації, взаємні виключення, обмеження кількості та порядкові межі. Той самий енкодер також може за один прямий прохід вилучати сутності, зв’язки та структуровані записи з позиціями на рівні символів. Відповіді класифікації не містять фрагментів доказів.

Результати тестування швидких рішень

Команда Fastino оцінила модель на Fast Decisions — внутрішньо згенерованому наборі даних для відкладеного тестування. Він містить 5 100 тестових прикладів у 17 наборах даних. Завдання охоплюють клієнтські операції, маршрутизацію за предметною областю (банківська справа, клінічна сфера, подорожі, пільги) та загальне розуміння контенту. Метрика — точність exact-match: прогноз зараховується лише тоді, коли його набір міток точно відповідає еталонному.

МодельТипСереднє
GLiNER2.5-DecideЕнкодер на 340 млн параметрів60,1%
JevK5Декодер Qwen3.5 класу 4B57,5%
SemIfДекодер Qwen3.5-4B56,4%
GLiFormer large-v1Однопрохідний енкодер49,0%
LayaЕнкодер ModernBERT на 421 млн параметрів46,6%

GLiNER2.5-Decide посіла перше місце у 9 із 17 наборів даних. Найсильнішою сферою стала маршрутизація намірів. Модель набрала 75,3% у визначенні намірів звернень до служби підтримки та 64,3% у визначенні банківських намірів. Це на 18,6 і 8,6 процентного пункта більше, ніж у наступних найкращих моделей.

Затримка: практичне використання на CPU

Команда Fastino протестувала чекпойнт від початку до кінця за розміру пакета 1 зі схемою на 2 голови та 15 міток. За довжини 64 токени затримка p50 становила:

  • 167,3 мс на 48-vCPU Intel Xeon Platinum 8581C
  • 43,6 мс на NVIDIA T4
  • 43,4 мс на NVIDIA L4
  • 38,3 мс на NVIDIA V100
  • 47,3 мс на NVIDIA A100

У коротких запитах переважають фіксовані витрати на попередню обробку та запуск ядер. Через це різниця між GPU становить не більше 9 мс. За довжини 1 024 токени A100 випереджає інші системи із результатом 52,6 мс проти 75,6 мс у V100 і 131,4 мс у L4.

Використання в коді

Цей виклик із кількома головами адаптовано з картки моделі:

Копіювати кодСкопійованоВикористати інший браузер
from gliner2 import AutoExtractor

model = AutoExtractor.from_pretrained("fastino/GLiNER2.5-Decide")

model.classify_text(
    "Please confirm the new retention rule is applied before Friday's audit.",
    {
        "intent": ["fyi", "request", "approval", "complaint"],
        "urgency": ["low", "normal", "high", "critical"],
        "route": ["support", "billing", "legal", "security"],
    },
)

Одноміткові голови повертають один рядок. Багатоміткові голови повертають кожну мітку вище за cls_threshold. Мітки можуть містити описи, а порядкові шкали передаються як звичайні рядки, наприклад «0» до «10».

Варіанти використання та сімейство моделей

Fastino орієнтує модель на маршрутизацію моделей, виклики інструментів, використання браузера та комп’ютера, захисні механізми, скорочення контексту, LLM-as-a-judge і симуляції. Донавчання працює локально, повністю або за допомогою LoRA, через тренер GLiNER2. Файл SKILL.md відкриває агентам для написання коду доступ до розміщеного робочого процесу.

Fastino також опублікувала GLiNER2.5-Decide-1B, побудовану на основі енкодера Ettin 1B. Вона набирає 59,6% на тому самому наборі, трохи поступаючись моделі на 340 млн параметрів. Для багатомовного введення Fastino рекомендує GLiNER2.5-multi-Decide — модель на 287 млн параметрів із результатом 56,7%. Базову архітектуру описано в статті про GLiNER2.

Головні висновки

  • Енкодер із відкритими вагами на 340 млн параметрів, Apache 2.0, працює на CPU або в ізольованому від мережі середовищі.
  • Повертає відповіді, імовірності, показник упевненості та метадані щодо здійсненності.
  • Спільне декодування забезпечує дотримання правил між пов’язаними відповідями.
  • Середній результат 60,1% на внутрішньому наборі Fastino із 17 наборів даних, перше місце у 9.
  • p50 становить 167,3 мс на CPU та 38,3 мс на V100 для коротких вхідних даних.

Ознайомтеся з технічними деталями та карткою моделі. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту ML із понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Потрібна співпраця з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини