Knowledgator пуска GLiFormer: енкодер с 575 млн. параметра, постигнал 91,10 F1 при извличане на вложен JSON без генериране на токени
Knowledgator Engineering пусна GLiFormer — рамка за кодиране, обусловена от схема, за извличане на информация. Един модел обработва разпознаване на именувани обекти (NER), класификация на текст, извличане на релации, структуриране в структуриран JSON с вложени нива и текстови вграждания. По време на инференция подавате етикети и схеми за извличане. В Hugging Face са налични две контролни точки. GLiFormer Base v1 има 264.2M параметъра, а GLiFormer Large v1 има 575.6M.
Може ли да се внедри днес? Да. И двете контролни точки са лицензирани под Apache 2.0, инсталират се с pip install gliformer и работят на CPU или GPU.
Проблемът, към който е насочен
Стековете за извличане често свързват отделни модели. Един маркира обекти, друг класифицира документи, а трети възстановява записи. Изследователският екип твърди, че тези задачи споделят една основна операция. Кодирате източника, представяте заявените концепции, след което оценявате съвместимостта им.
LLM моделите могат да генерират вложен JSON, но генерират имената на полетата, пунктуацията и стойностите токен по токен. GLiFormer премахва генерирането на изход от този процес.
Как работи GLiFormer
GLiFormer е изграден върху GLiNER и обобщава съпоставянето на етикети чрез „котва“. Котвата е обектът, спрямо който се оценява всеки етикет по време на изпълнение. Тя може да бъде групов вектор за класификация, двойка обекти за релации или слот в запис.
Източникът се кодира веднъж. След това множество схеми за един и същ документ се изпълняват като локални за задачата групи върху това споделено кодиране. Изчисленията в главата все пак нарастват с броя на групите, етикетите и котвите.
За NER главата оценява доказателства за начало, край и вътрешност за всяка двойка токен и етикет. Независимите сигмоидни изходи позволяват на вложени споменавания и споделени граници да съществуват едновременно.
Структурирането протича на 4 етапа:
- Заземяване на стойностите на полетата като спанове, взети директно от изходния текст.
- Присвояване на спанове към неупорядъчени слотове на записи, обучено чрез унгарско съпоставяне.
- Предвиждане на насочени връзки родител-дете, ограничени до позволените от схемата пътища.
- Сглобяване на вложен JSON с детерминиран декодер.
Стойностите са спанове от източника, така че моделът не може да измисля текст на стойност, който липсва във входа. Изборът на спанове, присвояването на записи и йерархията все пак могат да бъдат грешни.
Контролни точки и обучение
И двете контролни точки v1 използват типа модел gliformer-layout с 5 глави: NER, класификация, съвместни релации, многостепенно структуриране и вграждания. Всяка е конфигурирана с максимална ширина на спана от 12 думи и 100 котви за записи. Пълните спецификации са в документацията за предварително обучените модели.
| Спецификация | Base v1 | Large v1 |
|---|---|---|
| Параметри | 264.2M | 575.6M |
| Слоеве на кодера | 12 | 24 |
| Размерност на вграждането | 768 | 1024 |
Конфигуриран max_len | 16,384 | 8,192 |
GLiFormer-base започва от гръбнака DeBERTa, допълнително предварително обучен върху 100 милиарда токена. В статията са документирани 1,357,671 примера за широко многостранно обучение и 372,090 за последващо обучение, фокусирано върху задачите.
Бенчмаркове
Всички оценки по-долу са докладвани от Knowledgator.
- Вложен JSON (500 примера): Large постига 91.10 F1, а Base — 87.20. GPT-5.6-luna постига 91.96, а GPT-5-mini — 82.56. Метриката не зависи от реда и допуска отклонения в границите, а не изисква точно съвпадение на JSON.
- Класификация (13 набора от данни): Large достига среден macro-F1 от 75.03, а Base — 72.36. GLiNER2.5 постига 64.89, докато GPT-5-mini води със 79.79.
- CrossNER (5 области): Base има средно 65.10 F1, а Large — 64.35. Gemma-4-31B-IT достига 70.74.
- Релации (4 бенчмарка): Large има средно 21.33 micro-F1, а Base — 18.94. GLiNER-Relex достига 25.6, а Gemma-4-31B-IT — 25.08.
При обобщените резултати за NER и класификация статията посочва, че Large превъзхожда Gemma-4-E4B с около 14 пъти по-малко параметри.
Скорост без генериране на токени
Knowledgator е измерил времето на GLiFormer-base върху 40 документа за структуриране при размер на партидата 1. Медианната латентност е била 69 ms на GPU NVIDIA RTX PRO 6000 Blackwell във FP16. На 8-нишков CPU AMD EPYC 9B45 във FP32 тя е била 547 ms.
Ключовото твърдение за „до 95.8× по-бързо“ е аналитична оценка, а не измерване при изпълнение на LLM. То приема предварително запълване със скорост 2 000 входни токена в секунда и генериране със скорост 60 изходни токена в секунда. Не включва изчакване в опашка, мрежово забавяне и скрито разсъждение и не предполага никакво равенство по отношение на точността.
Използване
GitHub хранилището и картата на модела показват кратък извикващ код за структуриране:
records = model.structure(
"Alice works at Acme.",
{"employee": ["name", "company"]},
)
print(records)
# {'employee': [{'name': 'Alice', 'company': 'Acme'}]}Вложените Pydantic схеми работят за многостепенни записи. Едно извикване на inference може също да изпълнява едновременно извличане на обекти, класове и структури. Използвайте joint_relations за релации, тъй като контролните точки v1 не разполагат с отворена глава за релации.
Основни изводи
- GLiFormer изпълнява NER, класификация, извличане на релации, вложен JSON и вграждания върху един кодер.
- Large постига 91.10 F1 при структуриране, близо до 91.96 на GPT-5.6-luna.
- Base отчита медианна GPU латентност от 69 ms без генериране на нито един изходен токен.
- Извличането на релации все още изостава от GLiNER-Relex и по-големите LLM модели.
- Теглата под Apache 2.0 се инсталират чрез pip и могат да се хостват самостоятелно на CPU или GPU.
Разгледайте статията, теглата на модела, GitHub хранилището и документацията. Всички заслуги са за изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище, страница в Hugging Face, представяне на продукт, уебинар и др.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.