Knowledgator випускає GLiFormer: енкодер із 575 млн параметрів, що досягає 91,10 F1 під час вилучення вкладеного JSON без генерування токенів
Knowledgator Engineering випустила GLiFormer — фреймворк енкодера, обумовлений схемою, для вилучення інформації. Одна модель працює з розпізнаванням іменованих сутностей (NER), класифікацією тексту, вилученням зв’язків, структуруванням вкладених JSON-даних і текстовими ембедингами. Під час інференсу ви передаєте мітки та схеми вилучення. На Hugging Face доступні два чекпойнти. GLiFormer Base v1 має 264,2 млн параметрів, а GLiFormer Large v1 — 575,6 млн.
Можна розгортати вже сьогодні? Так. Обидва чекпойнти ліцензовані за Apache 2.0, встановлюються командою pip install gliformer і працюють на CPU або GPU.
Проблема, яку він вирішує
Стек вилучення часто об’єднує окремі моделі. Одна розпізнає сутності, інша класифікує документи, а третя відновлює записи. Дослідницька команда стверджує, що ці завдання мають спільну базову операцію. Закодувати джерело, представити запитані концепції, а потім оцінити їхню сумісність.
LLM можуть генерувати вкладений JSON, але вони створюють назви полів, розділові знаки та значення токен за токеном. GLiFormer прибирає генерацію вихідних даних із цього процесу.
Як працює GLiFormer
GLiFormer побудований на основі GLiNER і узагальнює зіставлення міток за допомогою «якоря». Якір — це об’єкт, відносно якого оцінюється кожна мітка під час виконання. Це може бути груповий вектор для класифікації, пара сутностей для зв’язків або слот запису.
Джерело кодується один раз. Після цього кілька схем для одного документа виконуються як локальні для завдання групи на основі спільного кодування. Обчислення на голові все одно зростають зі збільшенням кількості груп, міток і якорів.
Для NER голова оцінює свідчення початку, кінця та внутрішньої частини для кожної пари токен-мітка. Незалежні виходи сигмоїди дають змогу співіснувати вкладеним згадкам і спільним межам.
Структурування відбувається у 4 етапи:
- Прив’язати значення полів до спанів, узятих безпосередньо з тексту джерела.
- Призначити спани невпорядкованим слотам записів за допомогою навчання з угорським зіставленням.
- Передбачити спрямовані зв’язки «батько-дитина», обмежені шляхами, дозволеними схемою.
- Зібрати вкладений JSON за допомогою детермінованого декодера.
Значення є спанами джерела, тому модель не може вигадати текст значення, якого немає у вхідних даних. Вибір спанів, призначення записів і ієрархія все одно можуть бути помилковими.
Чекпойнти та навчання
Обидва чекпойнти v1 використовують тип моделі gliformer-layout із 5 головами: NER, класифікація, спільні зв’язки, багаторівневе структурування та ембединги. У кожному налаштовано максимальну ширину спана 12 слів і 100 якорів записів. Повні специфікації наведено в документації щодо попередньо навчених моделей.
| Специфікація | Base v1 | Large v1 |
|---|---|---|
| Параметри | 264,2 млн | 575,6 млн |
| Шари енкодера | 12 | 24 |
| Розмірність ембедингів | 768 | 1024 |
Налаштований max_len | 16 384 | 8 192 |
GLiFormer-base починається з бекбону DeBERTa, додатково попередньо навченого на 100 мільярдах токенів. У статті задокументовано 1 357 671 приклад для широкого багатозадачного навчання та 372 090 для цільового донавчання.
Бенчмарки
Усі наведені нижче результати повідомлені Knowledgator.
- Вкладений JSON (500 прикладів): Large набирає 91,10 F1, а Base — 87,20. GPT-5.6-luna набирає 91,96, а GPT-5-mini — 82,56. Метрика не залежить від порядку та допускає похибку меж, а не вимагає точного збігу JSON.
- Класифікація (13 наборів даних): Large досягає середнього macro-F1 75,03, а Base — 72,36. GLiNER2.5 набирає 64,89, тоді як GPT-5-mini лідирує з результатом 79,79.
- CrossNER (5 доменів): Base у середньому набирає 65,10 F1, а Large — 64,35. Gemma-4-31B-IT досягає 70,74.
- Зв’язки (4 бенчмарки): Large у середньому набирає 21,33 micro-F1, а Base — 18,94. GLiNER-Relex досягає 25,6, а Gemma-4-31B-IT — 25,08.
Для сукупних показників NER і класифікації у статті зазначено, що Large перевершує Gemma-4-E4B, маючи приблизно у 14 разів менше параметрів.
Швидкість без генерації токенів
Knowledgator виміряла GLiFormer-base на 40 документах для структурування з розміром батчу 1. Медіанна затримка на GPU NVIDIA RTX PRO 6000 Blackwell у FP16 становила 69 мс. На 8-потоковому CPU AMD EPYC 9B45 у FP32 вона становила 547 мс.
Ключова заява про «до 95,8 раза швидше» є аналітичною оцінкою, а не результатом вимірювання запуску LLM. Вона передбачає попереднє заповнення зі швидкістю 2 000 вхідних токенів за секунду та генерацію зі швидкістю 60 вихідних токенів за секунду. Вона не враховує черги, мережеві затримки та приховане міркування й не робить жодних припущень щодо рівності точності.
Як використовувати
Репозиторій на GitHub і картка моделі демонструють короткий виклик для структурування:
records = model.structure(
"Alice works at Acme.",
{"employee": ["name", "company"]},
)
print(records)
# {'employee': [{'name': 'Alice', 'company': 'Acme'}]}Вкладені схеми Pydantic працюють із багаторівневими записами. Один виклик inference також може одночасно виконувати розпізнавання сутностей, класифікацію та структурування. Для зв’язків використовуйте joint_relations, оскільки у чекпойнтах v1 немає відкритої голови зв’язків.
Основні висновки
- GLiFormer виконує NER, класифікацію, вилучення зв’язків, створення вкладеного JSON та побудову ембедингів на одному енкодері.
- Large досягає 91,10 F1 для структурування, майже наближаючись до GPT-5.6-luna з результатом 91,96.
- Base демонструє медіанну затримку на GPU 69 мс без жодного згенерованого вихідного токена.
- Вилучення зв’язків усе ще поступається GLiNER-Relex і більшим LLM.
- Ваги Apache 2.0 встановлюються через pip і дають змогу розміщувати модель самостійно на CPU або GPU.
Перегляньте статтю, ваги моделі, репозиторій на GitHub та документацію. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субредіту 150k+ ML та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію на GitHub, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.