Knowledgator выпускает GLiFormer: энкодер с 575 млн параметров, достигающий 91,10 F1 при извлечении вложенного JSON без генерации токенов
Knowledgator Engineering выпустила GLiFormer — фреймворк энкодера, обусловленного схемой, для извлечения информации. Одна модель выполняет распознавание именованных сущностей (NER), классификацию текста, извлечение связей, структурирование во вложенный JSON и создание текстовых эмбеддингов. На этапе инференса вы передаёте метки и схемы извлечения. На Hugging Face доступны две контрольные точки. GLiFormer Base v1 содержит 264,2 млн параметров, а GLiFormer Large v1 — 575,6 млн.
Можно ли развернуть уже сегодня? Да. Обе контрольные точки распространяются по лицензии Apache 2.0, устанавливаются с помощью pip install gliformer и работают на CPU или GPU.
Какие задачи решает модель
Стэки извлечения часто объединяют несколько отдельных моделей. Одна размечает сущности, другая классифицирует документы, а третья восстанавливает записи. Исследовательская команда утверждает, что эти задачи используют одну базовую операцию. Закодировать источник, представить запрошенные концепции, а затем оценить их совместимость.
LLM могут выдавать вложенный JSON, но генерируют имена полей, знаки пунктуации и значения токен за токеном. GLiFormer исключает генерацию выходных данных из этого процесса.
Как работает GLiFormer
GLiFormer создан на основе GLiNER и обобщает сопоставление меток с помощью «якоря». Якорь — это объект, с которым сопоставляется каждая метка во время выполнения. Им может быть групповой вектор для классификации, пара сущностей для связей или слот записи.
Источник кодируется один раз. Затем несколько схем для одного и того же документа обрабатываются как локальные группы задач на основе общего кодирования. При этом вычислительная нагрузка на головную часть всё равно растёт вместе с количеством групп, меток и якорей.
Для NER головная часть оценивает признаки начала, конца и нахождения внутри для каждой пары токен–метка. Независимые выходы сигмоиды позволяют сосуществовать вложенным упоминаниям и общим границам.
Структурирование выполняется в 4 этапа:
- Привязать значения полей к спанам, взятым непосредственно из исходного текста.
- Назначить спаны неупорядоченным слотам записей с обучением на основе сопоставления Венгерским алгоритмом.
- Предсказать направленные связи «родитель–потомок», ограниченные путями, разрешёнными схемой.
- Собрать вложенный JSON с помощью детерминированного декодера.
Значения являются спанами исходного текста, поэтому модель не может выдумать отсутствующий во входных данных текст значения. Однако выбор спанов, назначение записей и иерархия всё ещё могут быть ошибочными.
Контрольные точки и обучение
Обе контрольные точки v1 используют тип модели gliformer-layout с 5 головными частями: NER, классификация, совместное извлечение связей, многоуровневое структурирование и эмбеддинги. В каждой задана максимальная ширина спана в 12 слов и 100 якорей записей. Полные спецификации приведены в документации по предварительно обученным моделям.
| Параметр | Base v1 | Large v1 |
|---|---|---|
| Параметры | 264,2 млн | 575,6 млн |
| Слои энкодера | 12 | 24 |
| Размерность эмбеддинга | 768 | 1024 |
Заданный max_len | 16 384 | 8 192 |
GLiFormer-base создан на основе DeBERTa, дополнительно предварительно обученной на 100 млрд токенов. В статье документированы 1 357 671 пример для широкого многозадачного обучения и 372 090 примеров для последующего обучения, ориентированного на конкретные задачи.
Бенчмарки
Все приведённые ниже показатели представлены Knowledgator.
- Вложенный JSON (500 примеров): Large набирает 91,10 F1, а Base — 87,20. GPT-5.6-luna набирает 91,96, а GPT-5-mini — 82,56. Метрика не зависит от порядка и допускает неточное совпадение границ, а не требует точного совпадения JSON.
- Классификация (13 наборов данных): Large достигает среднего macro-F1 75,03, а Base — 72,36. GLiNER2.5 набирает 64,89, тогда как GPT-5-mini лидирует с результатом 79,79.
- CrossNER (5 предметных областей): Средний результат Base составляет 65,10 F1, а Large — 64,35. Gemma-4-31B-IT достигает 70,74.
- Связи (4 бенчмарка): Средний результат Large составляет 21,33 micro-F1, а Base — 18,94. GLiNER-Relex набирает 25,6, а Gemma-4-31B-IT — 25,08.
Для совокупных показателей NER и классификации в статье сообщается, что Large превосходит Gemma-4-E4B, имея примерно в 14 раз меньше параметров.
Скорость без генерации токенов
Knowledgator измерила GLiFormer-base на 40 документах для структурирования при размере батча 1. Медианная задержка составила 69 мс на GPU NVIDIA RTX PRO 6000 Blackwell в FP16. На 8-поточном CPU AMD EPYC 9B45 в FP32 она составила 547 мс.
Ключевой показатель «до 95,8 раза быстрее» является аналитической оценкой, а не результатом измерений запуска LLM. В нём предполагается предварительное заполнение со скоростью 2 000 входных токенов в секунду и генерация со скоростью 60 выходных токенов в секунду. Оценка не учитывает постановку в очередь, сетевые задержки и скрытое рассуждение, а также ничего не предполагает относительно равенства точности.
Использование
Репозиторий на GitHub и карточка модели демонстрируют короткий вызов структурирования:
records = model.structure(
"Alice works at Acme.",
{"employee": ["name", "company"]},
)
print(records)
# {'employee': [{'name': 'Alice', 'company': 'Acme'}]}Вложенные схемы Pydantic работают с многоуровневыми записями. Один вызов inference также может одновременно обрабатывать сущности, классы и структуры. Для связей используйте joint_relations, поскольку в контрольных точках v1 отсутствует открытая головная часть для связей.
Ключевые выводы
- GLiFormer выполняет NER, классификацию, извлечение связей, создание вложенного JSON и формирование эмбеддингов на одном энкодере.
- Large достигает 91,10 F1 при структурировании, почти сравниваясь с GPT-5.6-luna, результат которого составляет 91,96.
- Для Base заявлена медианная задержка на GPU 69 мс при нулевом количестве сгенерированных выходных токенов.
- Извлечение связей всё ещё уступает GLiNER-Relex и более крупным LLM.
- Веса по лицензии Apache 2.0 устанавливаются через pip и позволяют развернуть модель самостоятельно на CPU или GPU.
Ознакомьтесь с статьёй, весами модели, репозиторием на GitHub и документацией. Вся благодарность исследователю этого проекта. Также не стесняйтесь подписаться на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с аудиторией более 150 тысяч участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? Теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория на GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.