Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Knowledgator выпускает GLiFormer: энкодер с 575 млн параметров, достигающий 91,10 F1 при извлечении вложенного JSON без генерации токенов

Knowledgator Engineering выпустила GLiFormer — фреймворк энкодера, обусловленного схемой, для извлечения информации. Одна модель выполняет распознавание именованных сущностей (NER), классификацию текста, извлечение связей, структурирование во вложенный JSON и создание текстовых эмбеддингов. На этапе инференса вы передаёте метки и схемы извлечения. На Hugging Face доступны две контрольные точки. GLiFormer Base v1 содержит 264,2 млн параметров, а GLiFormer Large v1 — 575,6 млн.

Можно ли развернуть уже сегодня? Да. Обе контрольные точки распространяются по лицензии Apache 2.0, устанавливаются с помощью pip install gliformer и работают на CPU или GPU.

Какие задачи решает модель

Стэки извлечения часто объединяют несколько отдельных моделей. Одна размечает сущности, другая классифицирует документы, а третья восстанавливает записи. Исследовательская команда утверждает, что эти задачи используют одну базовую операцию. Закодировать источник, представить запрошенные концепции, а затем оценить их совместимость.

LLM могут выдавать вложенный JSON, но генерируют имена полей, знаки пунктуации и значения токен за токеном. GLiFormer исключает генерацию выходных данных из этого процесса.

Как работает GLiFormer

GLiFormer создан на основе GLiNER и обобщает сопоставление меток с помощью «якоря». Якорь — это объект, с которым сопоставляется каждая метка во время выполнения. Им может быть групповой вектор для классификации, пара сущностей для связей или слот записи.

Источник кодируется один раз. Затем несколько схем для одного и того же документа обрабатываются как локальные группы задач на основе общего кодирования. При этом вычислительная нагрузка на головную часть всё равно растёт вместе с количеством групп, меток и якорей.

Для NER головная часть оценивает признаки начала, конца и нахождения внутри для каждой пары токен–метка. Независимые выходы сигмоиды позволяют сосуществовать вложенным упоминаниям и общим границам.

Структурирование выполняется в 4 этапа:

  1. Привязать значения полей к спанам, взятым непосредственно из исходного текста.
  2. Назначить спаны неупорядоченным слотам записей с обучением на основе сопоставления Венгерским алгоритмом.
  3. Предсказать направленные связи «родитель–потомок», ограниченные путями, разрешёнными схемой.
  4. Собрать вложенный JSON с помощью детерминированного декодера.

Значения являются спанами исходного текста, поэтому модель не может выдумать отсутствующий во входных данных текст значения. Однако выбор спанов, назначение записей и иерархия всё ещё могут быть ошибочными.

Контрольные точки и обучение

Обе контрольные точки v1 используют тип модели gliformer-layout с 5 головными частями: NER, классификация, совместное извлечение связей, многоуровневое структурирование и эмбеддинги. В каждой задана максимальная ширина спана в 12 слов и 100 якорей записей. Полные спецификации приведены в документации по предварительно обученным моделям.

ПараметрBase v1Large v1
Параметры264,2 млн575,6 млн
Слои энкодера1224
Размерность эмбеддинга7681024
Заданный max_len16 3848 192

GLiFormer-base создан на основе DeBERTa, дополнительно предварительно обученной на 100 млрд токенов. В статье документированы 1 357 671 пример для широкого многозадачного обучения и 372 090 примеров для последующего обучения, ориентированного на конкретные задачи.

Бенчмарки

Все приведённые ниже показатели представлены Knowledgator.

  • Вложенный JSON (500 примеров): Large набирает 91,10 F1, а Base — 87,20. GPT-5.6-luna набирает 91,96, а GPT-5-mini — 82,56. Метрика не зависит от порядка и допускает неточное совпадение границ, а не требует точного совпадения JSON.
  • Классификация (13 наборов данных): Large достигает среднего macro-F1 75,03, а Base — 72,36. GLiNER2.5 набирает 64,89, тогда как GPT-5-mini лидирует с результатом 79,79.
  • CrossNER (5 предметных областей): Средний результат Base составляет 65,10 F1, а Large — 64,35. Gemma-4-31B-IT достигает 70,74.
  • Связи (4 бенчмарка): Средний результат Large составляет 21,33 micro-F1, а Base — 18,94. GLiNER-Relex набирает 25,6, а Gemma-4-31B-IT — 25,08.

Для совокупных показателей NER и классификации в статье сообщается, что Large превосходит Gemma-4-E4B, имея примерно в 14 раз меньше параметров.

Скорость без генерации токенов

Knowledgator измерила GLiFormer-base на 40 документах для структурирования при размере батча 1. Медианная задержка составила 69 мс на GPU NVIDIA RTX PRO 6000 Blackwell в FP16. На 8-поточном CPU AMD EPYC 9B45 в FP32 она составила 547 мс.

Ключевой показатель «до 95,8 раза быстрее» является аналитической оценкой, а не результатом измерений запуска LLM. В нём предполагается предварительное заполнение со скоростью 2 000 входных токенов в секунду и генерация со скоростью 60 выходных токенов в секунду. Оценка не учитывает постановку в очередь, сетевые задержки и скрытое рассуждение, а также ничего не предполагает относительно равенства точности.

Использование

Репозиторий на GitHub и карточка модели демонстрируют короткий вызов структурирования:

Копировать кодСкопированоИспользовать другой браузер
records = model.structure(
    "Alice works at Acme.",
    {"employee": ["name", "company"]},
)
print(records)
# {'employee': [{'name': 'Alice', 'company': 'Acme'}]}

Вложенные схемы Pydantic работают с многоуровневыми записями. Один вызов inference также может одновременно обрабатывать сущности, классы и структуры. Для связей используйте joint_relations, поскольку в контрольных точках v1 отсутствует открытая головная часть для связей.

Ключевые выводы

  • GLiFormer выполняет NER, классификацию, извлечение связей, создание вложенного JSON и формирование эмбеддингов на одном энкодере.
  • Large достигает 91,10 F1 при структурировании, почти сравниваясь с GPT-5.6-luna, результат которого составляет 91,96.
  • Для Base заявлена медианная задержка на GPU 69 мс при нулевом количестве сгенерированных выходных токенов.
  • Извлечение связей всё ещё уступает GLiNER-Relex и более крупным LLM.
  • Веса по лицензии Apache 2.0 устанавливаются через pip и позволяют развернуть модель самостоятельно на CPU или GPU.

Ознакомьтесь с статьёй, весами модели, репозиторием на GitHub и документацией. Вся благодарность исследователю этого проекта. Также не стесняйтесь подписаться на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с аудиторией более 150 тысяч участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? Теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория на GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости