LandingAI випустила Agentic Document Extraction Gen2 із DPT-3 Pro та DPT-3 Verity
LandingAI випустила Agentic Document Extraction (ADE) Gen2 — перебудовану систему інтелектуального аналізу документів на основі нового сімейства моделей під назвою DPT-3. Gen1 розглядала документ як плаский список фрагментів. Gen2 розглядає його як дерево, розраховує вартість за кількістю повернених символів, а не сторінок, і прив’язує кожну відповідь до конкретного рядка або слова на сторінці. Команда LandingAI описує цей реліз через три основні теми: доступність, готові для агентів результати та атомарне заземлення.
Чи можна її розгортати? Так. ADE Gen2 уже загальнодоступна. Розробники можуть безкоштовно почати роботу в середовищі ADE. Підприємства можуть запускати її в хмарі США або ЄС, у власному VPC на AWS, Azure чи Google Cloud, усередині Snowflake або локально, зокрема в ізольованих середовищах без доступу до мережі.
Дві моделі аналізу замість однієї
Gen2 розділяє аналіз між двома моделями, щоб робоче навантаження визначало ціну. DPT-3 Verity детерміновано транскрибує цифрові документи та повертає обмежувальну рамку й оцінку впевненості для кожного слова. Вона призначена для великого обсягу тексту, таблиць і простих полів форм. DPT-3 Pro спочатку аналізує макет сторінки, а потім слова, визначає типи блоків — від таблиць і рисунків до приміток на полях і підписів — повертає їх у порядку читання та працює зі сканованими сторінками, рукописним текстом, нелатинськими системами письма й математикою LaTeX. Команда LandingAI стверджує, що DPT-3 Verity коштує приблизно 40% кредитів, які стягує DPT-3 Pro, а також повідомляє, що автоматичну маршрутизацію між ними планують запустити восени 2026 року.
Зміна ціноутворення — головна новина
У DPT-2 кожна сторінка коштувала фіксовані 3 кредити. У DPT-3 споживання кредитів є сумою складової за сторінку та складової за кількість символів у результаті. На пріоритетному рівні DPT-3 Pro стягує 1 кредит за сторінку плюс 0,5 кредиту за кожні 1 000 символів у результаті. DPT-3 Verity стягує 0,3 кредиту за сторінку плюс 0,2 кредиту за кожні 1 000 символів у результаті. Стандартний рівень удвічі зменшує обидві ставки, тож аналіз 12-сторінкового документа за допомогою Pro, який повертає 48 120 символів, коштує 36,1 кредиту на пріоритетному рівні й приблизно вдвічі менше на стандартному. Підсумки округлюються до найближчих 0,1 кредиту, а метадані відповіді містять усі вхідні дані розрахунку.
Рівні обслуговування — другий важіль. Пріоритетний рівень призначений для випадків, коли на результат очікує людина або агент. Стандартний рівень працює асинхронно за ціною 0,5x і підходить для конвеєрів, які допускають очікування від кількох хвилин до кількох годин. Зверніть увагу: синхронні виклики завжди оплачуються за пріоритетною ставкою, а саме середовище працює на пріоритетному рівні. LandingAI прогнозує зниження витрат на 25–80% для змішаних робочих навантажень і заявляє, що аналіз за допомогою Verity на стандартному рівні коштує менше одного цента за сторінку. Вважайте це даними постачальника, доки не протестуєте власний набір документів, оскільки складова за кількість символів означає, що насичена сторінка може коштувати дорожче, ніж раніше.
Блоки, а не фрагменти
Відповідь Parse v2 має три поля верхнього рівня: markdown у порядку читання, metadata і structure. Структура є вузлом документа, дочірніми елементами якого є сторінки, а дочірніми елементами сторінок — блоки. Типи блоків включають text, table, table_cell, figure, marginalia, attestation, logo, card і scan_code. Кожен блок має семантичний ідентифікатор у форматі type-index, стабільний у межах відповіді, але не між повторними запусками аналізу, а також об’єкт заземлення з номером сторінки, діапазоном у рядку markdown і нормалізованою обмежувальною рамкою.
Вивід у форматі Markdown також стандартизовано. Рисунки використовують елементи на кшталт <figure type="CHART">, а згенерований опис ізольовано всередині тегів <description>, щоб транскрипцію ніколи не плутали з коментарями моделі. Для засвідчень виводяться послідовні мітки, як-от [STAMPED][SIGNED], а [ILLEGIBLE_SIGNATURE] і [ILLEGIBLE_TEXT] використовуються як фіксовані літерали. За замовчуванням таблиці надходять у форматі HTML, щоб зберегти об’єднані комірки.
Атомарне заземлення та його можливості
Атомарне заземлення — найважливіша можливість цього релізу. Кожен кінцевий блок містить масив atomic_grounding: по одному елементу на кожен візуальний рядок у DPT-3 Pro і по одному елементу на кожне слово в DPT-3 Verity. Verity додає значення впевненості від 0 до 1 для кожного слова, обчислене як найнижча оцінка для окремого символу в цьому слові, надаючи командам сигнал для передавання неточних транскрипцій на перевірку. Тепер комірки таблиць мають власні обмежувальні рамки, хоча Pro не заповнює атомарне заземлення на рівні комірок. Extract V2 створює цитати на основі цього заземлення, тож витягнуте поле можна простежити до конкретного слова на конкретній сторінці. Це робить можливими редагування персональних даних за координатами, порівняння документів і інтерфейси для перевірки, а не їх приблизні аналоги.
Інтерактивне пояснення
Основні висновки
- DPT-3 Pro і DPT-3 Verity (публічна попередня версія) замінюють DPT-2 як моделі аналізу.
- Тепер оплата за Parse складається зі ставки за сторінку та ставки за кількість символів у результаті, а не з фіксованих 3 кредитів за сторінку.
- DPT-3 Pro виконує заземлення до рівня рядка, а DPT-3 Verity — до рівня слова з оцінкою впевненості.
- Фрагменти скасовано; відповідь являє собою дерево документа, сторінок і блоків зі стабільними ідентифікаторами.
- Код клієнта Gen1 не працюватиме з кінцевими точками Gen2, тому потрібна міграція.
Ознайомтеся з технічними деталями тут. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання зі 150 тис.+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.