LandingAI пусна Agentic Document Extraction Gen2 с DPT-3 Pro и DPT-3 Verity
LandingAI пусна Agentic Document Extraction (ADE) Gen2 — преработена система за интелигентна обработка на документи, изградена около ново семейство модели, наречено DPT-3. Gen1 разглеждаше документа като плосък списък от фрагменти. Gen2 го разглежда като дърво, таксува според броя символи, които връща, вместо според броя страници, и свързва всеки отговор с конкретен ред или дума на страницата. Екипът на LandingAI представя изданието около три основни теми: достъпност, готови за агенти резултати и атомарно заземяване.
Може ли да се внедри? Да. ADE Gen2 вече е общодостъпен. Разработчиците могат да започнат безплатно в ADE playground. Предприятията могат да го използват в облака на US или EU, в собствен VPC в AWS, Azure или Google Cloud, в Snowflake или локално, включително в среди без мрежова свързаност.
Два модела за парсинг вместо един
Gen2 разделя парсинга между два модела, така че натоварването определя цената. DPT-3 Verity транскрибира цифрово създадени документи детерминистично и връща ограничителна рамка и оценка за достоверност за всяка дума. Той е предназначен за големи обеми текст, таблици и прости полета във формуляри. DPT-3 Pro първо анализира оформлението на страницата, а след това думите, открива типове блокове — от таблици и фигури до бележки в полетата и подписи — връща ги в реда на четене и обработва сканирани страници, ръкописен текст, нелатински писмености и математически формули на LaTeX. Екипът на LandingAI посочва, че DPT-3 Verity таксува приблизително 40% от кредитите, които таксува DPT-3 Pro, и също така заявява, че автоматичното насочване между двата модела е планирано за есента на 2026 г.
Промяната в ценообразуването е същинската новина
При DPT-2 всяка страница струваше фиксирани 3 кредита. При DPT-3 потреблението на кредити е сбор от компонент за страницата и компонент за броя изходни символи. При приоритетното ниво DPT-3 Pro таксува 1 кредит на страница плюс 0,5 кредита на всеки 1000 изходни символа. DPT-3 Verity таксува 0,3 кредита на страница плюс 0,2 кредита на всеки 1000 изходни символа. При стандартното ниво и двете ставки са наполовина, така че парсинг на 12 страници с Pro, който връща 48 120 символа, струва 36,1 кредита приоритетно и приблизително наполовина при стандартното ниво. Общите стойности се закръглят нагоре до най-близките 0,1 кредита, а метаданните в отговора показват всеки входен параметър, използван в изчислението.
Нивата на услугата са вторият фактор. Приоритетното ниво е за случаите, когато човек или агент чака. Стандартното работи асинхронно на цена 0,5x и е подходящо за процеси, които могат да изчакат от минути до часове. Имайте предвид, че синхронните заявки винаги се таксуват по приоритетната ставка, а самият playground работи с приоритетна ставка. LandingAI прогнозира намаляване на разходите с 25% до 80% при смесени натоварвания и твърди, че парсингът с Verity при стандартното ниво струва под един цент на страница. Приемайте тези стойности като данни от доставчика, докато не направите собствен сравнителен тест с вашия набор от документи, тъй като компонентът за символите означава, че плътна страница може да струва повече отпреди.
Блокове, а не фрагменти
Отговорът на Parse v2 има три полета от най-високо ниво: markdown в реда на четене, metadata и structure. Структурата представлява възел на документа, чиито деца са страниците, а децата на страниците са блокове. Типовете блокове включват text, table, table_cell, figure, marginalia, attestation, logo, card и scan_code. Всеки блок съдържа семантичен идентификатор във формат type-index, стабилен в рамките на един отговор, но не и при повторен парсинг, както и обект за заземяване с номера на страницата, диапазон в низа Markdown и нормализирана ограничителна рамка.
Изходът в Markdown също е стандартизиран. Фигурите използват елементи в стил <figure type="CHART">, като генерираният текст е изолиран в тагове <description>, така че транскрипцията никога да не се бърка с коментар от модела. Атестациите извеждат подредени един под друг етикети като [STAMPED][SIGNED], а [ILLEGIBLE_SIGNATURE] и [ILLEGIBLE_TEXT] са фиксирани литерали. По подразбиране таблиците се предоставят като HTML, за да се запазят обединените клетки.
Атомарно заземяване и какво позволява то
Атомарното заземяване е най-значимата възможност в това издание. Всеки краен блок съдържа масив atomic_grounding: по един запис за всеки визуален ред при DPT-3 Pro и по един запис за всяка дума при DPT-3 Verity. Verity прикачва стойност за достоверност от 0 до 1 към всяка дума, изчислена като най-ниската оценка за отделен символ в думата, което дава на екипите сигнал за насочване на несигурните транскрипции към проверка. Клетките на таблиците вече имат собствени ограничителни рамки, макар че Pro оставя атомарното заземяване на ниво клетка празно. Extract V2 извлича цитатите от това заземяване, така че извлеченото поле може да бъде проследено до конкретна дума на конкретна страница. Това прави възможни маскирането на лични данни по координати, сравняването на документи и изграждането на интерфейси за проверяващи, вместо те да бъдат само приблизителни.
Интерактивно обяснение
Основни изводи
- DPT-3 Pro и DPT-3 Verity (публична предварителна версия) заменят DPT-2 като модели за парсинг.
- Таксуването за Parse вече се състои от ставка на страница плюс ставка за изходните символи, а не от фиксирани 3 кредита на страница.
- DPT-3 Pro осъществява заземяване до ниво ред, а DPT-3 Verity — до ниво дума с оценка за достоверност.
- Фрагментите са премахнати; отговорът представлява дърво от документ, страница и блокове със стабилни идентификатори.
- Кодът на клиента за Gen1 няма да работи с крайните точки на Gen2, така че е необходима миграция.
Вижте техническите подробности тук. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! Имате ли Telegram? Вече можете да се присъедините към нас и в Telegram.
Искате да си партнирате с нас за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово издание, уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.