Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

LandingAI выпустила Agentic Document Extraction Gen2 с DPT-3 Pro и DPT-3 Verity

LandingAI выпустила Agentic Document Extraction (ADE) Gen2 — переработанный стек интеллектуальной обработки документов на основе нового семейства моделей под названием DPT-3. Gen1 рассматривала документ как плоский список фрагментов. Gen2 представляет его в виде дерева, рассчитывает стоимость по количеству возвращаемых символов, а не страниц, и привязывает каждый ответ к конкретной строке или слову на странице. Команда LandingAI описывает выпуск через три ключевые темы: доступность, готовые для агентов результаты и атомарная привязка.

Можно ли развернуть решение? Да. ADE Gen2 уже доступна для общего использования. Разработчики могут начать бесплатно в песочнице ADE. Корпоративные клиенты могут запускать решение в облаке США или ЕС, в собственной VPC на AWS, Azure или Google Cloud, внутри Snowflake либо локально, включая изолированные среды без доступа к внешним сетям.

Две модели парсинга вместо одной

Gen2 разделяет парсинг между двумя моделями, чтобы стоимость зависела от типа нагрузки. DPT-3 Verity детерминированно расшифровывает цифровые документы и возвращает ограничивающую рамку и показатель уверенности для каждого слова. Она предназначена для обработки больших объёмов текста, таблиц и простых полей форм. DPT-3 Pro сначала анализирует структуру страницы, а затем слова, определяет типы блоков — от таблиц и рисунков до примечаний на полях и подписей, — возвращает их в порядке чтения и работает со сканированными страницами, рукописным текстом, нелатинскими письменностями и математическими формулами LaTeX. Команда LandingAI утверждает, что DPT-3 Verity расходует примерно 40% кредитов, необходимых DPT-3 Pro, а автоматическая маршрутизация между двумя моделями запланирована на осень 2026 года.

Изменение модели ценообразования — главная новость

В DPT-2 каждая страница стоила фиксированные 3 кредита. В DPT-3 расход кредитов складывается из компонента страницы и компонента выходных символов. На приоритетном уровне DPT-3 Pro списывает 1 кредит за страницу плюс 0,5 кредита за каждые 1 000 выходных символов. DPT-3 Verity списывает 0,3 кредита за страницу плюс 0,2 кредита за каждые 1 000 выходных символов. На стандартном уровне обе ставки уменьшаются вдвое, поэтому разбор 12-страничного документа с помощью Pro, возвращающий 48 120 символов, стоит 36,1 кредита на приоритетном уровне и примерно вдвое меньше на стандартном. Итоговые значения округляются в большую сторону до ближайшей десятой кредита, а метаданные ответа содержат все входные данные, использованные в расчёте.

Уровни обслуживания — второй фактор. Приоритетный уровень предназначен для случаев, когда человек или агент ожидает результат. Стандартный уровень работает асинхронно по цене 0,5x и подходит для конвейеров, допускающих ожидание от нескольких минут до нескольких часов. Обратите внимание: синхронные вызовы всегда тарифицируются по приоритетной ставке, а сама песочница работает на приоритетном уровне. LandingAI прогнозирует снижение затрат на 25–80% для смешанных нагрузок и заявляет, что стоимость парсинга с помощью Verity на стандартном уровне составляет менее одного цента за страницу. Считайте эти значения данными поставщика, пока не протестируете собственный набор документов, поскольку компонент символов означает, что плотная страница может стоить дороже, чем раньше.

Блоки, а не фрагменты

Ответ Parse v2 содержит три поля верхнего уровня: markdown в порядке чтения, metadata и structure. Структура представляет собой узел документа, дочерними элементами которого являются страницы, а дочерними элементами страниц — блоки. Типы блоков включают текст, таблицу, ячейку таблицы, рисунок, примечание на полях, аттестацию, логотип, карточку и машинный код. Каждый блок содержит семантический идентификатор в формате type-index, стабильный в рамках одного ответа, но не сохраняющийся при повторном парсинге, а также объект привязки с номером страницы, диапазоном в строке markdown и нормализованной ограничивающей рамкой.

Формат вывода markdown также стандартизирован. Для рисунков используются элементы в стиле <figure type="CHART">, а сгенерированный текст изолирован внутри тегов <description>, поэтому расшифровку невозможно принять за комментарий модели. Аттестации выводятся в виде последовательных меток, например [STAMPED][SIGNED], а [ILLEGIBLE_SIGNATURE] и [ILLEGIBLE_TEXT] используются как фиксированные литералы. По умолчанию таблицы передаются в формате HTML для сохранения объединённых ячеек.

Атомарная привязка и её возможности

Атомарная привязка — наиболее значимая возможность этого выпуска. Каждый листовой блок содержит массив atomic_grounding: по одной записи на визуальную строку для DPT-3 Pro и по одной записи на слово для DPT-3 Verity. Verity присваивает каждому слову значение уверенности от 0 до 1, рассчитанное как минимальная оценка отдельных символов в этом слове, что даёт командам сигнал для направления сомнительных расшифровок на проверку. Теперь ячейки таблиц имеют собственные ограничивающие рамки, хотя Pro не заполняет атомарную привязку на уровне ячеек. Extract V2 формирует цитаты на основе этой привязки, поэтому извлечённое поле можно связать с конкретным словом на конкретной странице. Это делает возможными маскирование персональных данных по координатам, сравнение документов и создание интерфейсов для проверяющих вместо приблизительных решений.

Интерактивное объяснение

Основные выводы

  • DPT-3 Pro и DPT-3 Verity (публичная предварительная версия) заменяют DPT-2 в качестве моделей парсинга.
  • Теперь парсинг тарифицируется по ставке за страницу плюс ставке за выходные символы, а не по фиксированным 3 кредитам за страницу.
  • DPT-3 Pro обеспечивает привязку к строке, а DPT-3 Verity — к слову с показателем уверенности.
  • Фрагменты упразднены; ответ представляет собой дерево документа, страниц и блоков со стабильными идентификаторами.
  • Код клиента Gen1 не будет работать с конечными точками Gen2, поэтому потребуется миграция.

Ознакомьтесь с техническими подробностями здесь. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Подождите! Вы пользуетесь Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите стать нашим партнёром для продвижения вашего репозитория GitHub, страницы Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости