Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Reducto пуска r-1: модел за парсинг на документи в един проход, който намалява грешките с 20% при цена 1 цент на страница

Миналата седмица Reducto обяви r-1. Това е първият модел от ново семейство за парсинг, изградено върху преработена архитектура, и заменя многоетапния агентен OCR на компанията с еднократно обработване на цялата страница. Reducto твърди, че r-1 е по-точен от най-мощните ѝ стари агентни модели, по-бърз е и е до 6 пъти по-евтин.

Може ли да бъде внедрен днес? Да, в предварителен достъп. r-1 работи чрез хоствания Parse API на V3 и се активира с конфигурационен флаг. Няма отворени тегла и няма локална контролна точка за самостоятелно хостване. Платформата на Reducto поддържа отделно облачна среда за множество клиенти, клиентски VPC, локални инсталации и инсталации без мрежова свързаност, със SOC 2 Type II атестация и обработване на данни по HIPAA при по-високите нива, според нейните политики за сигурност.

Еднократно обработване вместо конвейер

Старият Parse изпълнява OCR, откриване на оформление и последваща обработка като отделни етапи, с опционални агентни визио-езикови стъпки отгоре. Всяко допълнително извикване на модел увеличава латентността. r-1 обединява текста, таблиците, фигурите, оформлението, реда на четене, форматирането и позиционното обвързване в еднократно обработване на цялата страница. Всеки блок се връща с ограничителни рамки, относителни към страницата, които свързват съдържанието с позицията му върху страницата.

Именно консолидирането е същинското продуктово твърдение. Екипите, работещи с финансови отчети, застрахователни искове или договори, често насочват файловете през няколко доставчици и добавят последваща обработка, за да постигнат използваема точност. r-1 е насочен към разходите за тази оркестрация, а не само към суровата точност на разпознаване на символи.

Числата

Reducto отчита 20% намаление на процента грешки при ранния предварителен достъп до r-1 спрямо собствените си стари агентни конвейери. Компанията също така посочва, че при вътрешни оценки r-1 е надминал широко използвани продукти на хиперскейлърите и големи LLM модели при сложни документи. Amazon Textract и Azure Document Intelligence са посочени в съобщението като категорията на утвърдените базови решения.

По отношение на цената старите агентни модели струваха между 3 и 6 цента на страница в зависимост от натоварването. r-1 струва 1 цент на страница, изцяло, без допълнителни множители за функции или разходи за кредити, необходими за постигане на висока точност. Reducto представя това като част от по-широко преминаване към фиксирани продуктови цени.

Имайте предвид, че 20-процентното намаление на грешките е измерено спрямо собствения предишен конвейер на Reducto, а не спрямо базова стойност на трета страна. А директното сравнение с хиперскейлъри и LLM модели е проведено от доставчика, без публичен набор от инструменти или набор от данни за оценка, публикувани заедно с обявяването.

Какво разрешава r-1 на страницата

Според документацията r-1 обработва естествено при еднократното обработване на цялата страница следното: цифров текст, сканирани документи и ръкописен текст; структурата на таблиците се разчита с контекста на цялата страница, включително обединени клетки и вложени заглавки; колоните, заглавията, долните колонтитули, страничните полета и редът на четене се определят съвместно; откриване на фигури с кратко генерирано описание; форматиране, което носи смисъл, включително заглавия, списъци, получер, подчертаване и зачертаване; и позиционно обвързване чрез ограничителни рамки, относителни към страницата.

Сред специфичните случаи, които Reducto посочва, са плътни таблици, необичайни оформления, нискокачествени сканирания, съдържание с водни знаци и документи, които не следват предвидим шаблон. Пропуснато зачертаване може да обърне смисъла на клауза в договор, а погрешно разчетена таблица може да подаде на агент грешна цифра, поради което тези гранични случаи са важни в регулирани конвейери.

Път за миграция и какво остава в стария стек

r-1 изисква V3 API. Заявка към Parse, в която липсва settings.model, все още работи със стария Parse, така че нищо не се поврежда незабелязано. Новите конвейери, създадени в Studio, използват r-1 по подразбиране.

Копиране на кодаКопираноИзползвайте друг браузър
result = client.parse.run(
    input=upload.file_id,
    settings={"model": "r-1"}
)

Агентната обработка не е премахната. Работните процеси, които изискват персонализирани подкани или разширено извличане на диаграми, все още насочват тези страници през агентния конвейер, който Reducto добавя към резултата от r-1 и който увеличава латентността. Екипите, мигриращи съществуваща конфигурация, трябва първо да проверят страницата за съвместимост на конфигурацията с r-1, тъй като някои стари настройки се игнорират или не се поддържат.

Reducto също така е обявила следващите две разработки: r-1 mini за натоварвания, чувствителни към скоростта и разходите, и автоматично маршрутизиране на ниво страница, което избира правилния модел за всяка страница. Организациите, преминаващи от друг парсер, могат да поискат кредити до 5000 долара за паралелно сравнение.

Основни изводи

  • r-1 обединява OCR, оформлението, таблиците, форматирането и позиционното обвързване в еднократно обработване на цялата страница.
  • Reducto отчита 20% намаление на грешките спрямо собствените си стари агентни конвейери.
  • Цената спада от 3–6 цента на страница до фиксиран 1 цент, включващ всичко.
  • Достъпен е в предварителен достъп чрез V3 Parse API с използване на settings.model: "r-1", без отворени тегла.

Вижте блога на Reducto, документацията за Parse r-1 и съобщението в X. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия информационен бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.

Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово издание, уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини