Reducto пуска r-1: модел за парсинг на документи в един проход, който намалява грешките с 20% при цена 1 цент на страница
Миналата седмица Reducto обяви r-1. Това е първият модел от ново семейство за парсинг, изградено върху преработена архитектура, и заменя многоетапния агентен OCR на компанията с еднократно обработване на цялата страница. Reducto твърди, че r-1 е по-точен от най-мощните ѝ стари агентни модели, по-бърз е и е до 6 пъти по-евтин.
Може ли да бъде внедрен днес? Да, в предварителен достъп. r-1 работи чрез хоствания Parse API на V3 и се активира с конфигурационен флаг. Няма отворени тегла и няма локална контролна точка за самостоятелно хостване. Платформата на Reducto поддържа отделно облачна среда за множество клиенти, клиентски VPC, локални инсталации и инсталации без мрежова свързаност, със SOC 2 Type II атестация и обработване на данни по HIPAA при по-високите нива, според нейните политики за сигурност.
Еднократно обработване вместо конвейер
Старият Parse изпълнява OCR, откриване на оформление и последваща обработка като отделни етапи, с опционални агентни визио-езикови стъпки отгоре. Всяко допълнително извикване на модел увеличава латентността. r-1 обединява текста, таблиците, фигурите, оформлението, реда на четене, форматирането и позиционното обвързване в еднократно обработване на цялата страница. Всеки блок се връща с ограничителни рамки, относителни към страницата, които свързват съдържанието с позицията му върху страницата.
Именно консолидирането е същинското продуктово твърдение. Екипите, работещи с финансови отчети, застрахователни искове или договори, често насочват файловете през няколко доставчици и добавят последваща обработка, за да постигнат използваема точност. r-1 е насочен към разходите за тази оркестрация, а не само към суровата точност на разпознаване на символи.
Числата
Reducto отчита 20% намаление на процента грешки при ранния предварителен достъп до r-1 спрямо собствените си стари агентни конвейери. Компанията също така посочва, че при вътрешни оценки r-1 е надминал широко използвани продукти на хиперскейлърите и големи LLM модели при сложни документи. Amazon Textract и Azure Document Intelligence са посочени в съобщението като категорията на утвърдените базови решения.
По отношение на цената старите агентни модели струваха между 3 и 6 цента на страница в зависимост от натоварването. r-1 струва 1 цент на страница, изцяло, без допълнителни множители за функции или разходи за кредити, необходими за постигане на висока точност. Reducto представя това като част от по-широко преминаване към фиксирани продуктови цени.
Имайте предвид, че 20-процентното намаление на грешките е измерено спрямо собствения предишен конвейер на Reducto, а не спрямо базова стойност на трета страна. А директното сравнение с хиперскейлъри и LLM модели е проведено от доставчика, без публичен набор от инструменти или набор от данни за оценка, публикувани заедно с обявяването.
Какво разрешава r-1 на страницата
Според документацията r-1 обработва естествено при еднократното обработване на цялата страница следното: цифров текст, сканирани документи и ръкописен текст; структурата на таблиците се разчита с контекста на цялата страница, включително обединени клетки и вложени заглавки; колоните, заглавията, долните колонтитули, страничните полета и редът на четене се определят съвместно; откриване на фигури с кратко генерирано описание; форматиране, което носи смисъл, включително заглавия, списъци, получер, подчертаване и зачертаване; и позиционно обвързване чрез ограничителни рамки, относителни към страницата.
Сред специфичните случаи, които Reducto посочва, са плътни таблици, необичайни оформления, нискокачествени сканирания, съдържание с водни знаци и документи, които не следват предвидим шаблон. Пропуснато зачертаване може да обърне смисъла на клауза в договор, а погрешно разчетена таблица може да подаде на агент грешна цифра, поради което тези гранични случаи са важни в регулирани конвейери.
Път за миграция и какво остава в стария стек
r-1 изисква V3 API. Заявка към Parse, в която липсва settings.model, все още работи със стария Parse, така че нищо не се поврежда незабелязано. Новите конвейери, създадени в Studio, използват r-1 по подразбиране.
result = client.parse.run(
input=upload.file_id,
settings={"model": "r-1"}
)Агентната обработка не е премахната. Работните процеси, които изискват персонализирани подкани или разширено извличане на диаграми, все още насочват тези страници през агентния конвейер, който Reducto добавя към резултата от r-1 и който увеличава латентността. Екипите, мигриращи съществуваща конфигурация, трябва първо да проверят страницата за съвместимост на конфигурацията с r-1, тъй като някои стари настройки се игнорират или не се поддържат.
Reducto също така е обявила следващите две разработки: r-1 mini за натоварвания, чувствителни към скоростта и разходите, и автоматично маршрутизиране на ниво страница, което избира правилния модел за всяка страница. Организациите, преминаващи от друг парсер, могат да поискат кредити до 5000 долара за паралелно сравнение.
Основни изводи
- r-1 обединява OCR, оформлението, таблиците, форматирането и позиционното обвързване в еднократно обработване на цялата страница.
- Reducto отчита 20% намаление на грешките спрямо собствените си стари агентни конвейери.
- Цената спада от 3–6 цента на страница до фиксиран 1 цент, включващ всичко.
- Достъпен е в предварителен достъп чрез V3 Parse API с използване на
settings.model: "r-1", без отворени тегла.
Вижте блога на Reducto, документацията за Parse r-1 и съобщението в X. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия информационен бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.
Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово издание, уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.