Reducto випускає r-1: модель розбору документів за один прохід, що зменшує кількість помилок на 20% за ціною 1 цент за сторінку
Минулого тижня Reducto оголосила про r-1. Це перша модель у новому сімействі парсерів, створена на основі переписаної архітектури, яка замінює багатоетапне агентне OCR-комплексне розпізнавання компанії одним повносторінковим проходом. Reducto стверджує, що r-1 точніша за найпотужніші застарілі агентні моделі компанії, працює швидше та коштує до 6 разів дешевше.
Чи можна розгорнути її вже сьогодні? Так, у режимі попереднього перегляду. r-1 працює через розміщений API Parse від Reducto на V3 і вмикається за допомогою конфігураційного прапорця. Відкритих ваг і локальної контрольної точки для самостійного розгортання немає. Платформа Reducto окремо підтримує хмарні середовища з кількома орендарями, VPC клієнта, локальні та ізольовані від мережі інсталяції; відповідно до її політик безпеки, на вищих тарифах також доступні атестація SOC 2 Type II і обробка даних HIPAA.
Один прохід замість конвеєра
Застарілий Parse виконує OCR, виявлення структури та постобробку як окремі етапи, із додатковими агентними проходами на основі зору та мови за потреби. Кожен додатковий виклик моделі збільшує затримку. r-1 об’єднує текст, таблиці, рисунки, структуру, порядок читання, форматування та прив’язку до джерела в один повносторінковий прохід. Кожен блок повертається з обмежувальними рамками відносно сторінки, які пов’язують вміст із його положенням на сторінці.
Саме консолідація є основною продуктовою заявкою. Команди, які працюють із фінансовою звітністю, страховими вимогами або контрактами, часто спрямовують файли через кількох постачальників і додають постобробку, щоб досягти прийнятної точності. r-1 націлена на витрати на таку оркестрацію, а не лише на точність розпізнавання символів.
Показники
Reducto повідомляє про 20% зниження рівня помилок у ранній версії r-1 для попереднього перегляду порівняно з власними застарілими агентними конвеєрами. Також компанія зазначає, що під час внутрішніх оцінювань r-1 перевершила поширені продукти гіпермасштабних хмарних провайдерів і великі LLM на складних документах. У релізі Amazon Textract та Azure Document Intelligence названі представниками базової категорії наявних рішень.
Щодо ціни: застарілі агентні моделі коштували від 3 до 6 центів за сторінку залежно від робочого навантаження. r-1 коштує 1 цент за сторінку, включно з усім, без додаткових множників функцій або витрат на кредити для досягнення високої точності. Reducto позиціонує це як частину ширшого переходу до фіксованих тарифних планів продуктів.
Зверніть увагу, що зниження помилок на 20% вимірюється порівняно з попереднім власним конвеєром Reducto, а не з базовим показником стороннього постачальника. Крім того, пряме порівняння з гіпермасштабними провайдерами та LLM проведене самою компанією, і разом з оголошенням не було опубліковано ні відкритого інструментарію оцінювання, ні набору даних.
Що r-1 розпізнає на сторінці
Згідно з документацією, r-1 нативно обробляє під час повносторінкового проходу: цифровий текст, скани та рукописний текст; структуру таблиць із урахуванням контексту всієї сторінки, зокрема об’єднані комірки та вкладені заголовки; колонки, заголовки, нижні колонтитули, бічні панелі та порядок читання, визначені разом; виявлення рисунків із коротким згенерованим описом; форматування, що має смислове значення, зокрема заголовки, списки, напівжирний шрифт, підкреслення та закреслення; а також прив’язку до джерела за допомогою обмежувальних рамок відносно сторінки.
Серед складних випадків, на які звертає увагу Reducto, — щільні таблиці, незвичні макети, скани низької якості, документи з водяними знаками та документи без передбачуваного шаблону. Втрачене закреслення може змінити зміст пункту контракту на протилежний, а неправильно прочитана таблиця може передати агенту неправильне число, тому ці крайові випадки мають велике значення в регульованих конвеєрах.
Шлях міграції та те, що залишається у старому стеку
Для r-1 потрібен API V3. Якщо запит Parse не містить settings.model, він і надалі виконуватиметься через застарілий Parse, тож нічого непомітно не зламається. Нові конвеєри, створені в Studio, за замовчуванням використовують r-1.
result = client.parse.run(
input=upload.file_id,
settings={"model": "r-1"}
)Агентну обробку не скасовано. Робочі процеси, яким потрібні власні підказки або розширене вилучення даних із діаграм, і надалі спрямовують такі сторінки через агентний конвеєр, який Reducto додає до результату r-1 і який збільшує затримку. Командам, що переносять наявну конфігурацію, слід спочатку перевірити сторінку сумісності конфігурації r-1, оскільки деякі застарілі налаштування ігноруються або не підтримуються.
Reducto також анонсувала наступні два компоненти: r-1 mini для робочих навантажень, чутливих до швидкості та вартості, і автоматичну маршрутизацію на рівні окремих сторінок, яка вибирає правильну модель для кожної сторінки. Організації, що переходять з іншого парсера, можуть запросити до 5 000 доларів у кредитах для паралельного порівняння.
Основні висновки
- r-1 об’єднує OCR, структуру, таблиці, форматування та прив’язку до джерела в один повносторінковий прохід.
- Reducto повідомляє про зниження помилок на 20% порівняно з власними застарілими агентними конвеєрами.
- Ціна знижується з 3–6 центів за сторінку до фіксованого 1 цента, включно з усім.
- Доступна у режимі попереднього перегляду через API Parse V3 із використанням
settings.model: "r-1", відкритих ваг немає.
Ознайомтеся з блогом Reducto, документацією Parse r-1 та оголошенням у X. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту ML із понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібно стати нашим партнером для просування вашого репозиторію GitHub АБО сторінки Hugging Face, АБО релізу продукту, АБО вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.