Cohere пуска Parse 5 (parse-v5.0): визуално-езиков модел с 2,3 млрд. параметъра, който превръща корпоративни документи в Markdown
Cohere пусна Parse (parse-v5.0) — модел за анализ на документи, предназначен за високомащабно корпоративно ingest-ване. Това е зрително-езиков модел с 2,3 млрд. параметъра, контекстен прозорец от 8 192 токена и размер около 4,6 GB, изграден върху архитектурата North-Micro-Vision-Instruct на Cohere Labs. Parse приема страница от PDF, PPT или JPEG като URI за данни, кодиран в base64, и връща Markdown, съдържащ текста в реда на четене, таблици, визуализирани като HTML, списъци, двойки ключ-стойност от формуляри, описания на изображения и координати на ограничаващи рамки. Преди него няма отделен OCR етап. Cohere предлага Parse API на цена от 1,50 щ.д. за 1 000 страници и позиционира модела спрямо съотношението цена–производителност, а не спрямо максималната точност — твърдение, което компанията подкрепя със самоотчетен резултат от 79,2 в ParseBench, който, както ще разгледаме по-долу, измерва три от петте измерения на този бенчмарк.
Може ли да бъде внедрен?
Да, в продукционна среда. Parse е общодостъпен чрез Cohere Parse API, Microsoft Foundry, AWS SageMaker и еднонаемателния Model Vault. Няма списък с чакащи и няма изследователски лиценз.
- Кои компании: Екипи от средния пазар, които вече използват RAG стек, могат да започнат с таксувани API заявки чрез безплатен пробен ключ. Големите предприятия с изисквания за локализация на данните или изолирани мрежи преминават директно към Model Vault или частно внедряване. Стартъпите в начален етап също могат да го използват, но икономическата полза започва да се усеща едва над приблизително 100 хил. страници месечно.
- Кои индустрии: Cohere е насочена към финансови услуги, застраховане, здравеопазване и науки за живота, публичния сектор, телекомуникациите, енергетиката и производството — вертикалите с интензивна употреба на документи, където сканираните формуляри и плътните таблици са обичайни.
- Приложения: RAG ingest-ване, интелигентна обработка на документи, процеси за обработка на искове и фактури, търсене в договори и заявления, както и предоставяне на контекст от документи на агенти.
Какво представлява Parse?
Parse е зрително-езиков модел с 2,3 млрд. параметъра, изграден върху архитектурата North-Micro-Vision-Instruct на Cohere Labs, с контекстен прозорец от 8 192 токена и размер около 4,6 GB. Той приема страници от PDF, PPT и JPEG като URI адреси за данни, кодирани в base64, и връща Markdown, съдържащ текста на документа, списъци, таблици, визуализирани като HTML, координати на ограничаващи рамки и описания на изображения.
Преди него няма отделен OCR етап. Моделът възстановява текста и реда на четене, таблиците, списъците, формулярите и двойките ключ-стойност, изображенията и надписите, както и местоположението на границите на страниците и визуалните елементи, в един проход. Девет езика са посочени като стабилно поддържани — арабски, английски, френски, немски, италиански, японски, корейски, португалски и испански — с поддръжка на други езици чрез zero-shot подход, но с по-ниска точност.
На практика са важни два режима на изхода. По подразбиране се връща Markdown низ за всяка страница. Задаването на output_format="blocks" връща типизирани блокове, при които блокът за таблица съдържа нейния HTML, ограничаващата рамка и описание. Именно вторият режим прави възможна проследимостта на ниво цитат.
Бенчмаркът
Cohere отчита резултат от 79,2 в ParseBench за Parse, усреднен за таблици, достоверност на съдържанието и семантично форматиране — пред Mistral OCR 4 (74,5), Azure Document Intelligence (74,3) и Databricks AI Parse (72,4).
ParseBench е бенчмарк на LlamaIndex с около 2 078 проверени от хора корпоративни страници, оценявани по пет измерения: таблици, диаграми, достоверност на съдържанието, семантично форматиране и визуално позициониране. Показателят на Cohere усреднява три от тях и изключва диаграмите и визуалното позициониране — двете измерения, при които повечето парсери се провалят.
Спрямо публичната класация същите доставчици получават значително по-ниски резултати при общата оценка по всички пет измерения: Mistral OCR 4 — 60,68, Databricks AI Parse — 60,68, Azure Document Intelligence (Layout) — 59,64. Средната стойност на Azure по трите измерения е 74,3, което съвпада точно с показателя на Cohere и потвърждава методологията. Cohere Parse понастоящем не е включен в тази класация, където LlamaParse Agentic води с 84,88.
Следователно 79,2 е отчетен от доставчика резултат за подмножество, а не позиция в класацията. Това е разумно твърдение, което може да бъде проверено върху собствените ви документи.
Колко струва
Cohere предлага Parse API на цена от 1,50 щ.д. за 1 000 страници. В Model Vault Parse 5 струва 4,00 щ.д. на час или 2 500 щ.д. на месец за инстанция Medium и 7,00 щ.д. на час или 4 300 щ.д. на месец за XL.
Точката на пресичане, която никой не публикува: при 0,0015 щ.д. на страница една инстанция Medium се изплаща при приблизително 1,67 млн. страници месечно, а XL — при приблизително 2,87 млн. Под тези обеми таксуваните API заявки са по-евтини. Над тях специализираният капацитет печели само по цена — преди да се вземе предвид въпросът за локализацията на данните, който обикновено е истинската причина предприятията да преминат към Vault.
Основни изводи
- Cohere пусна
parse-v5.0— зрително-езиков модел с 2,3 млрд. параметъра, който преобразува PDF файлове, слайдове и изображения в Markdown с HTML таблици и ограничаващи рамки. - Цената на API е 1,50 щ.д. за 1 000 страници; Model Vault струва 2 500 щ.д. месечно (Medium) или 4 300 щ.д. месечно (XL).
- Специализираният капацитет надминава таксуването според употребата едва над приблизително 1,67 млн. страници месечно.
- Показателят 79,2 в ParseBench е отчетен от доставчика за три от петте измерения и не включва диаграми и визуално позициониране.
Вижте техническите подробности тук и го изпробвайте в HF. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово издание, уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.