Cohere випускає Parse 5 (parse-v5.0): візуально-мовна модель із 2,3 млрд параметрів, що перетворює корпоративні документи на Markdown
Cohere випустила Parse (parse-v5.0) — модель для аналізу документів, призначену для високопродуктивного корпоративного завантаження даних. Це мультимодальна мовна модель із 2,3 млрд параметрів, контекстним вікном на 8 192 токени та обсягом близько 4,6 ГБ, побудована на архітектурі North-Micro-Vision-Instruct від Cohere Labs. Parse приймає сторінку PDF, PPT або JPEG як URI даних у форматі base64 і повертає Markdown, що містить текст у порядку читання, таблиці, відтворені як HTML, списки, пари ключ-значення з форм, описи зображень і координати обмежувальних рамок. Окремого етапу OCR перед нею немає. Cohere оцінює API Parse у $1,50 за 1 000 сторінок і позиціонує модель не за максимальною точністю, а за співвідношенням ціни та продуктивності — це твердження компанія підтверджує самостійно заявленим результатом ParseBench 79,2, який, як ми докладніше пояснюємо нижче, вимірює три з п’яти показників цього бенчмарку.
Чи можна її розгорнути?
Так, у продуктивному середовищі. Parse загальнодоступна через API Cohere Parse, Microsoft Foundry, AWS SageMaker і однокористувацький Model Vault. Черги очікування немає, як і дослідницької ліцензії.
- Які компанії: Команди середнього бізнесу, які вже використовують RAG-стек, можуть розпочати з тарифікованих викликів API за допомогою безкоштовного пробного ключа. Великі підприємства з вимогами щодо локалізації даних або ізольованого середовища одразу обирають Model Vault чи приватне розгортання. Стартапи на початковій стадії теж можуть ним користуватися, але економічний ефект стає відчутним лише за обсягів понад приблизно 100 тис. сторінок на місяць.
- Які галузі: Cohere орієнтується на фінансові послуги, страхування, охорону здоров’я та науки про життя, державний сектор, телекомунікації, енергетику й виробництво — галузі з великим документообігом, де скановані форми та складні таблиці є нормою.
- Застосування: завантаження даних для RAG, інтелектуальна обробка документів, процеси роботи зі страховими заявами та рахунками, пошук у контрактах і документах, а також передавання контексту документів агентам.
Що таке Parse?
Parse — мультимодальна мовна модель із 2,3 млрд параметрів, побудована на архітектурі North-Micro-Vision-Instruct від Cohere Labs, із контекстним вікном на 8 192 токени та обсягом близько 4,6 ГБ. Вона приймає сторінки PDF, PPT і JPEG як URI даних у форматі base64 та повертає Markdown, що містить текст документа, списки, таблиці, відтворені як HTML, координати обмежувальних рамок і описи зображень.
Окремого етапу OCR перед нею немає. Модель за один прохід відновлює текст і порядок читання, таблиці, списки, форми та пари ключ-значення, зображення й підписи до них, а також розташування меж сторінок і візуальних елементів. Дев’ять мов визначені як стабільні — арабська, англійська, французька, німецька, італійська, японська, корейська, португальська та іспанська, — а для інших мов передбачена підтримка в режимі zero-shot із нижчою точністю.
На практиці важливі два режими виведення. За замовчуванням повертається рядок Markdown для кожної сторінки. Налаштування output_format="blocks" повертає типізовані блоки, де блок таблиці містить її HTML, обмежувальну рамку та опис. Саме другий режим забезпечує можливість відстеження на рівні цитат.
Бенчмарк
Cohere повідомляє про результат ParseBench 79,2 для Parse, усереднений за показниками таблиць, відповідності вмісту та семантичного форматування; це вище, ніж у Mistral OCR 4 (74,5), Azure Document Intelligence (74,3) і Databricks AI Parse (72,4).
ParseBench — це бенчмарк LlamaIndex, що охоплює близько 2 078 перевірених людьми корпоративних сторінок, оцінених за п’ятьма показниками: таблиці, діаграми, відповідність вмісту, семантичне форматування та візуальне позиціонування. Показник Cohere усереднює три з них і не враховує діаграми та візуальне позиціонування — два показники, за якими більшість парсерів демонструють найгірші результати.
Згідно з публічним рейтингом, ті самі постачальники мають значно нижчі результати за повною п’ятимірною оцінкою: Mistral OCR 4 — 60,68, Databricks AI Parse — 60,68, Azure Document Intelligence (Layout) — 59,64. Середнє значення Azure за трьома показниками становить 74,3, що точно відповідає показнику Cohere та підтверджує методологію. Cohere Parse наразі не представлена в цьому рейтингу, де лідирує LlamaParse Agentic із результатом 84,88.
Отже, 79,2 — це заявлений постачальником результат за частиною показників, а не позиція в рейтингу. Це обґрунтоване твердження, яке варто перевірити на власних документах.
Скільки це коштує
Cohere встановила ціну API Parse на рівні $1,50 за 1 000 сторінок. У Model Vault Parse 5 коштує $4,00 за годину або $2 500 на місяць для інстансу Medium і $7,00 за годину або $4 300 на місяць для XL.
Поріг окупності, який ніхто не публікує: за ціни $0,0015 за сторінку один інстанс Medium виходить у беззбитковість приблизно за 1,67 млн сторінок на місяць, а XL — приблизно за 2,87 млн. Нижче цього обсягу тарифіковані виклики API дешевші. Вище — виділена потужність вигідніша лише за ціною, ще до будь-яких міркувань щодо локалізації даних, яка зазвичай і є справжньою причиною переходу підприємств на Vault.
Ключові висновки
- Cohere випустила
parse-v5.0— мультимодальну мовну модель із 2,3 млрд параметрів, яка перетворює PDF-файли, слайди та зображення на Markdown із HTML-таблицями й обмежувальними рамками. - Ціна API становить $1,50 за 1 000 сторінок; Model Vault коштує $2 500 на місяць (Medium) або $4 300 на місяць (XL).
- Виділена потужність перевершує тарифікацію за використанням лише за обсягів понад приблизно 1,67 млн сторінок на місяць.
- Показник ParseBench 79,2 заявлений постачальником і розрахований за трьома з п’яти показників; діаграми та візуальне позиціонування не враховано.
Ознайомтеся з технічними деталями тут і спробуйте на HF. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту ML із понад 150 тис. учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.