Cohere выпускает Parse 5 (parse-v5.0): визуально-языковая модель с 2,3 млрд параметров, превращающая корпоративные документы в Markdown
Cohere выпустила Parse (parse-v5.0) — модель для разбора документов, предназначенную для высокообъёмной корпоративной загрузки данных. Это визуально-языковая модель с 2,3 млрд параметров, контекстным окном на 8 192 токена и размером около 4,6 ГБ, созданная на основе архитектуры North-Micro-Vision-Instruct от Cohere Labs. Parse принимает страницу PDF, PPT или JPEG в виде URI данных, закодированного в base64, и возвращает Markdown, содержащий текст в порядке чтения, таблицы, отформатированные как HTML, списки, пары ключ-значение из форм, описания изображений и координаты ограничивающих рамок. Отдельный этап OCR перед ней не требуется. Cohere установила цену на Parse API в размере 1,50 доллара за 1 000 страниц и позиционирует модель с точки зрения соотношения цены и производительности, а не максимальной точности — это заявление компания подтверждает самостоятельно заявленным результатом ParseBench 79,2, который, как мы подробно рассмотрим ниже, измеряет три из пяти измерений этого бенчмарка.
Можно ли её развернуть?
Да, в промышленной эксплуатации. Parse доступна всем через Cohere Parse API, Microsoft Foundry, AWS SageMaker и выделенный для одного клиента Model Vault. Листа ожидания и исследовательской лицензии нет.
- Какие компании: Команды среднего бизнеса, уже использующие стек RAG, могут начать с тарификации API по факту использования, получив бесплатный пробный ключ. Крупные предприятия с требованиями к локализации данных или изолированным сетям сразу переходят на Model Vault или частное развёртывание. Стартапы на стадии посева также могут использовать решение, но экономический эффект начинает иметь значение лишь при объёме примерно от 100 тысяч страниц в месяц.
- Какие отрасли: Cohere ориентируется на финансовые услуги, страхование, здравоохранение и медико-биологические науки, государственный сектор, телекоммуникации, энергетику и производство — отрасли с большим объёмом документов, где отсканированные формы и сложные таблицы являются нормой.
- Применения: загрузка данных для RAG, интеллектуальная обработка документов, конвейеры обработки страховых требований и счетов, поиск по договорам и нормативным документам, а также предоставление агентам контекста документов.
Что такое Parse?
Parse — визуально-языковая модель с 2,3 млрд параметров, созданная на основе архитектуры North-Micro-Vision-Instruct от Cohere Labs, с контекстным окном на 8 192 токена и размером около 4,6 ГБ. Она принимает страницы PDF, PPT и JPEG в виде URI данных, закодированных в base64, и возвращает Markdown, содержащий текст документа, списки, таблицы в формате HTML, координаты ограничивающих рамок и описания изображений.
Отдельный этап OCR перед ней не требуется. Модель за один проход извлекает текст и порядок чтения, таблицы, списки, формы и пары ключ-значение, изображения и подписи к ним, а также расположение границ страниц и визуальных элементов. Девять языков указаны как стабильные — арабский, английский, французский, немецкий, итальянский, японский, корейский, португальский и испанский, — а для остальных языков предусмотрена поддержка в режиме zero-shot с более низкой точностью.
На практике важны два режима вывода. По умолчанию для каждой страницы возвращается строка Markdown. Параметр output_format="blocks" возвращает типизированные блоки, в которых блок таблицы содержит её HTML-код, ограничивающую рамку и описание. Именно второй режим делает возможной трассируемость на уровне цитат.
Бенчмарк
Cohere сообщает о результате ParseBench 79,2 для Parse, усреднённом по таблицам, достоверности содержимого и семантическому форматированию; это выше показателей Mistral OCR 4 (74,5), Azure Document Intelligence (74,3) и Databricks AI Parse (72,4).
ParseBench — бенчмарк LlamaIndex, включающий около 2 078 проверенных людьми корпоративных страниц, оцениваемых по пяти направлениям: таблицы, диаграммы, достоверность содержимого, семантическое форматирование и визуальное заземление. Показатель Cohere усредняет три из них и исключает диаграммы и визуальное заземление — два направления, на которых большинство парсеров демонстрируют резкое падение результатов.
В сравнении с публичной таблицей лидеров те же поставщики набирают значительно меньше баллов по итоговой оценке всех пяти направлений: Mistral OCR 4 — 60,68, Databricks AI Parse — 60,68, Azure Document Intelligence (Layout) — 59,64. Среднее значение Azure по трём направлениям составляет 74,3, что в точности совпадает с показателем Cohere и подтверждает методологию. Cohere Parse в настоящее время не представлена в этой таблице лидеров, где лидирует LlamaParse Agentic с результатом 84,88.
Таким образом, 79,2 — это заявленный поставщиком результат по части показателей, а не позиция в таблице лидеров. Это обоснованное утверждение, которое стоит проверить на собственных документах.
Стоимость
Cohere установила цену на Parse API в размере 1,50 доллара за 1 000 страниц. В Model Vault использование Parse 5 стоит 4,00 доллара в час или 2 500 долларов в месяц для экземпляра Medium и 7,00 долларов в час или 4 300 долларов в месяц для XL.
Точка перехода, о которой никто не говорит: при цене 0,0015 доллара за страницу один экземпляр Medium окупается примерно при 1,67 млн страниц в месяц, а XL — примерно при 2,87 млн. При меньшем объёме вызовы API с оплатой по факту использования дешевле. При большем объёме выделенная инфраструктура выигрывает исключительно по цене — ещё до обсуждения локализации данных, которая обычно и является настоящей причиной перехода предприятий на Vault.
Основные выводы
- Cohere выпустила
parse-v5.0— визуально-языковую модель с 2,3 млрд параметров, преобразующую PDF-файлы, слайды и изображения в Markdown с HTML-таблицами и ограничивающими рамками. - Цена API составляет 1,50 доллара за 1 000 страниц; Model Vault стоит 2 500 долларов в месяц (Medium) или 4 300 долларов в месяц (XL).
- Выделенная инфраструктура становится выгоднее тарификации по факту использования лишь при объёме примерно от 1,67 млн страниц в месяц.
- Показатель ParseBench 79,2 заявлен поставщиком, рассчитан по трём из пяти направлений и не учитывает диаграммы и визуальное заземление.
Ознакомьтесь с техническими подробностями здесь и попробуйте на HF. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Стоп! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите стать нашим партнёром для продвижения вашего репозитория GitHub, страницы Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.