Старый OCR-текст мешает обучению языковых моделей, и FineBooks хочет исправить это в масштабах
Ключевые моменты
- Проект FineBooks, совместная инициатива Hugging Face и EleutherAI, протестировал 14 OCR-моделей с открытым исходным кодом на более чем 2 000 страницах исторических книг, чтобы оценить, насколько хорошо они могут преобразовывать отсканированные тексты в очищенные обучающие данные для языковых моделей ИИ.
- Меньшие модели часто превосходили более крупные: лучшая модель достигла точности распознавания символов свыше 97 процентов при стоимости менее двух долларов США за тысячу страниц.
- Исследователи считают качество результатов достаточным для обучения ИИ, однако отмечают, что модели по-прежнему слишком часто ошибаются для использования в академических и научных целях.
Проект FineBooks от Hugging Face и EleutherAI протестировал 14 OCR-моделей с открытыми весами на более чем 2 000 страницах исторических книг. Лучшие модели уже создают текст, достаточно качественный для обучения ИИ, но пока не готовы к академическому использованию.
Обучение языковых моделей ИИ с открытым исходным кодом на книгах, находящихся в общественном достоянии, означает необходимость иметь дело с некачественным текстом. Несколько лет назад библиотеки извлекали эти тексты из сканов с помощью оптического распознавания символов, и результаты часто изобилуют ошибками. Проект Talkie количественно оценил возможный ущерб: языковая модель, обученная на тексте OCR, училась с эффективностью, составлявшей лишь 30 процентов от эффективности модели, обученной на расшифровках тех же книг, выполненных людьми.
FineBooks, совместный проект Hugging Face и EleutherAI, проверил, способны ли современные OCR-модели с открытым исходным кодом решить эту проблему. Команда запустила 14 моделей с открытыми весами на 2 165 страницах исторических книг и опубликовала результаты в виде рейтинга. Лучшие модели достигли точности распознавания символов свыше 97 процентов при стоимости менее двух долларов за тысячу страниц.

Миллионам страниц из общественного достояния нужно более качественное распознавание текста
Когда в прошлом году EleutherAI и её партнёры выпустили Common Pile — крупнейший на тот момент корпус для обучения с открытой лицензией, — он содержал около 300 000 книг из общественного достояния с текстами, полученными в ходе старых запусков OCR. Авторы FineBooks утверждают, что повторная обработка этих книг с помощью более совершенных моделей — один из наиболее эффективных способов улучшить открытые наборы данных для обучения ИИ.
Первой целью проекта стала Biodiversity Heritage Library (BHL), содержащая более 300 000 оцифрованных документов по естественной истории общим объёмом свыше 64 миллионов страниц. BHL предлагает свою коллекцию для массовой загрузки через AWS.
Для измерения качества OCR нужны страницы с заранее известными правильными расшифровками. Команда использовала материалы проекта IMPACT и BHL-Europe: в период с 2011 по 2012 год специалисты расшифровали шесть томов BHL на английском, французском, немецком и латинском языках с частотой ошибок около одного символа на 2 000. Эти данные доступны по лицензии CC-BY в репозитории GitHub и лежат в основе нового эталонного набора данных.
Маленькие модели превосходят более крупных конкурентов
Все 14 моделей доступны бесплатно и работают на локальном оборудовании без ключа API. Используемая метрика — Character Error Rate (CER), доля неправильно распознанных символов. Рейтинг разделяет результаты на «дипломатический» вариант, в котором модернизация архаичных символов, таких как длинная s (ſ), считается ошибкой, и вариант «для чтения», допускающий такие изменения.
Лидирующая модель dots.mocr использует всего 3 миллиарда параметров, тогда как Qwen3.5-9B получает более низкий результат, несмотря на то что она почти втрое крупнее. OvisOCR2 занимает второе место всего с 0,9 миллиарда параметров при стоимости 46 центов за тысячу страниц. Размер модели и качество OCR для исторических документов не коррелируют.
| Модель | Размер | Точность | Стоимость/1 000 страниц |
|---|---|---|---|
| dots.mocr | 3B | 97.6% | $1.94 |
| OvisOCR2 | 0.9B | 96.9% | $0.46 |
| PaddleOCR-VL-1.6 | 1B | 96.1% | $0.34 |
| olmOCR-2 | 8.3B | 95.7% | $0.45 |
| LightOnOCR-2 | 1B | 95.1% | $0.37 |
| Qwen3.5-9B | 9.7B | 94.9% | $0.89 |
| DeepSeek-OCR | 3.3B | 93.8% | $0.37 |
Оценка охватывает только шрифты антиква на четырёх языках. В ней не учитываются готический шрифт, нелатинские письменности и рукописный текст, а FineBooks ограничивается книжными страницами с одной колонкой. Команда планирует повторно обработать около 200 000 документов BHL из общественного достояния с помощью одной из лучших моделей и выпустить текст в виде открытого набора данных. Новые модели добавляются в рейтинг на постоянной основе, а инфраструктура оценки доступна открыто.
Достаточно хорошо для обучения ИИ, но слишком неточно для научной работы
Авторы FineBooks оценивают результаты с учётом предполагаемого применения. Они пишут, что для обучения языковых моделей лидирующие модели работают достаточно хорошо. Эти модели допускают значительно меньше ошибок, чем старые системы, а повторная обработка коллекции размером с BHL реалистична с учётом измеренной стоимости.
Перед библиотеками стоит другая проблема, отмечает команда. Их системы используют ALTO XML — формат с координатами на уровне слов. Новые модели выдают Markdown или обычный текст без позиций слов, поэтому их нельзя подключить к существующей библиотечной инфраструктуре.
Для академических расшифровок точность по-прежнему недостаточна, но не потому, что модели неправильно распознают символы. Они незаметно модернизируют их, заменяя длинную «s» или лигатуры современными эквивалентами. По словам команды, это можно исправить с помощью целевой тонкой настройки.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный отчёт о передовых разработках «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.