Старий OCR-текст шкодить навчанню мовних моделей, і FineBooks хоче виправити це у великих масштабах
Основні тези
- Проєкт FineBooks, спільна ініціатива Hugging Face та EleutherAI, протестував 14 OCR-моделей із відкритим кодом на понад 2 000 сторінках історичних книг, щоб оцінити, наскільки добре вони можуть перетворювати відскановані тексти на чисті навчальні дані для мовних моделей ШІ.
- Менші моделі часто перевершували більші: найкраща модель досягла точності розпізнавання символів понад 97 відсотків за вартістю менш ніж два долари США на тисячу сторінок.
- Хоча дослідники вважають якість результатів достатньою для навчання ШІ, вони зазначають, що моделі все ще припускаються надто багатьох помилок для використання в академічних або наукових цілях.
Проєкт FineBooks від Hugging Face та EleutherAI протестував 14 OCR-моделей із відкритими вагами на понад 2 000 сторінках історичних книг. Найкращі моделі вже створюють текст, достатньо якісний для навчання ШІ, але ще не готові до академічного використання.
Навчання мовних моделей ШІ з відкритим кодом на книгах, що перебувають у суспільному надбанні, означає необхідність працювати з неякісним текстом. Бібліотеки вилучили ці тексти зі сканів багато років тому за допомогою оптичного розпізнавання символів, і результати часто переповнені помилками. Проєкт Talkie оцінив потенційну шкоду: мовна модель, навчена на тексті OCR, засвоювала інформацію лише з 30-відсотковою ефективністю порівняно з моделлю, навченою на людських транскрипціях тих самих книг.
FineBooks, спільний проєкт Hugging Face та EleutherAI, перевірив, чи можуть сучасні OCR-моделі з відкритим кодом розв’язати цю проблему. Команда запустила 14 моделей із відкритими вагами на 2 165 сторінках історичних книг і опублікувала результати у вигляді рейтингу. Найкращі моделі досягли точності розпізнавання символів понад 97 відсотків за ціною менш ніж два долари на тисячу сторінок.

Мільйони сторінок із суспільного надбання потребують кращого розпізнавання тексту
Коли EleutherAI та її партнери торік випустили Common Pile — найбільший на той час навчальний корпус із відкритою ліцензією, — він містив близько 300 000 книг із суспільного надбання з текстами, отриманими під час старих запусків OCR. Автори FineBooks стверджують, що повторна обробка цих книг за допомогою кращих моделей є одним із найефективніших способів покращити відкриті навчальні набори даних для ШІ.
Першою ціллю проєкту стала Biodiversity Heritage Library (BHL), яка містить понад 300 000 оцифрованих документів з історії природи загальним обсягом понад 64 мільйони сторінок. BHL пропонує свою колекцію для масового завантаження через AWS.
Для вимірювання якості OCR потрібні сторінки з відомими правильними транскрипціями. Команда використала напрацювання проєкту IMPACT і BHL-Europe: у 2011–2012 роках експерти транскрибували шість томів BHL англійською, французькою, німецькою та латиною з частотою помилок близько одного символу на 2 000. Ці дані доступні за ліцензією CC-BY у репозиторії GitHub і стали основою нового еталонного набору даних.
Малі моделі перевершують більших конкурентів
Усі 14 моделей доступні безкоштовно та працюють на локальному обладнанні без API-ключа. Метрика — частота помилок у символах (CER), тобто частка неправильно розпізнаних символів. Рейтинг розділяє результати на «дипломатичний» варіант, у якому модернізація архаїчних символів, як-от довгого s (ſ), вважається помилкою, і варіант «читання», який допускає такі зміни.
Провідна модель dots.mocr використовує лише 3 мільярди параметрів, тоді як Qwen3.5-9B отримує нижчий результат, незважаючи на те, що вона майже втричі більша. OvisOCR2 посідає друге місце, маючи лише 0,9 мільярда параметрів і коштуючи 46 центів на тисячу сторінок. Розмір моделі та якість OCR не корелюють для історичних документів.
| Модель | Розмір | Точність | Вартість/1 000 сторінок |
|---|---|---|---|
| dots.mocr | 3B | 97.6% | $1.94 |
| OvisOCR2 | 0.9B | 96.9% | $0.46 |
| PaddleOCR-VL-1.6 | 1B | 96.1% | $0.34 |
| olmOCR-2 | 8.3B | 95.7% | $0.45 |
| LightOnOCR-2 | 1B | 95.1% | $0.37 |
| Qwen3.5-9B | 9.7B | 94.9% | $0.89 |
| DeepSeek-OCR | 3.3B | 93.8% | $0.37 |
Оцінювання охоплює лише шрифти Antiqua чотирма мовами. Воно не враховує фрактуру, нелатинські писемності або рукописний текст, а FineBooks обмежений книжковими сторінками з однією колонкою. Команда планує повторно обробити близько 200 000 документів BHL із суспільного надбання за допомогою однієї з найкращих моделей і випустити текст як відкритий набір даних. Нові моделі додаються до рейтингу на постійній основі, а система оцінювання доступна у відкритому доступі.
Достатньо добре для навчання ШІ, але надто неточно для академічних досліджень
Автори FineBooks оцінюють результати з огляду на передбачуване використання. Для навчання мовних моделей найкращі моделі працюють достатньо добре, пишуть вони. Моделі припускаються значно меншої кількості помилок, ніж старі конвеєри, а повторна обробка колекції розміром із BHL є реалістичною з огляду на виміряну вартість.
Бібліотеки стикаються з іншою проблемою, зазначає команда. Їхні системи покладаються на ALTO XML — формат із координатами на рівні слів. Нові моделі виводять Markdown або звичайний текст без позицій слів, тому їх неможливо під’єднати до наявної бібліотечної інфраструктури.
Для академічних транскрипцій точність усе ще недостатня, але не тому, що моделі неправильно розпізнають символи. Вони непомітно модернізують їх, замінюючи довге «s» або лігатури сучасними відповідниками. За словами команди, це можна виправити цільовим донавчанням.
Новини ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний звіт про передові розробки «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.