Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

Старият OCR текст осакатява обучението на езикови модели, а FineBooks иска да поправи това в голям мащаб

Старият OCR текст осакатява обучението на езикови модели, а FineBooks иска да поправи това в мащаб
Матиас Бастиан
10 авг. 2026 г.

Основни моменти

  • Проектът FineBooks, съвместна инициатива на Hugging Face и EleutherAI, сравни 14 OCR модела с отворен код върху над 2000 страници от исторически книги, за да оцени доколко добре могат да преобразуват сканирани текстове в чисти тренировъчни данни за езикови модели с изкуствен интелект.
  • По-малките модели често превъзхождаха по-големите, като най-добре представилият се модел постигна над 97 процента точност на знаците при цена под два щатски долара на хиляда страници.
  • Макар че изследователите смятат качеството на резултатите за достатъчно за целите на обучението на изкуствен интелект, те отбелязват, че моделите все още допускат твърде много грешки за академични или научни приложения.

Проектът FineBooks на Hugging Face и EleutherAI тества 14 OCR модела с отворени тегла върху повече от 2000 страници от исторически книги. Най-добрите модели вече създават текст, достатъчно добър за обучение на изкуствен интелект, но все още не са готови за академична употреба.

Обучението на езикови модели с отворен код върху книги, които са обществено достояние, означава да се справяме с лош текст. Библиотеките са извличали тези текстове от сканирани копия преди години чрез оптично разпознаване на символи, а резултатите често са пълни с грешки. Проектът Talkie измери потенциалните щети: езиков модел, обучен върху OCR текст, се е научил с едва 30 процента от ефективността на модел, обучен върху човешки транскрипции на същите книги.

FineBooks, съвместна инициатива на Hugging Face и EleutherAI, провери дали съвременните OCR модели с отворен код могат да решат този проблем. Екипът стартира 14 модела с отворени тегла върху 2165 страници от исторически книги и публикува резултатите като класация. Най-добрите модели постигнаха точност на знаците над 97 процента при цена под два долара на хиляда страници.

Три от 2165-те страници с проверен текст: едноколонен английски текст по естествена история, многоезично съдържание и илюстрационна страница, чиято цялостна транскрипция представлява един ред с името на художника. | Изображение: FineBooks / Biodiversity Heritage Library
Три от 2165-те страници с проверен текст: едноколонен английски текст по естествена история, многоезично съдържание и илюстрационна страница, чиято цялостна транскрипция представлява един ред с името на художника. | Изображение: FineBooks / Biodiversity Heritage Library

Милиони страници от обществено достояние се нуждаят от по-добро разпознаване на текста

Когато EleutherAI и партньорите му публикуваха Common Pile миналата година — най-големия до момента корпус за обучение с отворен лиценз — той съдържаше около 300 000 книги от обществено достояние с текст от по-стари OCR процеси. Авторите на FineBooks твърдят, че повторната обработка на тези книги с по-добри модели е един от най-ефективните начини за подобряване на отворените набори от данни за обучение на изкуствен интелект.

Проектът избра Biodiversity Heritage Library (BHL) за своя първа цел. Тя съхранява над 300 000 дигитализирани документа по естествена история, възлизащи общо на над 64 милиона страници. BHL предлага колекцията си за масово изтегляне чрез AWS.

Измерването на качеството на OCR изисква страници с известни правилни транскрипции. Екипът използва работа от проекта IMPACT и BHL-Europe: между 2011 и 2012 г. експерти транскрибираха шест тома от BHL на английски, френски, немски и латински език с честота на грешките от около един знак на всеки 2000. Тези данни са достъпни под лиценз CC-BY в хранилище в GitHub и са в основата на новия набор от данни с проверен текст.

Малките модели побеждават по-големите конкуренти

И 14-те модела са свободно достъпни и работят на локален хардуер без API ключ. Метриката е честота на грешките на знаците (CER) — делът на неправилно разпознатите знаци. Класацията разделя резултатите на вариант „дипломатичен“, който отчита осъвременяването на архаични знаци като дългото s (ſ) като грешка, и вариант „за четене“, който допуска такива промени.

Водещият модел dots.mocr използва само 3 милиарда параметъра, докато Qwen3.5-9B получава по-нисък резултат, въпреки че е почти три пъти по-голям. OvisOCR2 заема второ място с едва 0,9 милиарда параметъра при 46 цента на хиляда страници. Размерът на модела и качеството на OCR не са свързани при исторически документи.

Модел Размер Точност Цена/1000 страници
dots.mocr 3B 97.6% $1.94
OvisOCR2 0.9B 96.9% $0.46
PaddleOCR-VL-1.6 1B 96.1% $0.34
olmOCR-2 8.3B 95.7% $0.45
LightOnOCR-2 1B 95.1% $0.37
Qwen3.5-9B 9.7B 94.9% $0.89
DeepSeek-OCR 3.3B 93.8% $0.37

Оценяването обхваща само шрифтове Antiqua на четири езика. То не отчита Fraktur, нелатински писмености или ръкописен текст, а FineBooks е ограничен до едноколонни страници от книги. Екипът планира да обработи повторно около 200 000 документа от обществено достояние на BHL с един от водещите модели и да публикува текста като отворен набор от данни. Нови модели се добавят към класацията постоянно, а рамката за оценяване е свободно достъпна.

Достатъчно добро за обучение на изкуствен интелект, но твърде неточно за научна работа

Авторите на FineBooks оценяват резултатите според предназначението им. За обучение на езикови модели най-добре представилите се модели работят достатъчно добре, пишат те. Моделите допускат много по-малко грешки от старите процеси, а повторната обработка на колекция с размера на BHL е реалистична при измерените разходи.

Библиотеките се сблъскват с различен проблем, отбелязва екипът. Техните системи разчитат на ALTO XML — формат с координати на ниво дума. Новите модели извеждат Markdown или обикновен текст без позиции на думите, така че не могат да се включат в съществуващата библиотечна инфраструктура.

За научни транскрипции точността все още не е достатъчна, но не защото моделите разчитат неправилно знаците. Те незабелязано ги осъвременяват, заменяйки дългото „s“ или лигатурите със съвременни еквиваленти. Според екипа целенасоченото дообучаване може да реши този проблем.

Новини за изкуствения интелект без сензация – подбрани от хора

Абонирайте се за THE DECODER, за да четете без реклами, да получавате седмичен бюлетин за изкуствения интелект, нашия ексклузивен шест пъти годишно доклад за новите тенденции „AI Radar“, пълен достъп до архива и достъп до секцията за коментари.

Източник: Hugging Face

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от The Decoder на

Прочетете оригинала в The Decoder ↗

Текстът и изображенията са собственост на The Decoder и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини