Как вы себе представляете работу OCR? Страничка сканируется, программа находит области с буквами, распознает их и выдает текст. Старый добрый Tesseract так и пашет. А вот новый baidu/Unlimited-OCR делает финт ушами: он вообще не ищет буквы. Он берет всю страницу как картинку , жмет ее в горстку…
Unlimited-OCR от Baidu: читает страницу как картинку
Это краткое изложение. Полный текст материала доступен на сайте источника.