Jak OCR · obrázek/PDF na text funguje
OCR převádí naskenovaný obrázek nebo PDF založené na obrázcích na text, který můžete kopírovat, vyhledávat a upravovat, pomocí tesseract.js běžícího zcela uvnitř vašeho prohlížeče. Zvolíte jazyk dokumentu z voliče, příslušný jazykový model se stáhne do vašeho prohlížeče jednou a veškeré následné rozpoznávání probíhá offline z tohoto cachovaného modelu. Vaše naskenované soubory nejsou při konverzi nikdy přeneseny na žádný server.
Přesnost rozpoznávání silně závisí na kvalitě skenu. Čisté skeny s vysokým kontrastem při 200 DPI nebo více, s minimálním šumem pozadí a rovným zarovnáním stránek, dosahují nejlepších výsledků. Rozmazané, nízkorozlišovací nebo silně komprimované JPEG, stránky se sloupci nebo složitým rozvržením a ručně psaný text všechny snižují přesnost. Nástroj vydává blok obyčejného textu; pro strukturovaný výstup jako zachované tabulky nebo vícesloupkové rozvržení je nutné post-zpracování. Spuštění nástroje PDF Deskew na křivých skenech před OCR typicky zlepšuje míru rozpoznávání.