Come funziona OCR · immagine/PDF in testo
L'OCR converte un'immagine scansionata o un PDF basato su immagini in testo che puoi copiare, cercare e modificare, usando tesseract.js in esecuzione interamente nel tuo browser. Scegli la lingua del documento dal selettore, il modello linguistico pertinente si scarica nel tuo browser una volta, e tutti i riconoscimenti successivi girano offline da quel modello in cache. I tuoi file scansionati non vengono mai trasmessi ad alcun server durante la conversione.
La precisione del riconoscimento dipende fortemente dalla qualità della scansione. Scansioni pulite e ad alto contrasto a 200 DPI o superiori, con rumore di fondo minimo e allineamento retto della pagina, producono i migliori risultati. JPEG sfocati, a bassa risoluzione o molto compressi, pagine con colonne o layout complessi e testo scritto a mano riducono tutti la precisione. Lo strumento genera un blocco di testo semplice; per output strutturato come tabelle preservate o layout multi-colonna, è necessaria un'elaborazione successiva. Eseguire lo strumento PDF Deskew sulle scansioni storte prima dell'OCR migliora tipicamente i tassi di riconoscimento.