Cum funcționează OCR · imagine/PDF în text
OCR convertește o imagine scanată sau un PDF bazat pe imagini în text pe care îl puteți copia, căuta și edita, folosind tesseract.js care rulează complet în browserul dumneavoastră. Alegeți limba documentului din selector, modelul de limbă relevant se descarcă în browserul dumneavoastră o singură dată, iar toate recunoașterile ulterioare rulează offline din modelul memorat în cache. Fișierele dumneavoastră scanate nu sunt niciodată transmise vreunui server în timpul conversiei.
Precizia recunoașterii depinde puternic de calitatea scanării. Scanările curate, cu contrast ridicat la 200 DPI sau mai mult, cu zgomot de fundal minim și aliniere dreaptă a paginii produc cele mai bune rezultate. JPEG-urile foarte comprimate, cu rezoluție scăzută sau foarte comprimate, paginile cu coloane sau aspecte complexe și textul scris de mână reduc precizia. Instrumentul produce un bloc de text simplu; pentru rezultate structurate, cum ar fi tabele păstrate sau aspect multi-coloană, este necesară post-procesare. Rularea instrumentului PDF Deskew pe scanările înclinate înainte de OCR îmbunătățește de obicei ratele de recunoaștere.