Så fungerar OCR · bild/PDF till text
OCR konverterar en skannad bild eller bildbaserad PDF till text du kan kopiera, söka och redigera, med tesseract.js som körs helt inuti din webbläsare. Du väljer dokumentets språk från väljaren, den relevanta språkmodellen laddas ned till din webbläsare en gång, och all efterföljande igenkänning körs offline från den cachade modellen. Dina skannade filer skickas aldrig till någon server under konverteringen.
Igenkänningsnoggrannheten beror starkt på skanningskvaliteten. Rena, högkontrastiga skanningar vid 200 DPI eller över, med minimalt bakgrundsbrus och rak sidorientering, ger de bästa resultaten. Suddiga, lågupplösta eller kraftigt komprimerade JPEG-bilder, sidor med kolumner eller komplexa layouter och handskriven text minskar alla noggrannheten. Verktyget ger ut ett oformaterat textblock; för strukturerad utdata som bevarade tabeller eller flerspaltslayout behövs efterbearbetning. Att köra PDF Deskew-verktyget på skeva skanningar före OCR förbättrar vanligtvis igenkänningshastigheten.