Hoe OCR · afbeelding/PDF naar tekst werkt
OCR converteert een gescande afbeelding of op afbeeldingen gebaseerde PDF naar tekst die je kunt kopiëren, doorzoeken en bewerken, met tesseract.js dat volledig in je browser draait. Je kiest de documenttaal uit de selector, het relevante taalmodel wordt eenmalig naar je browser gedownload, en alle volgende herkenning draait offline vanuit dat gecachete model. Je gescande bestanden worden nooit naar een server verzonden tijdens de conversie.
Herkenningsnauwkeurigheid hangt sterk af van de scankwaliteit. Schone scans met hoog contrast bij 200 DPI of hoger, met minimale achtergrondstoring en rechte paginauitlijning, produceren de beste resultaten. Wazige, laagresolutie of zwaar gecomprimeerde JPEG-bestanden, pagina's met kolommen of complexe lay-outs en handgeschreven tekst verlagen de nauwkeurigheid. De tool geeft een platte tekstblok als uitvoer; voor gestructureerde uitvoer zoals bewaarde tabellen of meerkolomige lay-out is naverwerking nodig. Het uitvoeren van de PDF-rechtzettool op scheve scans voor OCR verbetert doorgaans de herkenningspercentages.