Hoe PDF-OCR · doorzoekbaar maken werkt
PDF-OCR maakt van een gescande PDF, een PDF die alleen uit paginabeelden bestaat zonder echte tekst, een doorzoekbare PDF: dezelfde paginabeelden, met daaroverheen een onzichtbare tekstlaag op de positie van elk herkend woord. Open het resultaat in een willekeurige PDF-lezer en je kunt voortaan met Ctrl+F een woord zoeken, een alinea selecteren en kopiëren, of het document laten indexeren door een zoekmachine, allemaal dingen die een gewone scan niet kan. De herkenning zelf draait op tesseract.js (dezelfde self-hosted OCR-engine als de OCR-tool gebruikt), en het renderen van de pagina's gebeurt met pdf.js; beide draaien volledig in je browsertab, en je bestand wordt nooit geüpload.
Deze tool is eerlijk over wat hij wel en niet doet. Hij reconstrueert geen lay-out, tabellen of lettertypen, en het is geen omzetter naar een bewerkbaar document: de zichtbare pagina blijft een afbeelding, identiek aan de bronscan, met een verborgen tekstlaag eronder toegevoegd. De nauwkeurigheid van de herkenning hangt af van de scankwaliteit, dezelfde richtlijn van 200 DPI of hoger, hoog contrast en een rechte pagina die voor elke OCR-engine geldt. Heb je alleen de platte, geëxtraheerde tekst nodig en geen doorzoekbare PDF, dan levert de OCR-tool in plaats daarvan een .txt-bestand op en is die sneller voor die specifieke taak.