Geen upload, 100% lokaal, geen account

Maak een gescande PDF doorzoekbaar

Zet een gescande PDF neer en krijg dezelfde pagina's terug met daarbovenop een onzichtbare, doorzoekbare tekstlaag. De herkenning draait volledig in je browser (op je apparaat, offline na de eerste keer laden), er wordt niets geüpload.

Hoe PDF-OCR · doorzoekbaar maken werkt

PDF-OCR maakt van een gescande PDF, een PDF die alleen uit paginabeelden bestaat zonder echte tekst, een doorzoekbare PDF: dezelfde paginabeelden, met daaroverheen een onzichtbare tekstlaag op de positie van elk herkend woord. Open het resultaat in een willekeurige PDF-lezer en je kunt voortaan met Ctrl+F een woord zoeken, een alinea selecteren en kopiëren, of het document laten indexeren door een zoekmachine, allemaal dingen die een gewone scan niet kan. De herkenning zelf draait op tesseract.js (dezelfde self-hosted OCR-engine als de OCR-tool gebruikt), en het renderen van de pagina's gebeurt met pdf.js; beide draaien volledig in je browsertab, en je bestand wordt nooit geüpload.

Deze tool is eerlijk over wat hij wel en niet doet. Hij reconstrueert geen lay-out, tabellen of lettertypen, en het is geen omzetter naar een bewerkbaar document: de zichtbare pagina blijft een afbeelding, identiek aan de bronscan, met een verborgen tekstlaag eronder toegevoegd. De nauwkeurigheid van de herkenning hangt af van de scankwaliteit, dezelfde richtlijn van 200 DPI of hoger, hoog contrast en een rechte pagina die voor elke OCR-engine geldt. Heb je alleen de platte, geëxtraheerde tekst nodig en geen doorzoekbare PDF, dan levert de OCR-tool in plaats daarvan een .txt-bestand op en is die sneller voor die specifieke taak.

Hoe je PDF-OCR · doorzoekbaar maken gebruikt, stap voor stap

  1. Sleep je gescande PDF (één paginabeeld per pagina, zonder bestaande tekstlaag) naar het uploadvak.
  2. Kies de hoofdtaal van het document in de taalkeuzelijst.
  3. Wacht bij het eerste gebruik van de tool tot de tesseract.js-engine is gedownload (dit gebeurt eenmalig).
  4. Klik op starten en wacht terwijl elke pagina op zijn beurt wordt gerenderd en herkend.
  5. Download de doorzoekbare PDF: hetzelfde uiterlijk, nu met een tekstlaag eronder.

Veelvoorkomende toepassingen

  • Een gescand contract moet doorzoekbaar zijn, zodat een specifieke clausule met Ctrl+F te vinden is in plaats van elke pagina door te lezen.
  • Een reeks gescande facturen moet naar een documentarchief waar de zoekindex alleen echte PDF-tekst leest.
  • Een gefotografeerd of gescand formulier moet selecteerbare gedrukte labels krijgen, zodat een alinea in een e-mail kan worden gekopieerd.
  • Een verzameling gescande rapporten in het Duits heeft volledige tekstzoekfunctie nodig; kies Duits als taal voordat je de tool start.

Veelgestelde vragen

Wat is het verschil met de gewone OCR-tool?

De OCR-tool haalt platte tekst uit een bestand en zet die in een .txt-bestand, waarbij de oorspronkelijke lay-out en afbeeldingen volledig verdwijnen. PDF-OCR behoudt de oorspronkelijke PDF-paginabeelden precies zoals ze eruitzien en voegt daaronder een onzichtbare, doorzoekbare tekstlaag toe. Gebruik OCR als je alleen de woorden nodig hebt; gebruik PDF-OCR als je het document als PDF wilt behouden maar wel doorzoekbaar en selecteerbaar wilt maken.

Ziet de uitvoer-PDF er anders uit dan mijn scan?

Nee. Elke pagina wordt vanuit je bron-PDF gerenderd en opnieuw als afbeelding ingesloten, pixel-identiek aan de originele scan (afgezien van eventuele JPEG-hercodering). De herkende woorden worden er met een doorzichtigheid van nul overheen getekend, dus er is niets nieuws zichtbaar; alleen een tekstzoekopdracht of tekstselectie laat de toegevoegde laag zien.

Reconstrueert de tool tabellen, kolommen of lettertypen?

Nee. De uitvoer houdt de pagina als één plat beeld; de onzichtbare tekstlaag volgt de posities van de herkende woorden, maar behoudt geen tabelstructuur of leesvolgorde bij meerdere kolommen buiten wat tesseract.js zelf afleidt, en ook niet de originele lettertypen. Dit is een laag om doorzoekbaarheid toe te voegen, geen omzetting naar bewerkbare tekst.

Worden mijn gescande documenten ergens naartoe verzonden tijdens de verwerking?

Nee. Nadat de tesseract.js-engine en het taalpakket van deze site zijn gedownload (een eenmalige download van enkele megabytes bij het eerste gebruik), gebeurt elke paginarender en elke herkenningsronde volledig in je browsertab. Gescande contracten, medische dossiers of andere gevoelige documenten bereiken nooit een server.

Waarom duurt het verwerken van een lange PDF een tijdje?

Elke pagina wordt naar een afbeelding gerenderd en OCR wordt per afbeelding afzonderlijk uitgevoerd, allemaal in je browsertab, zodat de verwerkingstijd oploopt met het aantal pagina's. De voortgangsbalk toont de echte voortgang per pagina, en bestanden zijn beperkt tot 80 MB om het hele proces binnen het geheugenbudget van een browsertab te houden.

Wat als mijn PDF al selecteerbare tekst heeft?

OCR uitvoeren op een PDF die al een echte tekstlaag bevat, is niet nodig: die openen in een lezer en op Ctrl+F drukken werkt dan al. Deze tool is bedoeld voor PDF's die uit paginabeelden bestaan zonder onderliggende tekst, de gebruikelijke uitvoer van een flatbedscanner of een "afdrukken naar PDF" van een gefotografeerd document.