Geen upload, 100% lokaal, geen account

Stappenplan

Een gescande PDF doorzoekbaar maken

Een gescande PDF ziet er uit als een normaal document maar is eigenlijk een foto van een pagina: Ctrl+F vindt niets, en je kunt geen enkel woord selecteren of kopiëren. De tool PDF-OCR lost dit op zonder te veranderen wat het bestand is. Ze leest elke pagina-afbeelding, herkent de tekens met een OCR-engine op je apparaat, en legt de herkende tekst onzichtbaar bovenop diezelfde afbeelding, zodat de PDF er nog steeds precies zo uitziet en print als voorheen, maar nu reageert op zoeken en tekstselectie. Het bestand verlaat nooit je apparaat.

Stap voor stap

  1. Open de tool PDF-OCR en zet je gescande PDF erin. Alleen PDF-bestanden worden geaccepteerd, en het bestand is beperkt tot 80 MB; een typische scan met meerdere pagina's blijft daar ruim onder.
  2. Kies de taal van het document uit de vervolgkeuzelijst (Engels, Frans, Duits, Spaans, Portugees of Italiaans) en pas, als je wilt, de naam van het uitvoerbestand aan. De standaardnaam behoudt automatisch de extensie .pdf.
  3. Klik op Uitvoeren en wacht tot elke pagina is verwerkt. Elke pagina wordt gerenderd, door de OCR-engine gehaald en krijgt een eigen onzichtbare tekstlaag voordat de tool verdergaat naar de volgende, dus een lang document duurt langer dan een enkele pagina. Download het resultaat: het opent en print identiek aan het origineel, maar Ctrl+F, tekstselectie en kopiëren-plakken werken nu.

Doorzoekbare PDF of platte tekst: wat heb je echt nodig

Deze tool en de gewone OCR-tool lossen hetzelfde onderliggende probleem op, tekst herkennen in een gescande afbeelding, maar ze behouden verschillende dingen. De OCR-tool gooit de pagina-afbeelding weg en geeft je een plat .txt-bestand terug: gebruik het als je de woorden in een editor wilt plakken, vertalen of als tekst wilt doorzoeken, en het je niet uitmaakt of de oorspronkelijke vormgeving van het document behouden blijft. De tool PDF-OCR hier houdt de oorspronkelijke PDF precies zoals hij is, pagina-afbeeldingen en al, en voegt alleen een verborgen tekstlaag eronder toe: gebruik hem als het document een PDF moet blijven die je nog kunt printen, e-mailen of archiveren, maar je er ook tekst uit wilt kunnen zoeken of kopiëren. Geen van beide tools reconstrueert de lay-out als bewerkbare tekst met echte lettertypen en tabellen; beide werken vanuit dezelfde herkende tekst, alleen anders verpakt.

Waarom het resultaat afhangt van de scan, en waar de grenzen liggen

De herkenningsnauwkeurigheid volgt de kwaliteit van de bronafbeelding, net als bij gewone OCR: een schone, rechte scan van ongeveer 200 tot 300 DPI wordt betrouwbaar herkend, terwijl een wazige foto, een scheve pagina of zware schaduwen meer verkeerd gelezen woorden opleveren. Kwam een pagina scheef uit de scanner, zet hem dan eerst recht met de tool Gescande pagina's rechtzetten voordat je OCR uitvoert, zodat de herkenningsstap rechte tekst leest. De tool ondersteunt zes talen (Engels, Frans, Duits, Spaans, Portugees, Italiaans); een document in een niet-ondersteunde taal wordt niet correct herkend. De verwerking gebeurt pagina voor pagina in je browsertab, dus een document met tientallen pagina's duurt merkbaar langer dan een scan van twee pagina's, en het bestand is beperkt tot 80 MB. De uitvoer-PDF blijft ook meestal ongeveer even groot als het origineel, omdat de pagina-afbeeldingen zelf niet worden aangeraakt; heb je daarna een kleiner bestand nodig, stuur het dan door de PDF-compressor.

Hoe de onzichtbare tekstlaag wordt opgebouwd

Elke PDF-pagina wordt eerst gerasteriseerd naar een canvas-afbeelding in je browser, dezelfde renderstap die de tool PDF naar afbeeldingen gebruikt. De OCR-engine (Tesseract, gecompileerd naar WebAssembly) leest die afbeelding en geeft elk herkend woord terug samen met zijn begrenzingskader, zijn positie op de pagina. Die woorden worden vervolgens teruggetekend op een kopie van de oorspronkelijke PDF-pagina op hun herkende posities, maar met nul dekking, zodat er visueel niets verandert: de pagina-afbeelding die je ziet en print is dezelfde die werd gescand, bovenop liggend. De zoek- en tekstselectiefuncties van een PDF-viewer kijken alleen naar die onzichtbare tekstlaag, waardoor het bestand doorzoekbaar en selecteerbaar wordt zonder er anders uit te zien. Dit alles, renderen, herkennen en opnieuw samenstellen, gebeurt in je browsertab; de PDF wordt van lokale schijf gelezen en nergens naartoe verstuurd.

De tools die in deze gids worden gebruikt

Veelgestelde vragen

Ziet en print de doorzoekbare PDF er nog precies uit als de originele scan?

Ja. De tool wijzigt de pagina-afbeelding nooit; ze voegt er alleen een onzichtbare tekstlaag onder toe. Op scherm en op papier is de uitvoer visueel identiek aan de scan die je erin zette. Wat verandert is dat de zoek- en tekstselectietools van een viewer nu de herkende woorden kunnen vinden en pakken, omdat ze die verborgen laag lezen.

Waarom bestaat deze tool naast de gewone OCR-tool?

Ze beantwoorden verschillende behoeften vanuit dezelfde herkenningsstap. De OCR-tool geeft je een plat tekstbestand, wat je wilt als je van plan bent de woorden te plakken, bewerken of vertalen en het document niet als PDF hoeft te blijven. Deze tool houdt het bestand als PDF met de originele pagina-afbeeldingen intact, wat je wilt als het document nog geprint, gearchiveerd of zo geëmaild moet worden, maar je er ook tekst uit wilt kunnen zoeken of kopiëren.

Bronnen