Sådan gør du
Gør en scannet PDF søgbar
En scannet PDF ser ud som et normalt dokument, men er i virkeligheden et billede af en side: Ctrl+F finder intet, og du kan ikke markere eller kopiere et eneste ord. Værktøjet PDF OCR retter det uden at ændre, hvad filen er. Det læser hvert sidebillede, genkender tegnene med en OCR-motor på enheden og lægger den genkendte tekst usynligt oven på det samme billede, så PDF'en stadig ser ud og printer nøjagtigt som før, men nu reagerer på søgning og tekstmarkering. Filen forlader aldrig din enhed.
Trin for trin
- Åbn værktøjet PDF OCR, og slip din scannede PDF i det. Kun PDF-filer accepteres, og filen er begrænset til 80 MB; en typisk flersidet scanning ligger langt under det.
- Vælg dokumentets sprog fra rullelisten (engelsk, fransk, tysk, spansk, portugisisk eller italiensk), og rediger om ønsket navnet på outputfilen. Standarden beholder automatisk .pdf-filendelsen.
- Klik på Kør, og vent, mens hver side behandles. Hver side gengives, køres gennem OCR-motoren og får sit eget usynlige tekstlag, før værktøjet går videre til den næste, så et langt dokument tager længere tid end en enkelt side. Download resultatet: det åbner og printer identisk med originalen, men Ctrl+F, tekstmarkering og kopiér-indsæt virker nu.
Søgbar PDF eller ren tekst: hvad har du egentlig brug for
Dette værktøj og det almindelige OCR-værktøj løser det samme underliggende problem, at genkende tekst i et scannet billede, men de beholder forskellige ting. OCR-værktøjet kasserer sidebilledet og giver dig en almindelig .txt-fil tilbage: brug det, når du vil indsætte ordene i en editor, oversætte dem eller søge i dem som tekst, og du er ligeglad med at bevare dokumentets oprindelige udseende. Værktøjet PDF OCR her beholder den oprindelige PDF nøjagtigt, som den er, sidebilleder og det hele, og tilføjer kun et skjult tekstlag nedenunder: brug det, når dokumentet skal forblive en PDF, du stadig kan printe, sende med mail eller arkivere, men du også vil kunne søge i eller kopiere fra det. Ingen af værktøjerne genopbygger layoutet som redigerbar tekst med rigtige skrifttyper og tabeller; begge arbejder ud fra den samme genkendte tekst, bare pakket forskelligt.
Hvorfor resultatet afhænger af scanningen, og hvor grænserne ligger
Genkendelsens nøjagtighed følger kildebilledets kvalitet, på samme måde som for almindelig OCR: en ren, lige scanning omkring 200 til 300 DPI genkender pålideligt, mens et sløret foto, en skæv side eller kraftige skygger giver flere fejllæste ord. Hvis en side kom ud skæv, så ret den med værktøjet Ret skæve scannede sider, før du kører OCR, så genkendelsestrinnet læser lige tekst. Værktøjet dækker seks sprog (engelsk, fransk, tysk, spansk, portugisisk, italiensk); et dokument på et sprog, der ikke understøttes, genkendes ikke korrekt. Behandlingen kører side for side i din browserfane, så et dokument med dusinvis af sider tager mærkbart længere tid end en to-siders scanning, og filen er begrænset til 80 MB. Output-PDF'en har også tendens til at have en størrelse svarende til originalen, da selve sidebillederne ikke røres; hvis du bagefter har brug for en mindre fil, kan du køre den gennem PDF-komprimeringen.
Sådan bygges det usynlige tekstlag
Hver PDF-side rasteriseres først til et canvas-billede i din browser, det samme rendering-trin, som værktøjet PDF til billeder bruger. OCR-motoren (Tesseract, kompileret til WebAssembly) læser det billede og returnerer hvert genkendt ord sammen med dets afgrænsningsboks, dets position på siden. De ord tegnes derefter tilbage på en kopi af den oprindelige PDF-side på deres genkendte positioner, men med nul opacitet, så intet ændrer sig visuelt: sidebilledet, du ser og printer, er det samme, der blev scannet, liggende ovenpå. En PDF-fremvisers søge- og tekstmarkeringsfunktioner ser kun på det usynlige tekstlag, hvilket er grunden til, at filen bliver søgbar og markerbar uden at se anderledes ud. Alt dette, rendering, genkendelse og genopbygning, sker inde i din browserfane; PDF'en læses fra den lokale disk og sendes aldrig nogen steder hen.
Værktøjerne brugt i denne guide
- PDF OCR · gør den søgbarGør en scannet PDF søgbar og markerbar helt i din browser, ingen upload.
- OCR · billede/PDF til tekstUdtræk tekst fra scannede billeder eller PDF'er helt i din browser, kører offline, ingen upload.
- Ret skæve scannede siderRet skæve scannede PDF'er eller billeder helt i din browser, ingen upload.
- Komprimér PDFReducer PDF-filstørrelsen ved at optimere den interne struktur tabsfrit, uden upload.
Ofte stillede spørgsmål
Vil den søgbare PDF stadig se ud og printe nøjagtigt som den oprindelige scanning?
Ja. Værktøjet ændrer aldrig sidebilledet; det tilføjer kun et usynligt tekstlag nedenunder. På skærmen og på papir er outputtet visuelt identisk med den scanning, du slap i. Det, der ændrer sig, er, at en fremvisers søge- og tekstmarkeringsværktøjer nu kan finde og gribe de genkendte ord, fordi de læser fra det skjulte lag.
Hvorfor findes dette værktøj sammen med det almindelige OCR-værktøj?
De svarer på forskellige behov ud fra det samme genkendelsestrin. OCR-værktøjet giver dig en almindelig tekstfil, hvilket er det, du vil have, hvis du planlægger at indsætte, redigere eller oversætte ordene og ikke behøver at beholde dokumentet som en PDF. Dette værktøj beholder filen som en PDF med de oprindelige sidebilleder intakte, hvilket er det, du vil have, hvis dokumentet stadig skal printes, arkiveres eller sendes med mail som det er, men du også vil kunne søge i eller kopiere tekst fra det.