Ingen upload, 100% lokalt, ingen konto

Artikel

Hvorfor du ikke kan kopiere tekst fra nogle PDF'er

Prøv at markere en linje i én PDF, og ordene fremhæves normalt, klar til at kopiere. Prøv den samme bevægelse i en anden PDF, og der sker ingenting, eller markøren griber hele siden som et fotografi, fordi det er præcis, hvad det er. To filer, der ser identiske ud på skærmen, kan være bygget helt forskelligt indeni. Her er, hvordan du kan se hvilken slags du har, og hvad du kan gøre ved den, der modstår kopiering.

To forskellige slags PDF-side

En PDF kan gemme en side på to meget forskellige måder. I en tekstbaseret PDF er hvert bogstav et tegnobjekt med en Unicode-værdi, en skrifttype og en position, på samme måde som en webside gemmer tekst: en fremviser kan markere det, søge i det, og en skærmlæser kan læse det højt. I en billedbaseret PDF er siden ét fladt billede, ofte produceret af en scanner, en fax eller et 'udskriv til PDF'-trin anvendt på et foto af et dokument. Bogstaverne ser ens ud for dine øjne, men for filformatet er der intet tegn nedenunder, kun pixels.

Side-om-side-sammenligning: en tekstbaseret PDF-side med en fremhævet, markerbar linje tekst ved siden af en billedbaseret PDF-side, hvor den ens udseende tekst er ét fladt billede uden markering

En hurtig måde at se, hvilken du har

Tryk Ctrl+F eller Cmd+F, og søg efter et ord, du tydeligt kan se på siden. Finder søgningen det og fremhæver det, har siden et rigtigt tekstlag. Finder søgningen intet nogen steder i dokumentet, er siden et billede, uanset hvor skarpt eller hvor meget som et maskinskrevet dokument det ser ud. At trække musen for at markere en linje giver det samme svar: en fremhævning versus en almindelig rektangelmarkering.

Genopbygning af teksten med OCR

Optisk tegngenkendelse (OCR) læser pixlerne i en billedbaseret side og matcher formerne mod en trænet model af bogstaver for et givet sprog, og genopbygger derefter et tekstlag med de genkendte tegn placeret, hvor de fremstod. Et værktøj som OCR gør dette helt i browseren: intet uploades, og outputtet er en almindelig tekstfil, du kan søge i, kopiere eller redigere. Nøjagtigheden afhænger af kilden: en ren, lige, høj-opløsnings scanning på et velunderstøttet sprog genkender pålideligt, mens en skæv, sløret, lav-kontrast eller håndskrevet side giver flere fejl, nogle gange et forkert tegn eller et fejllæst ord.

Pipeline-diagram: pixlerne på en scannet side gennemgår OCR-tegngenkendelse og kommer ud som et genopbygget, placeret tekstlag

Når filen allerede har tekst, men udtrækning ser forkert ud

Hvis din PDF rent faktisk har et rigtigt tekstlag, men et værktøj som PDF til tekst producerer tekst i en mærkelig rækkefølge, med kolonner blandet sammen eller mellemrum kollapset, er det et andet, urelateret problem: tekstobjekterne findes, men deres læserækkefølge på siden blev ikke gemt på den måde, et script naturligt forventer. Det er en layout-finurlighed at rydde op i efter udtrækning, ikke et tegn på, at teksten mangler, og det kræver ikke OCR at rette.

Værktøjer i denne artikel

Ofte stillede spørgsmål

Min PDF ligner et normalt maskinskrevet dokument, men jeg kan stadig ikke markere nogen tekst. Hvorfor?

Det er mest sandsynligt en scannet eller fotograferet side gemt som en PDF, eller et dokument fladlagt til et billede med vilje. Visuelt kan det være umuligt at skelne fra en tekstbaseret PDF; forskellen viser sig kun, når du prøver at søge i eller markere den. At køre den gennem OCR genopbygger et rigtigt, markerbart tekstlag ud fra pixlerne.

Virker OCR lige godt på alle sprog?

Nej. Nøjagtigheden afhænger af, om der findes en trænet model for det sprog og skrift, og af scanningens kvalitet. Velunderstøttede sprog på en ren, lige scanning genkendes pålideligt; håndskrift, lavopløsningsbilleder eller sprog med mindre træningsdata giver flere fejl. OCR-output er altid en efter-bedste-evne-transskription, værd at korrekturlæse hurtigt, før du stoler på det.

Kilder