Ingen opplasting, 100% lokalt, ingen konto

Artikkel

Hvorfor du ikke kan kopiere tekst fra enkelte PDF-er

Prøv å markere en linje i én PDF, og ordene fremheves normalt, klare til å kopieres. Prøv samme bevegelse i en annen PDF, og ingenting skjer, eller markøren griper hele siden som et fotografi, fordi det er nøyaktig hva det er. To filer som ser identiske ut på skjermen kan være helt forskjellig bygget under. Her er hvordan du vet hvilken type du har, og hva du gjør med den som motstår kopiering.

To forskjellige typer PDF-side

En PDF kan lagre en side på to svært forskjellige måter. I en tekstbasert PDF er hver bokstav et tegnobjekt med en Unicode-verdi, en skrifttype og en posisjon, på samme måte som en nettside lagrer tekst: en leser kan markere den, søke i den, og en skjermleser kan lese den høyt. I en bildebasert PDF er siden ett flatt bilde, ofte produsert av en skanner, en faks, eller et «skriv ut til PDF»-trinn brukt på et bilde av et dokument. Bokstavene ser like ut for øynene dine, men for filformatet finnes det ikke noe tegn under, bare piksler.

Sammenligning side ved side: en tekstbasert PDF-side med en markert, kopierbar tekstlinje ved siden av en bildebasert PDF-side der den samme teksten er ett flatt bilde uten markering.

En rask måte å avgjøre hvilken du har

Trykk Ctrl+F eller Cmd+F og søk etter et ord du tydelig kan se på siden. Hvis søket finner det og fremhever det, har siden et ekte tekstlag. Hvis søket ikke finner noe noe sted i dokumentet, er siden et bilde, uansett hvor skarpt eller hvor mye det ligner et skrevet dokument. Å dra musen for å markere en linje gir samme svar: en markering versus en vanlig rektangelmarkering.

Å rekonstruere teksten med OCR

Optisk tegngjenkjenning (OCR) leser pikslene i en bildebasert side og matcher formene mot en trenet modell av bokstaver for et gitt språk, og bygger deretter et tekstlag med de gjenkjente tegnene plassert der de dukket opp. Et verktøy som ocr gjør dette helt i nettleseren: ingenting lastes opp, og resultatet er en ren tekstfil du kan søke i, kopiere eller redigere. Nøyaktighet avhenger av kilden: en ren, rett, høyoppløselig skanning på et godt støttet språk gjenkjenner pålitelig, mens en skjev, uskarp, kontrastfattig eller håndskrevet side gir flere feil, noen ganger et feil tegn eller et feillest ord.

Pipelinediagram: pikslene i en skannet side går gjennom OCR-tegngjenkjenning og kommer ut som et rekonstruert, posisjonert tekstlag.

Når filen allerede har tekst men ekstraheringen ser feil ut

Hvis PDF-en din faktisk har et ekte tekstlag, men et verktøy som pdf-til-tekst produserer tekst i en merkelig rekkefølge, med kolonner slått sammen eller mellomrom kollapset, er det et annet, urelatert problem: tekstobjektene finnes, men leserekkefølgen deres på siden ble ikke lagret slik et skript naturlig forventer. Det er en layout-finurlighet å rydde opp etter ekstrahering, ikke et tegn på at teksten mangler, og det trenger ikke OCR for å fikses.

Verktøy i denne artikkelen

Ofte stilte spørsmål

PDF-en min ser ut som et vanlig skrevet dokument, men jeg kan fortsatt ikke markere noen tekst. Hvorfor?

Det er mest sannsynlig en skannet eller fotografert side lagret som en PDF, eller et dokument flatet ut til et bilde med vilje. Visuelt kan det være umulig å skille fra en tekstbasert PDF; forskjellen viser seg bare når du prøver å søke eller markere den. Å kjøre den gjennom OCR bygger et ekte, markerbart tekstlag fra pikslene.

Fungerer OCR like godt på alle språk?

Nei. Nøyaktighet avhenger av om det finnes en trenet modell for det språket og skriften, og av kvaliteten på skanningen. Godt støttede språk på en ren, rett skanning gjenkjenner pålitelig; håndskrift, lavoppløselige bilder, eller språk med mindre treningsdata gir flere feil. OCR-resultatet er alltid en beste-innsats-transkripsjon, verdt en rask korrekturlesing før du stoler på det.

Kilder