Ingen opplasting, 100% lokalt, ingen konto

Slik gjør du

Gjør en skannet PDF søkbar

En skannet PDF ser ut som et vanlig dokument, men er egentlig et bilde av en side: Ctrl+F finner ingenting, og du kan ikke markere eller kopiere et eneste ord. PDF OCR-verktøyet fikser dette uten å endre hva filen er. Det leser hvert sidebilde, gjenkjenner tegnene med en OCR-motor på enheten, og legger den gjenkjente teksten usynlig oppå det samme bildet, slik at PDF-en fortsatt ser ut og skrives ut nøyaktig som før, men nå reagerer på søk og tekstmarkering. Filen forlater aldri enheten din.

Steg for steg

  1. Åpne PDF OCR-verktøyet og slipp den skannede PDF-en din inn. Bare PDF-filer godtas, og filen er begrenset til 80 MB; en typisk flersides skanning er godt under det.
  2. Velg dokumentets språk fra nedtrekksmenyen (engelsk, fransk, tysk, spansk, portugisisk eller italiensk) og, hvis du vil, rediger filnavnet for resultatet. Standarden beholder .pdf-utvidelsen automatisk.
  3. Klikk Kjør og vent til hver side er behandlet. Hver side gjengis, kjøres gjennom OCR-motoren og får sitt eget usynlige tekstlag før verktøyet går videre til neste, så et langt dokument tar lengre tid enn en enkelt side. Last ned resultatet: det åpnes og skrives ut identisk med originalen, men Ctrl+F, tekstmarkering og kopier-lim-inn fungerer nå.

Søkbar PDF eller ren tekst: hvilken trenger du egentlig

Dette verktøyet og det vanlige OCR-verktøyet løser det samme underliggende problemet, gjenkjenning av tekst i et skannet bilde, men de beholder forskjellige ting. OCR-verktøyet kaster bort sidebildet og gir deg tilbake en ren .txt-fil: bruk det når du vil lime ordene inn i et redigeringsprogram, oversette dem eller søke i dem som tekst, og du ikke bryr deg om å bevare dokumentets opprinnelige utseende. PDF OCR-verktøyet her beholder den opprinnelige PDF-en nøyaktig som den er, sidebilder og alt, og legger bare til et skjult tekstlag under: bruk det når dokumentet må forbli en PDF du fortsatt kan skrive ut, sende på e-post eller arkivere, men du også vil kunne søke i eller kopiere fra det. Ingen av verktøyene rekonstruerer layouten som redigerbar tekst med ekte skrifttyper og tabeller; begge jobber ut fra den samme gjenkjente teksten, bare pakket forskjellig.

Hvorfor resultatet avhenger av skanningen, og hvor grensene ligger

Gjenkjenningens nøyaktighet følger kvaliteten på kildebildet, på samme måte som for vanlig OCR: en ren, rett skanning på rundt 200 til 300 DPI gjenkjenner pålitelig, mens et uskarpt foto, en skjev side eller kraftige skygger gir flere feillesninger. Hvis en side kom ut skjev, rett den opp med PDF-rettvinkle-verktøyet før du kjører OCR slik at gjenkjenningstrinnet leser jevn tekst. Verktøyet dekker seks språk (engelsk, fransk, tysk, spansk, portugisisk, italiensk); et dokument på et språk som ikke støttes vil ikke gjenkjennes riktig. Behandlingen skjer side for side i nettleserfanen din, så et dokument med dusinvis av sider tar merkbart lengre tid enn en toside-skanning, og filen er begrenset til 80 MB. Utdata-PDF-en har også en tendens til å være lik i størrelse som originalen, siden selve sidebildene ikke røres; hvis du trenger en mindre fil etterpå, kjør den gjennom PDF-komprimeringen.

Hvordan det usynlige tekstlaget bygges

Hver PDF-side rasteriseres først til et canvas-bilde i nettleseren din, det samme rendertrinnet som PDF-til-bilde-verktøyet bruker. OCR-motoren (Tesseract, kompilert til WebAssembly) leser det bildet og returnerer hvert gjenkjente ord sammen med dets avgrensningsboks, dets posisjon på siden. Disse ordene tegnes så tilbake på en kopi av den opprinnelige PDF-siden ved deres gjenkjente posisjoner, men med null opasitet, slik at ingenting endres visuelt: sidebildet du ser og skriver ut er det samme som ble skannet, liggende oppå. En PDF-lesers søke- og tekstmarkeringsfunksjoner ser bare på det usynlige tekstlaget, som er grunnen til at filen blir søkbar og markerbar uten å se annerledes ut. Alt dette, gjengiving, gjenkjenning og gjenoppbygging, skjer inne i nettleserfanen din; PDF-en leses fra lokal disk og overføres aldri noe sted.

Verktøyene brukt i denne guiden

Ofte stilte spørsmål

Vil den søkbare PDF-en fortsatt se ut og skrives ut nøyaktig som den opprinnelige skanningen?

Ja. Verktøyet endrer aldri sidebildet; det legger bare til et usynlig tekstlag under det. På skjerm og på papir er resultatet visuelt identisk med skanningen du slapp inn. Det som endres er at en lesers søke- og tekstmarkeringsverktøy nå kan finne og gripe de gjenkjente ordene, fordi de leser fra det skjulte laget.

Hvorfor finnes dette verktøyet ved siden av det vanlige OCR-verktøyet?

De svarer på forskjellige behov ut fra samme gjenkjenningstrinn. OCR-verktøyet gir deg en ren tekstfil, som er det du vil ha hvis du planlegger å lime inn, redigere eller oversette ordene og ikke trenger å beholde dokumentet som en PDF. Dette verktøyet beholder filen som en PDF med de opprinnelige sidebildene intakt, som er det du vil ha hvis dokumentet fortsatt må skrives ut, arkiveres eller sendes på e-post som det er, men du også vil kunne søke i eller kopiere tekst fra det.

Kilder