Ingen uppladdning, 100% lokalt, inget konto

Så gör du

Gör en skannad PDF sökbar

En skannad PDF ser ut som ett vanligt dokument men är egentligen en bild av en sida: Ctrl+F hittar ingenting, och du kan inte markera eller kopiera ett enda ord. Verktyget PDF-OCR löser det utan att ändra vad filen är. Det läser varje sidbild, känner igen tecknen med en OCR-motor på din egen enhet, och lägger den igenkända texten osynligt ovanpå samma bild, så att PDF:en fortfarande ser ut och skrivs ut precis som förut men nu svarar på sökning och textmarkering. Filen lämnar aldrig din enhet.

Steg för steg

  1. Öppna verktyget PDF-OCR och släpp in din skannade PDF. Bara PDF-filer tas emot, och filen begränsas till 80 MB; en typisk flersidig skanning ligger klart under det.
  2. Välj dokumentets språk i listrutan (engelska, franska, tyska, spanska, portugisiska eller italienska) och redigera vid behov filnamnet för resultatet. Standardnamnet behåller .pdf-ändelsen automatiskt.
  3. Klicka på Kör och vänta tills varje sida har bearbetats. Varje sida ritas, körs genom OCR-motorn och får sitt eget osynliga textlager innan verktyget går vidare till nästa, så ett långt dokument tar längre tid än en enda sida. Ladda ner resultatet: det öppnas och skrivs ut identiskt med originalet, men Ctrl+F, textmarkering och kopiera-klistra fungerar nu.

Sökbar PDF eller vanlig text: vilket behöver du egentligen

Det här verktyget och det vanliga OCR-verktyget löser samma underliggande problem, att känna igen text i en skannad bild, men de behåller olika saker. OCR-verktyget kastar bort sidbilden och ger dig tillbaka en vanlig .txt-fil: använd det när du vill klistra in orden i en textredigerare, översätta dem eller söka i dem som text, och du inte bryr dig om att bevara dokumentets ursprungliga utseende. PDF-OCR-verktyget här behåller originalPDF:en precis som den är, sidbilder och allt, och lägger bara till ett dolt textlager under: använd det när dokumentet behöver förbli en PDF du fortfarande kan skriva ut, e-posta eller arkivera, men du också vill kunna söka eller kopiera från den. Inget av verktygen återskapar layouten som redigerbar text med riktiga typsnitt och tabeller; båda arbetar från samma igenkända text, bara paketerad på olika sätt.

Varför resultatet beror på skanningen, och var gränserna går

Igenkänningens noggrannhet följer källbildens kvalitet, precis som för vanlig OCR: en ren, rak skanning på ungefär 200 till 300 DPI känns igen tillförlitligt, medan ett suddigt foto, en sned sida eller kraftiga skuggor ger fler feltolkade ord. Kom en sida ut sned, räta upp den med verktyget Räta upp skannade sidor innan du kör OCR så att igenkänningssteget läser rak text. Verktyget täcker sex språk (engelska, franska, tyska, spanska, portugisiska, italienska); ett dokument på ett språk som inte stöds känns inte igen korrekt. Bearbetningen sker sida för sida i din webbläsarflik, så ett dokument med dussintals sidor tar märkbart längre tid än en tvåsidig skanning, och filen begränsas till 80 MB. Den resulterande PDF:en tenderar också att vara ungefär lika stor som originalet, eftersom sidbilderna själva inte rörs; behöver du en mindre fil efteråt, kör den genom PDF-komprimeraren.

Så byggs det osynliga textlagret

Varje PDF-sida rastreras först till en canvas-bild i din webbläsare, samma ritsteg som verktyget PDF till bilder använder. OCR-motorn (Tesseract, kompilerad till WebAssembly) läser den bilden och returnerar varje igenkänt ord tillsammans med dess omslutande ruta, dess position på sidan. Dessa ord ritas sedan tillbaka på en kopia av den ursprungliga PDF-sidan på sina igenkända positioner, men med noll opacitet, så inget ändras visuellt: sidbilden du ser och skriver ut är samma som skannades, liggande ovanpå. En PDF-läsares sök- och textmarkeringsfunktioner tittar bara på det osynliga textlagret, vilket är varför filen blir sökbar och markerbar utan att se annorlunda ut. Allt detta, ritning, igenkänning och återuppbyggnad, sker inuti din webbläsarflik; PDF:en läses från den lokala disken och skickas aldrig någonstans.

Verktygen som används i den här guiden

Vanliga frågor

Kommer den sökbara PDF:en fortfarande se ut och skrivas ut exakt som originalskanningen?

Ja. Verktyget ändrar aldrig sidbilden; det lägger bara till ett osynligt textlager under den. På skärmen och på papper är resultatet visuellt identiskt med skanningen du släppte in. Det som ändras är att en läsares sök- och textmarkeringsverktyg nu kan hitta och greppa de igenkända orden, eftersom de läser från det dolda lagret.

Varför finns det här verktyget vid sidan av det vanliga OCR-verktyget?

De svarar mot olika behov från samma igenkänningssteg. OCR-verktyget ger dig en vanlig textfil, vilket är vad du vill ha om du tänker klistra in, redigera eller översätta orden och inte behöver behålla dokumentet som en PDF. Det här verktyget behåller filen som en PDF med de ursprungliga sidbilderna intakta, vilket är vad du vill ha om dokumentet fortfarande behöver skrivas ut, arkiveras eller e-postas som det är, men du också vill kunna söka eller kopiera text från den.

Källor