Ingen uppladdning, 100% lokalt, inget konto

Artikel

Varför du inte kan kopiera text från vissa PDF:er

Försök markera en rad i en PDF och orden markeras normalt, redo att kopieras. Försök samma rörelse i en annan PDF och ingenting händer, eller markören griper hela sidan som ett fotografi, för det är precis vad det är. Två filer som ser identiska ut på skärmen kan vara helt olika byggda under ytan. Här är hur du avgör vilken sort du har, och vad du gör med den som motstår kopiering.

Två olika sorters PDF-sida

En PDF kan lagra en sida på två väldigt olika sätt. I en textbaserad PDF är varje bokstav ett teckenobjekt med ett Unicode-värde, ett typsnitt och en position, på samma sätt som en webbsida lagrar text: en läsare kan markera den, söka i den, och en skärmläsare kan läsa upp den. I en bildbaserad PDF är sidan en enda platt bild, ofta producerad av en skanner, ett fax, eller ett "skriv ut till PDF"-steg applicerat på ett foto av ett dokument. Bokstäverna ser likadana ut för dina ögon, men för filformatet finns inget tecken under, bara pixlar.

Jämförelse sida vid sida: en textbaserad PDF-sida med en markerad, markerbar textrad bredvid en bildbaserad PDF-sida där likadant utseende text är en enda platt bild utan markering.

Ett snabbt sätt att avgöra vilken du har

Tryck Ctrl+F eller Cmd+F och sök efter ett ord du tydligt kan se på sidan. Hittar sökningen det och markerar det har sidan ett riktigt textlager. Hittar sökningen ingenting någonstans i dokumentet är sidan en bild, oavsett hur skarp eller hur mycket den liknar ett skrivet dokument. Att dra musen för att markera en rad ger samma svar: en markering mot en enkel rektangelmarkering.

Att återskapa texten med OCR

Optisk teckenigenkänning (OCR) läser pixlarna på en bildbaserad sida och matchar formerna mot en tränad modell av bokstäver för ett givet språk, och bygger sedan om ett textlager med de igenkända tecknen positionerade där de förekom. Ett verktyg som OCR-verktyget gör detta helt i webbläsaren: inget laddas upp, och resultatet är en vanlig textfil du kan söka i, kopiera eller redigera. Noggrannheten beror på källan: en ren, rak skanning i hög upplösning på ett väl stött språk känns igen tillförlitligt, medan en sned, suddig, lågkontrast- eller handskriven sida ger fler misstag, ibland ett fel tecken eller ett feltolkat ord.

Pipelinediagram: pixlarna på en skannad sida går genom OCR-teckenigenkänning och kommer ut som ett återskapat, positionerat textlager.

När filen redan har text men extraktionen ser fel ut

Har din PDF ett riktigt textlager men ett verktyg som PDF till text ger text i en konstig ordning, med kolumner sammanslagna eller mellanrum hoprasade, är det ett annat, orelaterat problem: textobjekten finns men deras läsordning på sidan lagrades inte på det sätt ett skript naturligt förväntar sig. Det är en layoutkonstighet att städa upp efter extraktionen, inte ett tecken på att texten saknas, och det behöver inte OCR för att lösas.

Verktyg i den här artikeln

Vanliga frågor

Min PDF ser ut som ett vanligt skrivet dokument men jag kan ändå inte markera någon text. Varför?

Det är troligtvis en skannad eller fotograferad sida sparad som en PDF, eller ett dokument avsiktligt plattat till en bild. Visuellt kan den vara omöjlig att skilja från en textbaserad PDF; skillnaden syns bara när du försöker söka i eller markera den. Att köra den genom OCR bygger om ett riktigt, markerbart textlager från pixlarna.

Fungerar OCR lika bra på alla språk?

Nej. Noggrannheten beror på om det finns en tränad modell för det språket och den skriften, och på skanningens kvalitet. Väl stödda språk på en ren, rak skanning känns igen tillförlitligt; handskrift, lågupplösta bilder eller språk med mindre träningsdata ger fler fel. OCR-resultatet är alltid en transkription efter bästa förmåga, värd en snabb korrekturläsning innan du litar på den.

Källor