Ingen uppladdning, 100% lokalt, inget konto

Så gör du

Så extraherar du de inbäddade bilderna ur en PDF

Det finns två olika saker folk menar när de pratar om att extrahera bilder ur en PDF, och de kräver olika verktyg. Den här guiden handlar om att plocka ut de ursprungliga bildfilerna som placerats inuti dokumentet: fotona som en formgivare lade in i en broschyr, logotypen i en rapport, inskanningarna i ett avtal. Det är inte samma sak som att göra om varje sida till en bild. Om du vill ha en ögonblicksbild av hur en hel sida ser ut, inklusive text och layout, använd verktyget PDF till JPG i stället. Extraktorn här läser rasterobjekten som lagras i PDF:en och ger dig tillbaka källbilderna själva, i deras ursprungliga upplösning, allt i din webbläsare.

Steg för steg

  1. Öppna PDF-bildextraktorn och släpp din fil i den. Verktyget läser dokumentet lokalt och listar hur många inbäddade bilder det hittade. Inget skickas någonstans: tolkningen sker i webbläsarfliken på din egen enhet.
    PDF-bildextraktorn med ett dokument inläst, som visar antalet inbäddade bilder som hittats
  2. Låt den skanna de inbäddade bildobjekten. Den går igenom varje sida, samlar in varje raster den hittar och tar bort dubbla soft-mask-kopior så att du inte slutar med två versioner av samma bild. Det finns inga sid- eller formatinställningar att välja: målet är att returnera originalen exakt som de lagrades, inte att koda om dem.
  3. Ladda ner resultaten. En enda bild kommer tillbaka som en fil; flera bilder erbjuds som individuella nedladdningar, namngivna och sorterade så att de hålls i ordning. Varje fil behåller det format den hade inuti PDF:en, vanligtvis JPEG för foton och PNG för grafik med transparens.
    De extraherade bilderna redo att laddas ner, en fil per bild

Inbäddade bilder kontra sidor som gjorts till bilder

Det här är skillnaden som avgör vilket verktyg du vill ha. En inbäddad bild är ett foto eller en grafik som upphovspersonen placerade inuti PDF:en; den här extraktorn returnerar den filen precis som den lagrades, i sin verkliga pixelstorlek, utan något målat runt omkring. Att rendera en sida till en bild är motsatsen: PDF till JPG ritar allt på sidan (text, vektorformer, bakgrunder och de inbäddade bilderna tillsammans) till ett enda platt raster i en upplösning du väljer. Använd extraktorn när du vill ha tillbaka källmaterialet, till exempel för att återanvända ett produktfoto. Använd PDF till JPG när du vill ha en trogen ögonblicksbild av sidan så som en läsare ser den.

Varför det spelar roll att göra detta lokalt

Bilderna som ligger gömda i en PDF är ofta den känsligaste delen av den: inskannade ID-foton, signerade sidor, interna skärmdumpar, privata illustrationer. Att skicka dokumentet till en extraktor online lämnar över allt det till en server du inte kontrollerar, tillsammans med textlagret och eventuell metadata. Extraktorn här öppnar PDF:en med PDF.js inuti din webbläsare och plockar ut bildobjekten på din maskin, så att filen och allt i den stannar på din enhet.

Hur PDF-bildextrahering fungerar

Att extrahera bilder från en PDF skiljer sig från att konvertera en sida till en rastersskärmdump. Inuti en PDF-fil lagras bilder som separata /XObject-strömordböcker innehållande råbinärdata (vanligtvis DCTDecode/JPEG-, Flate-, JPX- eller CCITT-kodning) tillsammans med metadata för dimensioner och färgrymd. Ett korrekt extraheringsverktyg tolkar dessa strömmar direkt och hämtar varje bild utan att om-koda den. Eftersom råbytesen läses snarare än om-renderas behåller den extraherade filen exakt upplösning, färgprofil och kvalitet som fanns när bilden först bäddades in. Inget komprimeringsssteg innebär ingen ytterligare kvalitetsförlust, oavsett hur många gånger PDF:en i sig har sparats om.

Verktygen som används i den här guiden

Vanliga frågor

Får jag originalbilderna eller skärmdumpar av sidorna?

Originalbilderna. Det här verktyget returnerar de inbäddade bildfilerna precis som de lagrades i PDF:en, i deras ursprungliga upplösning och i deras ursprungliga format. Om du i stället vill ha en bild av varje hel sida, inklusive text och layout, är det ett annat jobb: använd verktyget PDF till JPG, som rastrerar hela sidan i en upplösning du väljer.

Varför hittade den färre bilder än jag väntade mig?

En PDF innehåller bara inbäddade bilder där upphovspersonen faktiskt placerade rasterfiler. Vektorgrafik, diagram ritade med PDF:ens ritkommandon och text är inte bilder, så de extraheras inte. Verktyget tar också bort dubbla soft-mask-kopior som vissa exporter skapar, vilket kan sänka antalet. Om en sida i sig är en inskanning innehåller den oftast en helsidesbild, vilket är det du får tillbaka.