Bez przesyłania, 100% lokalnie, bez konta

Instrukcja

Jak wyodrębnić osadzone obrazy z pliku PDF

Wyodrębnianie obrazów z pliku PDF może oznaczać dwie różne rzeczy, a każda z nich wymaga innego narzędzia. Ten poradnik dotyczy wydobycia oryginalnych plików graficznych umieszczonych wewnątrz dokumentu: zdjęć, które projektant wstawił do broszury, logo w raporcie czy skanów w umowie. To nie to samo, co zamiana każdej strony na obraz. Jeśli chcesz uzyskać zrzut całej strony wraz z jej tekstem i układem, użyj zamiast tego narzędzia PDF na JPG. Tutejszy ekstraktor odczytuje obiekty rastrowe zapisane w pliku PDF i oddaje Ci same obrazy źródłowe w ich oryginalnej rozdzielczości, w całości w Twojej przeglądarce.

Krok po kroku

  1. Otwórz ekstraktor obrazów z PDF i przeciągnij do niego swój plik. Narzędzie odczytuje dokument lokalnie i podaje liczbę znalezionych osadzonych obrazów. Nic nigdzie nie jest wysyłane: analiza odbywa się w karcie przeglądarki na Twoim własnym urządzeniu.
    Ekstraktor obrazów z PDF z wczytanym dokumentem, pokazujący liczbę znalezionych osadzonych obrazów
  2. Pozwól mu przeskanować osadzone obiekty graficzne. Narzędzie przechodzi przez każdą stronę, zbiera każdy znaleziony raster i usuwa zduplikowane kopie masek miękkich, tak abyś nie otrzymał dwóch wersji tego samego obrazu. Nie ma żadnych ustawień stron ani formatu do wybrania: celem jest zwrócenie oryginałów dokładnie w takiej postaci, w jakiej były zapisane, a nie ich ponowne kodowanie.
  3. Pobierz wyniki. Pojedynczy obraz wraca jako jeden plik; kilka obrazów jest oferowanych jako osobne pobrania, nazwane i uporządkowane, dzięki czemu zachowują kolejność. Każdy plik zachowuje format, jaki miał wewnątrz pliku PDF, zwykle JPEG dla zdjęć i PNG dla grafik z przezroczystością.
    Wyodrębnione obrazy gotowe do pobrania, jeden plik na obraz

Osadzone obrazy a strony zamienione na obrazy

To właśnie ta różnica decyduje, którego narzędzia potrzebujesz. Osadzony obraz to zdjęcie lub grafika, którą autor umieścił w pliku PDF; ten ekstraktor zwraca taki plik w postaci, w jakiej był zapisany, w jego rzeczywistym rozmiarze w pikselach i bez niczego dorysowanego dookoła. Renderowanie strony do obrazu działa odwrotnie: PDF na JPG rysuje wszystko, co jest na stronie (tekst, kształty wektorowe, tła oraz osadzone obrazy razem), w jeden płaski raster o wybranej przez Ciebie rozdzielczości. Użyj ekstraktora, gdy chcesz odzyskać materiały źródłowe, na przykład by ponownie wykorzystać zdjęcie produktu. Użyj PDF na JPG, gdy chcesz wierny zrzut strony takiej, jaką widzi czytelnik.

Dlaczego warto robić to lokalnie

Obrazy ukryte w pliku PDF są często jego najbardziej wrażliwą częścią: zeskanowane zdjęcia z dowodów, podpisane strony, wewnętrzne zrzuty ekranu, prywatne grafiki. Wysłanie dokumentu do ekstraktora online oddaje to wszystko serwerowi, nad którym nie masz kontroli, razem z warstwą tekstu i wszelkimi metadanymi. Tutejszy ekstraktor otwiera plik PDF za pomocą PDF.js wewnątrz Twojej przeglądarki i wydobywa obiekty graficzne na Twoim komputerze, więc plik i wszystko, co zawiera, pozostają na Twoim urządzeniu.

Jak działa wyodrębnianie obrazów z PDF

Wyodrębnianie obrazów z PDF różni się od konwersji strony do zrzutu ekranu w formie rastrowej. W pliku PDF obrazy są przechowywane jako oddzielne słowniki strumieni /XObject zawierające surowe dane binarne (zazwyczaj w kodowaniu DCTDecode/JPEG, Flate, JPX lub CCITT) wraz z metadanymi dotyczącymi wymiarów i przestrzeni kolorów. Właściwe narzędzie do wyodrębniania analizuje te strumienie bezpośrednio, wyciągając każdy obraz bez ponownego kodowania. Ponieważ surowe bajty są odczytywane, a nie renderowane ponownie, wyodrębniony plik zachowuje dokładną rozdzielczość, profil kolorów i jakość obecne w momencie pierwszego osadzenia obrazu. Brak kroku rekompresji oznacza brak dodatkowej utraty jakości, niezależnie od tego, ile razy sam PDF był ponownie zapisywany.

Narzędzia użyte w tym poradniku

Najczęściej zadawane pytania

Czy otrzymam oryginalne obrazy, czy zrzuty stron?

Oryginalne obrazy. To narzędzie zwraca osadzone pliki graficzne w takiej postaci, w jakiej były zapisane w pliku PDF, w ich natywnej rozdzielczości i oryginalnym formacie. Jeśli zamiast tego chcesz obraz każdej pełnej strony, wraz z tekstem i układem, to inne zadanie: użyj narzędzia PDF na JPG, które rasteryzuje całą stronę w wybranej przez Ciebie rozdzielczości.

Dlaczego znalazło mniej obrazów, niż się spodziewałem?

Plik PDF zawiera osadzone obrazy tylko tam, gdzie autor rzeczywiście umieścił pliki rastrowe. Grafiki wektorowe, wykresy rysowane poleceniami rysunkowymi PDF oraz tekst nie są obrazami, więc nie są wyodrębniane. Narzędzie odrzuca też zduplikowane kopie masek miękkich, które tworzą niektóre eksporty, co może obniżyć liczbę. Jeśli sama strona jest skanem, zwykle zawiera jeden obraz na całą stronę, i to właśnie odzyskasz.