Bez przesyłania, 100% lokalnie, bez konta

Artykuł

Zestaw narzędzi PDF w przeglądarce: czyszczenie, układ i struktura

Większość prac z plikami PDF mieści się w trzech grupach: uczynienie dokumentu czytelnym, rozmieszczenie jego stron na powierzchni oraz edycja dołączonych do niego danych. Ta strona oferuje około jedenastu małych narzędzi, które obejmują te grupy, a każde z nich działa na pliku wewnątrz karty Twojej przeglądarki. PDF zostaje otwarty, zmieniony i zapisany bez opuszczania Twojego urządzenia, więc to samo narzędzie równie dobrze obsłuży pasek wynagrodzenia i poufną umowę.

Oczyść i popraw skan

Strona, która wyszła ze skanera lub z aparatu telefonu, często wymaga kilku poprawek, zanim warto będzie ją zachować. Narzędzie do obracania obraca strony, które trafiły bokiem lub do góry nogami, w krokach co 90 stopni, i zastępuje dawny poradnik o obracaniu zeskanowanego PDF. Narzędzie do prostowania wyrównuje tekst, który stoi pod lekkim kątem, co ma znaczenie, gdy zamierzasz później uruchomić rozpoznawanie tekstu. Narzędzie skali szarości usuwa kanały koloru, co zmniejsza plik i likwiduje delikatny odcień, który skanery płaskie nadają białemu papierowi. Narzędzie do naprawy jest uczciwe co do swoich granic: odbudowuje te części uszkodzonego PDF, które pdf-lib potrafi przeanalizować i ponownie zapisać, więc odzyskuje wiele plików odrzucanych przez inne czytniki, ale nie potrafi odtworzyć treści, której nigdy nie zapisano w pliku. Użyj go jako pierwszej próby przy dokumencie, który się nie otwiera, a nie jako gwarancji.

Przekrzywiona, zamazana zeskanowana strona obok tej samej strony po wyprostowaniu i czyszczeniu w skali szarości, prosta i czytelna.

Rozłóż strony

Gdy dokument jest już czytelny, możesz potrzebować zmienić, jak strony leżą na arkuszu. Narzędzie do przycinania obcina marginesy lub redukuje stronę do obszaru, który Cię interesuje. Narzędzie do zmiany rozmiaru zmienia wymiary strony, na przykład z US Letter na A4, aby dokument poprawnie drukował się w innym kraju. Narzędzie n-up umieszcza kilka stron obok siebie na jednym arkuszu, co przydaje się do materiałów do rozdania lub do oszczędzania papieru. Narzędzie do naprzemiennego łączenia przeplata dwa pliki strona po stronie, a najczęstszym powodem, by po nie sięgnąć, jest dwustronny skan zrobiony na jednostronnym skanerze: skanujesz przody do jednego pliku, odwracasz stos i skanujesz tyły do drugiego pliku, a potem mieszasz je tak, by strony wróciły do pierwotnej kolejności. Żadne z tych narzędzi nie rasteryzuje Twojego tekstu, więc cyfrowo utworzony PDF zachowuje zaznaczalny tekst po zmianie układu.

Metadane i struktura

Ostatnia grupa to dane owinięte wokół stron. Narzędzie do metadanych odczytuje i zapisuje na nowo pola tytułu, autora, tematu i słów kluczowych oraz pozwala je wyczyścić przed udostępnieniem dokumentu, co jest małym, ale realnym krokiem dla prywatności. Narzędzie do zakładek buduje klikalny konspekt, który czytnik PDF pokazuje w panelu bocznym, dzięki czemu długi raport staje się łatwy w nawigacji. Narzędzie HTML do PDF działa w drugą stronę i zamienia wklejony znacznik w PDF, z wyraźnym zastrzeżeniem: renderuje wynik jako obraz strony, więc wynik nie jest zaznaczalnym tekstem. Gdy naprawdę potrzebujesz wydobyć słowa z PDF, istnieją dwie różne drogi. Jeśli plik powstał cyfrowo, narzędzie PDF do tekstu odczytuje jego osadzony tekst wprost i dokładnie. Jeśli plik jest skanem, nie ma tekstu do odczytania, więc potrzebujesz optycznego rozpoznawania znaków, które zgaduje litery na podstawie obrazu i może popełniać błędy. Wiedza o tym, w którym przypadku jesteś, oszczędza wiele zamieszania.

Wewnętrzna struktura PDF i tabele XREF

Plik PDF nie jest liniowym dokumentem; to baza danych oddzielnych obiektów (słowniki, tablice, strumienie i wartości numeryczne) połączonych tabelą Cross-Reference (XREF) na końcu pliku. Tabela XREF mapuje każde ID obiektu na jego dokładne przesunięcie bajtowe. Niektóre edytory desktopowe zapisują zmiany jako aktualizację przyrostową: nową sekcję XREF dołączoną do pliku, która nadpisuje tylko zmodyfikowane obiekty, pozostawiając oryginalne bajty na miejscu pod spodem. Narzędzia przeglądarkowe oparte na pdf-lib działają inaczej: parsują cały dokument do grafu obiektów w pamięci, stosują żądaną zmianę (na przykład przepisując wpis słownika Rotate strony z 0 na 90), a następnie serializują cały plik od nowa jako pojedynczy, świeży PDF. To pełne przepisanie oznacza, że cały dokument musi zmieścić się w pamięci podczas działania narzędzia, dlatego każde narzędzie narzuca maksymalny rozmiar wejściowy; nigdy nie przesyła niczego z niego na serwer.

Budowa pliku PDF: nagłówek, obiekty, tabela xref indeksująca każdy obiekt według przesunięcia w bajtach oraz trailer.

Kompresja strumieni i jak działa naprawa PDF

Zawartość strony w PDF (polecenia rysowania tekstu, ścieżki wektorowe, obrazy rastrowe) znajduje się w obiektach Stream, które są prawie zawsze kompresowane za pomocą FlateDecode (zlib). Gdy PDF jest uszkodzony, szkoda dotyczy zazwyczaj wadliwej tabeli XREF lub obciętego skompresowanego strumienia. Narzędzie naprawcze całkowicie omija uszkodzoną tabelę XREF i wykonuje liniowe skanowanie surowego strumienia bajtów, szukając znaczników obj i endobj, które ograniczają poszczególne obiekty. Wyodrębnia te obiekty, próbuje zdekompresować skojarzone strumienie i buduje nową, dobrze sformułowaną tabelę XREF od zera. Jeśli uszkodzenie znajduje się wewnątrz samego strumienia skompresowanego Flate, dane w tym konkretnym obiekcie nie są możliwe do odzyskania; struktura dokumentu może zostać przywrócona, ale dotyczy to stron, które mogą być puste lub pozbawione obrazów.

Narzędzia w tym artykule

Najczęściej zadawane pytania

Czy te narzędzia PDF wysyłają mój plik na serwer?

Nie. Każde z tych narzędzi otwiera, edytuje i zapisuje PDF wewnątrz karty Twojej przeglądarki za pomocą JavaScriptu i WebAssembly. Plik jest wczytywany z Twojego dysku do strony, a wynik zapisywany prosto do pobrania, więc nic nie jest wysyłane przez sieć. Możesz to potwierdzić, otwierając panel sieciowy przeglądarki podczas używania narzędzia albo odłączając się od internetu po załadowaniu strony i obserwując, jak narzędzie nadal działa.

Czy narzędzie do naprawy potrafi naprawić każdy uszkodzony PDF?

Nie każdy plik. Narzędzie do naprawy analizuje dokument od nowa i zapisuje świeżą, poprawnie zbudowaną kopię, co naprawia uszkodzone tabele odsyłaczy krzyżowych i wiele wad strukturalnych, które uniemożliwiają otwarcie PDF. Nie potrafi wymyślić danych, których naprawdę brakuje, ani cofnąć silnego szyfrowania. Traktuj je jako szybką pierwszą próbę: jeśli odzyska Twój plik, gotowe, a jeśli nie, nic nie tracisz i możesz poszukać oryginału.