Artykuł
Zestaw narzędzi PDF w przeglądarce: czyszczenie, układ i struktura
Większość prac z plikami PDF mieści się w trzech grupach: uczynienie dokumentu czytelnym, rozmieszczenie jego stron na powierzchni oraz edycja dołączonych do niego danych. Ta strona oferuje około jedenastu małych narzędzi, które obejmują te grupy, a każde z nich działa na pliku wewnątrz karty Twojej przeglądarki. PDF zostaje otwarty, zmieniony i zapisany bez opuszczania Twojego urządzenia, więc to samo narzędzie równie dobrze obsłuży pasek wynagrodzenia i poufną umowę.
Oczyść i popraw skan
Strona, która wyszła ze skanera lub z aparatu telefonu, często wymaga kilku poprawek, zanim warto będzie ją zachować. Narzędzie do obracania obraca strony, które trafiły bokiem lub do góry nogami, w krokach co 90 stopni, i zastępuje dawny poradnik o obracaniu zeskanowanego PDF. Narzędzie do prostowania wyrównuje tekst, który stoi pod lekkim kątem, co ma znaczenie, gdy zamierzasz później uruchomić rozpoznawanie tekstu. Narzędzie skali szarości usuwa kanały koloru, co zmniejsza plik i likwiduje delikatny odcień, który skanery płaskie nadają białemu papierowi. Narzędzie do naprawy jest uczciwe co do swoich granic: odbudowuje te części uszkodzonego PDF, które pdf-lib potrafi przeanalizować i ponownie zapisać, więc odzyskuje wiele plików odrzucanych przez inne czytniki, ale nie potrafi odtworzyć treści, której nigdy nie zapisano w pliku. Użyj go jako pierwszej próby przy dokumencie, który się nie otwiera, a nie jako gwarancji.

Rozłóż strony
Gdy dokument jest już czytelny, możesz potrzebować zmienić, jak strony leżą na arkuszu. Narzędzie do przycinania obcina marginesy lub redukuje stronę do obszaru, który Cię interesuje. Narzędzie do zmiany rozmiaru zmienia wymiary strony, na przykład z US Letter na A4, aby dokument poprawnie drukował się w innym kraju. Narzędzie n-up umieszcza kilka stron obok siebie na jednym arkuszu, co przydaje się do materiałów do rozdania lub do oszczędzania papieru. Narzędzie do naprzemiennego łączenia przeplata dwa pliki strona po stronie, a najczęstszym powodem, by po nie sięgnąć, jest dwustronny skan zrobiony na jednostronnym skanerze: skanujesz przody do jednego pliku, odwracasz stos i skanujesz tyły do drugiego pliku, a potem mieszasz je tak, by strony wróciły do pierwotnej kolejności. Żadne z tych narzędzi nie rasteryzuje Twojego tekstu, więc cyfrowo utworzony PDF zachowuje zaznaczalny tekst po zmianie układu.
Metadane i struktura
Ostatnia grupa to dane owinięte wokół stron. Narzędzie do metadanych odczytuje i zapisuje na nowo pola tytułu, autora, tematu i słów kluczowych oraz pozwala je wyczyścić przed udostępnieniem dokumentu, co jest małym, ale realnym krokiem dla prywatności. Narzędzie do zakładek buduje klikalny konspekt, który czytnik PDF pokazuje w panelu bocznym, dzięki czemu długi raport staje się łatwy w nawigacji. Narzędzie HTML do PDF działa w drugą stronę i zamienia wklejony znacznik w PDF, z wyraźnym zastrzeżeniem: renderuje wynik jako obraz strony, więc wynik nie jest zaznaczalnym tekstem. Gdy naprawdę potrzebujesz wydobyć słowa z PDF, istnieją dwie różne drogi. Jeśli plik powstał cyfrowo, narzędzie PDF do tekstu odczytuje jego osadzony tekst wprost i dokładnie. Jeśli plik jest skanem, nie ma tekstu do odczytania, więc potrzebujesz optycznego rozpoznawania znaków, które zgaduje litery na podstawie obrazu i może popełniać błędy. Wiedza o tym, w którym przypadku jesteś, oszczędza wiele zamieszania.
Wewnętrzna struktura PDF i tabele XREF
Plik PDF nie jest liniowym dokumentem; to baza danych oddzielnych obiektów (słowniki, tablice, strumienie i wartości numeryczne) połączonych tabelą Cross-Reference (XREF) na końcu pliku. Tabela XREF mapuje każde ID obiektu na jego dokładne przesunięcie bajtowe. Niektóre edytory desktopowe zapisują zmiany jako aktualizację przyrostową: nową sekcję XREF dołączoną do pliku, która nadpisuje tylko zmodyfikowane obiekty, pozostawiając oryginalne bajty na miejscu pod spodem. Narzędzia przeglądarkowe oparte na pdf-lib działają inaczej: parsują cały dokument do grafu obiektów w pamięci, stosują żądaną zmianę (na przykład przepisując wpis słownika Rotate strony z 0 na 90), a następnie serializują cały plik od nowa jako pojedynczy, świeży PDF. To pełne przepisanie oznacza, że cały dokument musi zmieścić się w pamięci podczas działania narzędzia, dlatego każde narzędzie narzuca maksymalny rozmiar wejściowy; nigdy nie przesyła niczego z niego na serwer.

Kompresja strumieni i jak działa naprawa PDF
Zawartość strony w PDF (polecenia rysowania tekstu, ścieżki wektorowe, obrazy rastrowe) znajduje się w obiektach Stream, które są prawie zawsze kompresowane za pomocą FlateDecode (zlib). Gdy PDF jest uszkodzony, szkoda dotyczy zazwyczaj wadliwej tabeli XREF lub obciętego skompresowanego strumienia. Narzędzie naprawcze całkowicie omija uszkodzoną tabelę XREF i wykonuje liniowe skanowanie surowego strumienia bajtów, szukając znaczników obj i endobj, które ograniczają poszczególne obiekty. Wyodrębnia te obiekty, próbuje zdekompresować skojarzone strumienie i buduje nową, dobrze sformułowaną tabelę XREF od zera. Jeśli uszkodzenie znajduje się wewnątrz samego strumienia skompresowanego Flate, dane w tym konkretnym obiekcie nie są możliwe do odzyskania; struktura dokumentu może zostać przywrócona, ale dotyczy to stron, które mogą być puste lub pozbawione obrazów.
Narzędzia w tym artykule
- Prostuj pochylone stronyProstuj pochylone zeskanowane PDF lub obrazy w całości w przeglądarce, bez przesyłania.
- PDF do skali szarościKonwertuj kolorowy PDF do skali szarości w całości w przeglądarce, bez przesyłania.
- Napraw PDFPrzebuduj uszkodzony lub puchaty PDF w czystą, poprawnie sformowaną kopię, w całości w przeglądarce, bez przesyłania.
- Obróć strony PDFObróć wybrane strony PDF (90, 180 lub 270°) bez przesyłania.
- Kadruj strony PDFWizualnie kadruj dowolną stronę PDF, zaznacz obszar i zastosuj do wszystkich stron lub tylko jednej, bez przesyłania.
- Zmień rozmiar stron PDFSkaluj każdą stronę do A4, Letter, Legal, A3 lub A5, lub procentowo, bez przesyłania.
- PDF N-up (stron na arkusz)Umieść 2, 4, 6, 8, 9 lub 16 stron PDF na każdym arkuszu, aby zaoszczędzić papier. 100% w przeglądarce, bez przesyłania.
- Przeplataj i mieszaj dwa PDFPrzeplataj strony z dwóch PDF (A1, B1, A2, B2…) do skanowania dwustronnego. Bez przesyłania.
- Usuwanie / edytor metadanych PDFUsuń lub edytuj ukryte metadane PDF (autor, tytuł, oprogramowanie…) w przeglądarce. Bez przesyłania.
- Dodaj zakładki PDFDodaj klikalny konspekt zakładek (spis treści) do dowolnego PDF, definiuj tytuły, numery stron i zagnieżdżanie. 100% w przeglądarce, bez przesyłania.
- HTML do PDFKonwertuj wklejony HTML do PDF w przeglądarce (przybliżone, rastrowe). Bez wysyłania.
Najczęściej zadawane pytania
Czy te narzędzia PDF wysyłają mój plik na serwer?
Nie. Każde z tych narzędzi otwiera, edytuje i zapisuje PDF wewnątrz karty Twojej przeglądarki za pomocą JavaScriptu i WebAssembly. Plik jest wczytywany z Twojego dysku do strony, a wynik zapisywany prosto do pobrania, więc nic nie jest wysyłane przez sieć. Możesz to potwierdzić, otwierając panel sieciowy przeglądarki podczas używania narzędzia albo odłączając się od internetu po załadowaniu strony i obserwując, jak narzędzie nadal działa.
Czy narzędzie do naprawy potrafi naprawić każdy uszkodzony PDF?
Nie każdy plik. Narzędzie do naprawy analizuje dokument od nowa i zapisuje świeżą, poprawnie zbudowaną kopię, co naprawia uszkodzone tabele odsyłaczy krzyżowych i wiele wad strukturalnych, które uniemożliwiają otwarcie PDF. Nie potrafi wymyślić danych, których naprawdę brakuje, ani cofnąć silnego szyfrowania. Traktuj je jako szybką pierwszą próbę: jeśli odzyska Twój plik, gotowe, a jeśli nie, nic nie tracisz i możesz poszukać oryginału.