Стаття
Набір PDF-інструментів у браузері: очищення, розмітка та структура
Більшість завдань із PDF потрапляють у три групи: зробити документ читабельним, розташувати його сторінки на аркуші та відредагувати привʼязані до нього дані. На цьому сайті є близько одинадцяти невеликих інструментів, що покривають ці групи, і кожен із них працює з файлом усередині вкладки вашого браузера. PDF відкривається, змінюється та зберігається, не залишаючи вашого пристрою, тож той самий інструмент однаково добре підходить і для розрахункового листа, і для конфіденційного договору.
Очищення та виправлення скана
Сторінка, отримана зі сканера чи з камери телефона, часто потребує кількох виправлень, перш ніж її варто залишити. Інструмент повороту розвертає сторінки, що потрапили боком чи догори ногами, з кроком у 90 градусів, і замінює колишній посібник із повороту відсканованого PDF. Інструмент вирівнювання випрямляє текст, що лежить під невеликим кутом, а це важливо, якщо ви плануєте потім запускати розпізнавання тексту. Інструмент переведення у відтінки сірого прибирає кольорові канали, що зменшує розмір файлу та знімає легкий відтінок, який планшетні сканери додають до білого паперу. Інструмент відновлення чесно говорить про свої межі: він перезбирає ті частини пошкодженого PDF, які pdf-lib здатна розібрати та перезберегти, тож він рятує багато файлів, які відхиляють інші програми, але не може відтворити вміст, якого у файлі ніколи не було. Використовуйте його як першу спробу для документа, що не відкривається, а не як гарантію.

Розмітка сторінок
Коли документ став читабельним, може знадобитися змінити те, як сторінки розташовані на аркуші. Інструмент обрізання зрізає поля чи вирізає сторінку до області, що вас цікавить. Інструмент зміни розміру змінює розміри сторінки, наприклад із US Letter на A4, щоб документ правильно друкувався в іншій країні. Інструмент n-up розміщує кілька сторінок поруч на одному аркуші, що зручно для роздаткових матеріалів чи для економії паперу. Інструмент чергування посторінково переплітає два файли, і звична причина звернутися до нього така: двосторонній скан, зроблений на односторонньому сканері, коли ви скануєте лицьові сторони в один файл, перевертаєте стос і скануєте звороти в другий файл, а потім змішуєте їх, щоб сторінки стали у початковий порядок. Жоден із цих інструментів не растеризує ваш текст, тож від початку цифровий PDF зберігає виділюваний текст після зміни розкладки.
Метадані та структура
Остання група, це дані, обгорнуті навколо сторінок. Інструмент метаданих читає та переписує поля заголовка, автора, теми та ключових слів і дозволяє очистити їх перед тим, як ви поділитеся документом, що є невеликим, але реальним кроком до приватності. Інструмент закладок будує клікабельний зміст, який програма для читання PDF показує в бічній панелі, завдяки чому довгим звітом стає зручно переміщатися. Інструмент HTML у PDF діє у зворотний бік і перетворює вставлену розмітку на PDF, із ясним застереженням: він відмальовує результат як зображення сторінки, тож у виводі немає виділюваного тексту. Коли вам справді потрібні слова з PDF, існують два різні шляхи. Якщо файл було створено у цифровому вигляді, інструмент PDF у текст читає його вбудований текст напряму й точно. Якщо файл є сканом, читати нічого, тож потрібне оптичне розпізнавання символів, яке вгадує літери за картинкою і може помилятися. Розуміння того, який у вас випадок, позбавляє багатьох непорозумінь.
Внутрішня структура PDF і таблиці XREF
Файл PDF не є лінійним документом; це база даних дискретних об'єктів (словників, масивів, потоків і числових значень), пов'язаних таблицею перехресних посилань (XREF) у кінці файлу. Таблиця XREF відображає ідентифікатор кожного об'єкта на його точне байтове зміщення. Деякі десктопні редактори зберігають зміни як інкрементальне оновлення: новий розділ XREF, доданий до файлу, який замінює лише змінені об'єкти, лишаючи оригінальні байти на місці під ним. Браузерні інструменти, побудовані на pdf-lib, працюють інакше: вони розбирають увесь документ у граф об'єктів у пам'яті, застосовують потрібну зміну (наприклад, переписуючи запис Rotate сторінки з 0 на 90), а потім повністю пересеріалізують файл з нуля як єдиний новий PDF. Такий повний перезапис означає, що весь документ має вміститися в пам'яті, поки працює інструмент, тому кожен інструмент встановлює максимальний розмір вхідного файлу; він ніколи не завантажує жодну його частину на сервер.

Стиснення потоків і принцип відновлення PDF
Вміст сторінки у PDF (команди малювання тексту, векторні шляхи, растрові зображення) міститься в об'єктах Stream, які майже завжди стиснуті за допомогою FlateDecode (zlib). Коли PDF пошкоджений, пошкодження, як правило, стосується або некоректної таблиці XREF, або усіченого стисненого потоку. Інструмент відновлення повністю обходить пошкоджену таблицю XREF і виконує лінійне сканування необробленого байтового потоку, шукаючи маркери obj і endobj, що обмежують окремі об'єкти. Він витягує ці об'єкти, намагається декомпресувати пов'язані потоки і з нуля будує нову коректну таблицю XREF. Якщо пошкодження знаходиться всередині самого стисненого Flate-потоку, дані в цьому конкретному об'єкті не підлягають відновленню; структуру документа можна відновити, але уражені сторінки можуть бути порожніми або без зображень.
Інструменти з цієї статті
- Вирівняти відскановані сторінкиВирівнюйте перекошені відскановані PDF чи зображення повністю у вашому браузері, без завантаження.
- PDF у відтінки сірогоПеретворіть кольоровий PDF у відтінки сірого повністю у вашому браузері, без завантаження.
- Відновити PDFПеребудуйте пошкоджений або роздутий PDF у чисту, правильно сформовану копію, повністю у вашому браузері, без завантаження.
- Поворот сторінок PDFПовертайте вибрані сторінки PDF (90, 180 чи 270°) без завантаження.
- Обрізати сторінки PDFВізуально обрізайте будь-яку сторінку PDF, виділіть область і застосуйте до всіх сторінок або лише до однієї, без завантаження на сервер.
- Змінити розмір сторінок PDFМасштабуйте кожну сторінку до A4, Letter, Legal, A3 чи A5, або у відсотках, без завантаження.
- PDF N-up (сторінок на аркуш)Розміщуйте 2, 4, 6, 8, 9 чи 16 сторінок PDF на кожному аркуші, щоб заощадити папір. 100% у вашому браузері, без завантаження.
- Чергувати та поєднати два PDFЧергуйте сторінки з двох PDF (A1, B1, A2, B2…) для двостороннього сканування. Без завантаження.
- Видалення / редагування метаданих PDFВидаляйте чи редагуйте приховані метадані PDF (автор, заголовок, програма…) у вашому браузері. Без завантаження.
- Додати закладки до PDFДодавайте клікабельну структуру закладок (зміст) до будь-якого PDF, визначайте назви, номери сторінок та вкладеність. 100% у вашому браузері, без завантаження.
- HTML у PDFПеретворіть вставлений HTML на PDF у браузері (за можливості, растром). Без завантаження.
Поширені запитання
Чи завантажують ці PDF-інструменти мій файл на сервер?
Ні. Кожен із цих інструментів відкриває, редагує та зберігає PDF усередині вкладки вашого браузера за допомогою JavaScript і WebAssembly. Файл зчитується з вашого диска у сторінку, а результат записується прямо у завантаження, тож мережею нічого не надсилається. Ви можете переконатися в цьому, відкривши мережеву панель браузера під час роботи з інструментом, або відʼєднавшись від інтернету після завантаження сторінки й побачивши, що інструмент усе ще працює.
Чи може інструмент відновлення полагодити будь-який пошкоджений PDF?
Не будь-який файл. Інструмент відновлення наново розбирає документ і записує свіжу, правильно сформовану копію, що виправляє пошкоджені таблиці перехресних посилань і багато структурних збоїв, які заважають PDF відкритися. Він не може вигадати дані, яких справді немає, чи зняти сильне шифрування. Ставтеся до нього як до швидкої першої спроби: якщо він врятує ваш файл, справу зроблено, а якщо ні, ви нічого не втратили й можете пошукати оригінал.