บทความ
ชุดเครื่องมือ PDF ในเบราว์เซอร์: ทำความสะอาด จัดวาง และจัดโครงสร้าง
งาน PDF ส่วนใหญ่แบ่งได้เป็นสามกลุ่ม คือ ทำให้เอกสารอ่านได้ จัดเรียงหน้าของมันบนพื้นที่ และแก้ไขข้อมูลที่ผูกอยู่กับมัน เว็บไซต์นี้มีเครื่องมือเล็ก ๆ ราวสิบเอ็ดตัวที่ครอบคลุมกลุ่มเหล่านี้ และทุกตัวทำงานกับไฟล์ภายในแท็บเบราว์เซอร์ของคุณ ไฟล์ PDF ถูกเปิด แก้ไข และบันทึกโดยไม่ออกจากอุปกรณ์ของคุณ ดังนั้นเครื่องมือตัวเดียวกันจึงรองรับทั้งสลิปเงินเดือนและสัญญาลับได้ดีพอ ๆ กัน
ทำความสะอาดและแก้ไขสแกน
หน้าที่ได้มาจากเครื่องสแกนหรือกล้องโทรศัพท์มักต้องการการแก้ไขเล็กน้อยก่อนที่จะคุ้มค่าแก่การเก็บไว้ เครื่องมือหมุนจะพลิกหน้าที่เข้ามาด้านข้างหรือกลับหัว ทีละ 90 องศา และมาแทนคู่มือเก่าสำหรับการหมุน PDF ที่สแกน เครื่องมือปรับให้ตรงจะทำให้ข้อความที่วางเอียงเล็กน้อยตรงขึ้น ซึ่งสำคัญเมื่อคุณวางแผนจะรันการรู้จำข้อความหลังจากนั้น เครื่องมือเฉดสีเทาจะตัดช่องสีออก ทำให้ไฟล์เล็กลงและขจัดสีจาง ๆ ที่เครื่องสแกนแบบแท่นเติมลงบนกระดาษขาว เครื่องมือซ่อมแซมตรงไปตรงมาเรื่องขีดจำกัดของมัน คือมันสร้างส่วนของ PDF ที่เสียหายซึ่ง pdf-lib สามารถแยกวิเคราะห์และบันทึกใหม่ได้ขึ้นมาใหม่ จึงกู้ไฟล์จำนวนมากที่โปรแกรมอื่นปฏิเสธได้ แต่มันไม่สามารถสร้างเนื้อหาที่ไม่เคยถูกเขียนลงในไฟล์ขึ้นมาใหม่ได้ ให้ใช้มันเป็นความพยายามแรกกับเอกสารที่เปิดไม่ขึ้น ไม่ใช่เป็นการรับประกัน

จัดวางหน้า
เมื่อเอกสารอ่านได้แล้ว คุณอาจต้องเปลี่ยนวิธีที่หน้าวางอยู่บนแผ่นกระดาษ เครื่องมือครอบตัดจะตัดขอบหรือลดหน้าลงเหลือเฉพาะบริเวณที่คุณสนใจ เครื่องมือปรับขนาดจะเปลี่ยนขนาดหน้า เช่น จาก US Letter เป็น A4 เพื่อให้เอกสารพิมพ์ได้ถูกต้องในอีกประเทศหนึ่ง เครื่องมือ n-up จะวางหลายหน้าเรียงกันบนแผ่นเดียว ซึ่งสะดวกสำหรับเอกสารแจกหรือเพื่อประหยัดกระดาษ เครื่องมือสลับผสมจะแทรกไฟล์สองไฟล์ทีละหน้า และเหตุผลที่พบบ่อยในการหยิบมันมาใช้คือสแกนสองหน้าที่ทำบนเครื่องสแกนหน้าเดียว คุณสแกนด้านหน้าเข้าไฟล์หนึ่ง พลิกปึกกระดาษแล้วสแกนด้านหลังเข้าไฟล์ที่สอง จากนั้นผสมมันเพื่อให้หน้ากลับเข้าสู่ลำดับเดิม เครื่องมือเหล่านี้ไม่มีตัวใดแปลงข้อความของคุณเป็นภาพแรสเตอร์ ดังนั้น PDF ที่สร้างจากดิจิทัลจึงยังคงมีข้อความที่เลือกได้หลังจากเปลี่ยนการจัดวาง
ข้อมูลเมตาและโครงสร้าง
กลุ่มสุดท้ายคือข้อมูลที่ห่อหุ้มอยู่รอบหน้า เครื่องมือข้อมูลเมตาจะอ่านและเขียนทับช่องชื่อเรื่อง ผู้เขียน หัวเรื่อง และคำสำคัญ และให้คุณล้างมันก่อนที่จะแชร์เอกสาร ซึ่งเป็นก้าวเล็ก ๆ แต่มีจริงเรื่องความเป็นส่วนตัว เครื่องมือบุ๊กมาร์กจะสร้างสารบัญที่คลิกได้ซึ่งโปรแกรมอ่าน PDF แสดงในแผงด้านข้าง ทำให้รายงานยาว ๆ ท่องไปได้สะดวก เครื่องมือ HTML เป็น PDF ทำในทางกลับกัน คือเปลี่ยนมาร์กอัปที่วางลงไปให้เป็น PDF พร้อมคำเตือนชัดเจนว่า มันเรนเดอร์ผลลัพธ์เป็นภาพของหน้า ดังนั้นผลลัพธ์จึงไม่ใช่ข้อความที่เลือกได้ เมื่อคุณต้องการคำออกมาจาก PDF จริง ๆ มีสองเส้นทางที่ต่างกัน หากไฟล์ถูกสร้างแบบดิจิทัล เครื่องมือ PDF เป็นข้อความจะอ่านข้อความที่ฝังอยู่โดยตรงและแม่นยำ หากไฟล์เป็นสแกน ก็ไม่มีข้อความให้อ่าน คุณจึงต้องใช้การรู้จำอักขระด้วยแสง ซึ่งเดาตัวอักษรจากภาพและอาจผิดพลาดได้ การรู้ว่าคุณอยู่ในกรณีไหนช่วยลดความสับสนได้มาก
โครงสร้างภายใน PDF และตาราง XREF
ไฟล์ PDF ไม่ใช่เอกสารเชิงเส้น แต่เป็นฐานข้อมูลของออบเจกต์แยกส่วน (dictionary, array, stream และค่าตัวเลข) ที่เชื่อมต่อด้วยตาราง Cross-Reference (XREF) ที่ท้ายไฟล์ ตาราง XREF แมป object ID แต่ละตัวกับ byte offset ที่แน่นอน โปรแกรมแก้ไขบนเดสก์ท็อปบางตัวบันทึกการเปลี่ยนแปลงแบบ incremental update: ต่อส่วน XREF ใหม่เข้าไปในไฟล์ซึ่งแทนที่เฉพาะออบเจกต์ที่แก้ไข โดยเก็บไบต์เดิมไว้ข้างใต้ เครื่องมือในเบราว์เซอร์ที่สร้างบน pdf-lib ทำงานต่างออกไป: มันแยกวิเคราะห์เอกสารทั้งหมดเป็น object graph ในหน่วยความจำ ทำการเปลี่ยนแปลงที่ร้องขอ (เช่น เขียน Rotate entry ของหน้าใหม่จาก 0 เป็น 90) แล้วจึง serialize ไฟล์ทั้งหมดใหม่ตั้งแต่ต้นเป็น PDF ใหม่ไฟล์เดียว การเขียนใหม่ทั้งหมดนี้หมายความว่าเอกสารทั้งฉบับต้องพอดีกับหน่วยความจำขณะที่เครื่องมือทำงาน ซึ่งเป็นเหตุผลที่แต่ละเครื่องมือกำหนดขนาดไฟล์นำเข้าสูงสุด และไม่เคยอัปโหลดสิ่งใดไปยังเซิร์ฟเวอร์เลย

การบีบอัด stream และวิธีที่การซ่อมแซม PDF ทำงาน
เนื้อหาหน้าใน PDF (คำสั่งวาดข้อความ เส้นเวกเตอร์ ภาพ raster) อยู่ใน Stream objects ซึ่งเกือบทั้งหมดบีบอัดด้วย FlateDecode (zlib) เมื่อ PDF เสียหาย ความเสียหายมักเกิดที่ตาราง XREF ที่มีรูปแบบผิดหรือ compressed stream ที่ถูกตัดทอน เครื่องมือซ่อมแซมจะข้ามตาราง XREF ที่เสียหายและทำการสแกนเชิงเส้นของ byte stream ดิบ โดยค้นหา obj และ endobj markers ที่ล้อมออบเจกต์แต่ละตัว ดึงออบเจกต์เหล่านั้น พยายามคลาย stream ที่เกี่ยวข้อง และสร้างตาราง XREF ที่มีรูปแบบดีใหม่ตั้งแต่ต้น หากความเสียหายอยู่ภายใน Flate-compressed stream เอง ข้อมูลในออบเจกต์นั้นจะไม่สามารถกู้คืนได้ โครงสร้างเอกสารสามารถคืนค่าได้แต่หน้าที่ได้รับผลกระทบอาจว่างเปล่าหรือหายภาพ
เครื่องมือที่กล่าวถึงในบทความนี้
- ปรับตรงหน้าสแกนยืดตรง PDF ที่สแกนเอียงหรือรูปภาพทั้งหมดในเบราว์เซอร์ของคุณ, ไม่ต้องอัปโหลด
- PDF เป็นโทนสีเทาแปลง PDF สีเป็นโทนสีเทาทั้งหมดในเบราว์เซอร์ของคุณ, ไม่ต้องอัปโหลด
- ซ่อมแซม PDFสร้าง PDF ที่เสียหายหรือบวมขึ้นมาใหม่เป็นสำเนาที่สะอาดและมีรูปแบบดี, ทั้งหมดในเบราว์เซอร์ของคุณ ไม่ต้องอัปโหลด
- หมุนหน้า PDFหมุนหน้าที่เลือกของ PDF (90, 180 หรือ 270°) โดยไม่ต้องอัปโหลด
- ตัดขอบหน้า PDFตัดขอบหน้า PDF แบบเห็นภาพ, เลือกพื้นที่และใช้กับทุกหน้าหรือแค่หน้าเดียว โดยไม่ต้องอัปโหลด
- ปรับขนาดหน้า PDFปรับขนาดทุกหน้าเป็น A4, Letter, Legal, A3 หรือ A5, หรือตามเปอร์เซ็นต์, โดยไม่ต้องอัปโหลด
- PDF N-up (หลายหน้าต่อแผ่น)วาง 2, 4, 6, 8, 9 หรือ 16 หน้า PDF บนแต่ละแผ่นเพื่อประหยัดกระดาษ 100% ในเบราว์เซอร์ ไม่อัปโหลด
- สลับและผสม PDF สองไฟล์สอดแทรกหน้าจาก PDF สองไฟล์ (A1, B1, A2, B2…) สำหรับการสแกนสองหน้า ไม่ต้องอัปโหลด
- ตัวลบ/แก้ไข metadata ของ PDFลบหรือแก้ไข metadata ที่ซ่อนอยู่ใน PDF (ผู้แต่ง ชื่อเรื่อง ซอฟต์แวร์…) ในเบราว์เซอร์ ไม่อัปโหลด
- เพิ่มบุ๊กมาร์ก PDFเพิ่มโครงร่างบุ๊กมาร์กที่คลิกได้ (สารบัญ) ใน PDF ใดก็ได้, กำหนดชื่อ หมายเลขหน้า และการซ้อน 100% ในเบราว์เซอร์ของคุณ ไม่ต้องอัปโหลด
- HTML เป็น PDFแปลง HTML ที่วางมาเป็น PDF ในเบราว์เซอร์ของคุณ (ทำเท่าที่ทำได้ แบบแรสเตอร์) ไม่มีการอัปโหลด
คำถามที่พบบ่อย
เครื่องมือ PDF เหล่านี้อัปโหลดไฟล์ของฉันไปยังเซิร์ฟเวอร์หรือไม่
ไม่ เครื่องมือแต่ละตัวเปิด แก้ไข และบันทึก PDF ภายในแท็บเบราว์เซอร์ของคุณโดยใช้ JavaScript และ WebAssembly ไฟล์ถูกอ่านจากดิสก์ของคุณเข้าสู่หน้า และผลลัพธ์ถูกเขียนตรงไปยังการดาวน์โหลด ดังนั้นจึงไม่มีอะไรถูกส่งผ่านเครือข่าย คุณยืนยันได้โดยเปิดแผงเครือข่ายของเบราว์เซอร์ขณะใช้เครื่องมือ หรือโดยตัดการเชื่อมต่ออินเทอร์เน็ตหลังจากหน้าโหลดแล้วและดูว่าเครื่องมือยังทำงานได้
เครื่องมือซ่อมแซมแก้ไข PDF ที่เสียได้ทุกไฟล์หรือไม่
ไม่ใช่ทุกไฟล์ เครื่องมือซ่อมแซมจะแยกวิเคราะห์เอกสารใหม่และเขียนสำเนาที่สดและถูกต้องตามรูปแบบ ซึ่งแก้ตารางอ้างอิงไขว้ที่เสียและข้อบกพร่องเชิงโครงสร้างหลายอย่างที่ทำให้ PDF เปิดไม่ขึ้น มันไม่สามารถสร้างข้อมูลที่หายไปจริง ๆ ขึ้นมาหรือถอดการเข้ารหัสที่แข็งแกร่งได้ จงถือว่ามันเป็นความพยายามแรกอย่างรวดเร็ว ถ้ามันกู้ไฟล์ของคุณได้ก็เสร็จ และถ้าไม่ได้ คุณก็ไม่ได้เสียอะไรและสามารถมองหาต้นฉบับได้