บทความ
ทำไม PDF ถึงแก้ไขยากขนาดนี้
การเปิด PDF แล้วคาดหวังจะเปลี่ยนประโยคแบบที่คุณทำในโปรแกรมประมวลผลคำเป็นสาเหตุความหงุดหงิดที่พบบ่อย เอกสาร Word เก็บย่อหน้า สไตล์ และกฎการจัดเรียงใหม่ ส่วน PDF เก็บหน้าที่เสร็จสมบูรณ์แล้ว นี่คือสิ่งที่อยู่ข้างในไฟล์ PDF จริง ๆ ทำไมมันถึงทำให้การแก้ไขข้อความจริงยาก และสิ่งที่เครื่องมือของเราทำได้และทำไม่ได้
PDF อธิบายหน้ากระดาษ ไม่ใช่ย่อหน้า
Portable Document Format ที่กำหนดมาตรฐานเป็น ISO 32000 ถูกออกแบบมาเพื่อให้หน้าดูเหมือนกันทุกประการบนทุกอุปกรณ์และเครื่องพิมพ์: มันเก็บ content stream ของคำสั่งวาดระดับต่ำ วางตัวอักษรนี้ที่พิกัด x,y นี้ แทนที่จะเป็นย่อหน้าของข้อความที่จัดเรียงใหม่ได้ ฟอร์แมตไฟล์ของโปรแกรมประมวลผลคำเก็บข้อความเป็นลำดับตัวอักษรพร้อมสไตล์และกฎเลย์เอาต์แนบมา ส่วน PDF เก็บเลย์เอาต์ที่เสร็จสมบูรณ์เองไว้เลย นั่นคือเหตุผลทั้งหมดว่าทำไมมันแสดงผลเหมือนกันทุกที่ และเป็นเหตุผลทั้งหมดว่าทำไมการย้ายประโยคไม่ใช่การแก้ไขข้อความง่าย ๆ

ทำไมประโยคถึงไม่ขยับตามง่าย ๆ
ในเอกสารที่จัดเรียงใหม่ได้ การทำให้ประโยคยาวขึ้นจะดันส่วนที่เหลือของย่อหน้าลงมาโดยอัตโนมัติ PDF ไม่มีกฎแบบนั้น: แต่ละบรรทัดของข้อความเป็นอ็อบเจ็กต์ที่วางตำแหน่งแยกกัน ดังนั้นการแทรกคำหนึ่งคำหมายถึงการคำนวณและจัดตำแหน่งใหม่ของทุกตัวอักษรหลังจากมัน บนบรรทัดนั้นและมักบนทุกบรรทัดด้านล่างด้วย เพื่อไม่ให้ข้อความทับกัน ซอฟต์แวร์ที่ให้คุณแก้ไข PDF เหมือนเอกสารกำลังสร้างการไหลนี้ขึ้นใหม่อย่างเงียบ ๆ เบื้องหลัง ซึ่งเป็นเหตุผลที่ผลลัพธ์อาจขยับระยะห่าง ฟอนต์ หรือการตัดบรรทัดในแบบที่โปรแกรมประมวลผลคำแท้ ๆ ไม่มีวันทำ
สิ่งที่ตัวแก้ไข PDF ของเราทำจริง ๆ
ตัวแก้ไข PDF ของเราเพิ่มกล่องข้อความ รูปภาพ ไฮไลต์ และสี่เหลี่ยมปิดทับสีขาวลงบนหน้าที่มีอยู่แล้ว วางตำแหน่งตามที่คุณกำหนด มันไม่แตะต้องหรือจัดเรียง content stream ต้นฉบับข้างใต้ใหม่ นั่นครอบคลุมกรณีจริงทั่วไป: การเติมช่องว่างในฟอร์ม การเพิ่มตราประทับหรือบันทึกย่อ การปิดบรรทัดก่อนพิมพ์ มันไม่ได้เปลี่ยน PDF กลับเป็นย่อหน้าที่แก้ไขได้แบบที่โปรแกรมประมวลผลคำทำ เพราะนั่นต้องสร้างโครงสร้างเอกสารขึ้นใหม่ ไม่ใช่แค่วาดทับมัน

เมื่อคุณต้องการข้อความจริง ๆ ไม่ใช่เลย์เอาต์
หากเป้าหมายคือการนำถ้อยคำไปใช้ซ้ำ ให้คัดลอกมันออกมาแทนการแก้ไขหน้าตรง ๆ: เครื่องมือ PDF เป็นข้อความของเราดึงอ็อบเจ็กต์ตัวอักษรที่อยู่ข้างใต้ หรือรัน OCR บนหน้าที่สแกนซึ่งไม่มีอ็อบเจ็กต์แบบนั้นเลย ออกมาเป็นข้อความล้วนที่คุณวางลงในโปรแกรมแก้ไขใดก็ได้และจัดรูปแบบใหม่ตั้งแต่ต้น วิธีนี้หลีกเลี่ยงปัญหาการจัดเรียงใหม่ไปเลยทั้งหมด เพราะคุณกำลังทำงานกับคำ ไม่ใช่หน้าตายตัวที่มันถูกวาดไว้
แปลง PDF กลับเป็นเอกสาร Word
การเปลี่ยน PDF ให้เป็นไฟล์ Word ที่แก้ไขและจัดเรียงใหม่ได้เต็มรูปแบบเป็นปัญหาที่ต่างและยากกว่ามาก: มันต้องอนุมานขอบเขตย่อหน้า สไตล์ และโครงสร้างตารางจากหน้าที่บันทึกไว้เพียงตัวอักษรที่วางตำแหน่ง ซึ่งเป็นการสร้างใหม่แบบหนักและไม่สมบูรณ์แบบพอดีที่เครื่องมือฝั่งเซิร์ฟเวอร์ทำ นั่นอยู่นอกขอบเขตจริง ๆ สำหรับเว็บไซต์ที่ทำงานในเบราว์เซอร์เท่านั้นและสร้างขึ้นรอบแนวคิดไม่อัปโหลดไฟล์เลย: มันไม่ใช่สิ่งที่เราทำ และเครื่องมือใดก็ตามที่อ้างว่าแปลง PDF เป็น Word ที่แก้ไขได้อย่างสมบูรณ์แบบกำลังเดาแบบสูญเสียข้อมูลอยู่ที่ไหนสักแห่ง
เครื่องมือที่กล่าวถึงในบทความนี้
คำถามที่พบบ่อย
ฉันแก้ไขข้อความจริงของ PDF ได้ฟรีโดยไม่ต้องอัปโหลดหรือไม่
คุณเพิ่มข้อความใหม่ รูปภาพ และกล่องปิดทับลงบนหน้าได้ด้วยตัวแก้ไข PDF ของเรา ทั้งหมดในเบราว์เซอร์ของคุณ การเปลี่ยนข้อความต้นฉบับตรงที่เดิม แบบที่คุณทำในโปรแกรมประมวลผลคำ ต้องสร้างเอกสารขึ้นใหม่เป็นไฟล์ที่จัดเรียงใหม่ได้ ซึ่งเป็นการทำงานที่ต่างและหนักกว่าการวางอ็อบเจ็กต์ทับมาก
ทำไมการคัดลอกข้อความออกจาก PDF บางครั้งถึงให้ผลลัพธ์ยุ่งเหยิง
อ็อบเจ็กต์ข้อความของ PDF ถูกวางตำแหน่งแยกกันและไม่จำเป็นต้องเก็บตามลำดับการอ่าน ตัวอย่างเช่นหน้าที่จัดเป็นคอลัมน์อาจมีอ็อบเจ็กต์ข้างใต้เรียงจากบนลงล่างทั่วทั้งหน้าแทนที่จะเรียงทีละคอลัมน์ ดังนั้นการคัดลอกวางตรง ๆ อาจสลับบรรทัดที่ไม่เกี่ยวข้องกันเข้าด้วยกัน
มีวิธีจริงในการนำเนื้อหาของ PDF ไปเป็นไฟล์ Word ที่แก้ไขได้หรือไม่
บริการแปลงเฉพาะทางพยายามทำสิ่งนี้โดยอนุมานย่อหน้าและสไตล์จากเลย์เอาต์ของหน้า ให้ผลลัพธ์ที่หลากหลายขึ้นอยู่กับความซับซ้อนของเอกสารต้นฉบับ การสร้างใหม่แบบนั้นไม่ใช่สิ่งที่เครื่องมือฝั่งไคลเอนต์แบบไม่อัปโหลดทำได้อย่างไม่สูญเสียข้อมูล ซึ่งเป็นเหตุผลที่มันอยู่นอกเหนือสิ่งที่เว็บไซต์นี้เสนอ การดึงข้อความด้วย pdf-to-text แล้วจัดรูปแบบเองเป็นทางเลือกที่ตรงไปตรงมา