ไม่มีการอัปโหลด, 100% ในเครื่อง, ไม่มีบัญชี

บทความ

ทำไมคัดลอกข้อความจาก PDF บางไฟล์ไม่ได้

ลองเลือกบรรทัดหนึ่งใน PDF ไฟล์หนึ่งแล้วคำต่าง ๆ จะไฮไลต์ตามปกติ พร้อมคัดลอก ลองท่าเดียวกันใน PDF อีกไฟล์แล้วไม่มีอะไรเกิดขึ้น หรือเคอร์เซอร์คว้าทั้งหน้าเหมือนเป็นภาพถ่าย เพราะมันคือภาพถ่ายจริง ๆ ไฟล์สองไฟล์ที่ดูเหมือนกันบนหน้าจอสามารถถูกสร้างต่างกันโดยสิ้นเชิงข้างใต้ นี่คือวิธีบอกว่าคุณมีแบบไหน และควรทำอย่างไรกับแบบที่ต้านทานการคัดลอก

PDF สองแบบที่ต่างกัน

PDF สามารถเก็บหน้าไว้ได้สองวิธีที่ต่างกันมาก ใน PDF แบบข้อความ ตัวอักษรทุกตัวคืออ็อบเจ็กต์ตัวอักษรที่มีค่า Unicode ฟอนต์ และตำแหน่ง เหมือนกับที่หน้าเว็บเก็บข้อความ: โปรแกรมดูสามารถเลือก ค้นหา และ screen reader อ่านออกเสียงได้ ใน PDF แบบภาพ หน้าคือภาพแบนหนึ่งภาพ มักสร้างจากสแกนเนอร์ แฟกซ์ หรือขั้นตอน "print to PDF" ที่ใช้กับภาพถ่ายของเอกสาร ตัวอักษรดูเหมือนกันในสายตาคุณ แต่สำหรับฟอร์แมตไฟล์แล้วไม่มีตัวอักษรอยู่ข้างใต้เลย มีแค่พิกเซล

เปรียบเทียบเคียงข้างกัน: หน้า PDF แบบข้อความที่มีบรรทัดข้อความไฮไลต์และเลือกได้ ข้าง ๆ หน้า PDF แบบภาพที่ข้อความหน้าตาเดียวกันเป็นภาพแบนหนึ่งภาพที่เลือกไม่ได้

วิธีเช็กด่วนว่าคุณมีแบบไหน

กด Ctrl+F หรือ Cmd+F แล้วค้นหาคำที่คุณเห็นชัดเจนบนหน้า หากการค้นหาพบและไฮไลต์มัน หน้านั้นมีเลเยอร์ข้อความจริง หากการค้นหาไม่พบอะไรเลยในเอกสารทั้งหมด หน้านั้นคือภาพ ไม่ว่ามันจะคมชัดแค่ไหนหรือดูเหมือนเอกสารที่พิมพ์แค่ไหนก็ตาม การลากเมาส์เพื่อเลือกบรรทัดก็ให้คำตอบเดียวกัน: การไฮไลต์เทียบกับการเลือกสี่เหลี่ยมธรรมดา

สร้างข้อความใหม่ด้วย OCR

Optical Character Recognition (OCR) อ่านพิกเซลของหน้าแบบภาพแล้วจับคู่รูปทรงกับโมเดลตัวอักษรที่ฝึกมาสำหรับภาษาหนึ่ง ๆ จากนั้นสร้างเลเยอร์ข้อความใหม่โดยวางตัวอักษรที่รู้จำได้ในตำแหน่งที่ปรากฏ เครื่องมืออย่าง ocr ทำสิ่งนี้ทั้งหมดในเบราว์เซอร์: ไม่มีอะไรถูกอัปโหลด และผลลัพธ์คือไฟล์ข้อความล้วนที่คุณค้นหา คัดลอก หรือแก้ไขได้ ความแม่นยำขึ้นอยู่กับต้นฉบับ: สแกนที่คมชัด ตรง ความละเอียดสูงในภาษาที่รองรับดีจะรู้จำได้แม่นยำ ในขณะที่หน้าที่เอียง เบลอ คอนทราสต์ต่ำ หรือลายมือเขียนจะเกิดข้อผิดพลาดมากขึ้น บางครั้งอ่านตัวอักษรผิดหรือคำผิด

แผนภาพขั้นตอน: พิกเซลของหน้าที่สแกนไว้ผ่านการรู้จำตัวอักษร OCR แล้วออกมาเป็นเลเยอร์ข้อความที่สร้างใหม่พร้อมตำแหน่ง

เมื่อไฟล์มีข้อความอยู่แล้วแต่การดึงออกมาดูผิดปกติ

หาก PDF ของคุณมีเลเยอร์ข้อความจริงอยู่แล้ว แต่เครื่องมืออย่าง pdf-to-text ให้ข้อความออกมาในลำดับแปลก ๆ คอลัมน์รวมกันหรือระยะห่างหายไป นั่นเป็นปัญหาที่ต่างออกไปและไม่เกี่ยวข้องกัน: อ็อบเจ็กต์ข้อความมีอยู่จริง แต่ลำดับการอ่านบนหน้าไม่ได้ถูกเก็บไว้ในแบบที่สคริปต์คาดหวังตามธรรมชาติ นั่นเป็นความแปลกประหลาดของเลย์เอาต์ที่ต้องแก้ไขหลังการดึงข้อมูล ไม่ใช่สัญญาณว่าข้อความหายไป และไม่ต้องใช้ OCR แก้ไข

เครื่องมือที่กล่าวถึงในบทความนี้

คำถามที่พบบ่อย

PDF ของฉันดูเหมือนเอกสารที่พิมพ์ปกติแต่ยังเลือกข้อความไม่ได้เลย ทำไม

มันน่าจะเป็นหน้าที่สแกนหรือถ่ายภาพแล้วบันทึกเป็น PDF หรือเอกสารที่ทำให้แบนเป็นภาพโดยตั้งใจ ทางสายตามันแยกไม่ออกจาก PDF แบบข้อความ ความแตกต่างจะปรากฏก็ต่อเมื่อคุณลองค้นหาหรือเลือกมันเท่านั้น การรันผ่าน OCR จะสร้างเลเยอร์ข้อความจริงที่เลือกได้จากพิกเซลขึ้นมาใหม่

OCR ทำงานได้ดีเท่ากันในทุกภาษาหรือไม่

ไม่ ความแม่นยำขึ้นอยู่กับว่ามีโมเดลที่ฝึกมาสำหรับภาษาและอักษรนั้นหรือไม่ และคุณภาพของสแกน ภาษาที่รองรับดีบนสแกนที่คมชัดและตรงจะรู้จำได้แม่นยำ ลายมือเขียน ภาพความละเอียดต่ำ หรือภาษาที่มีข้อมูลฝึกน้อยกว่าจะเกิดข้อผิดพลาดมากขึ้น ผลลัพธ์ OCR เป็นการถอดความแบบพยายามให้ดีที่สุดเสมอ ควรตรวจทานอย่างรวดเร็วก่อนพึ่งพามัน

แหล่งข้อมูล