บทความ
ทำไมคัดลอกข้อความจาก PDF บางไฟล์ไม่ได้
ลองเลือกบรรทัดหนึ่งใน PDF ไฟล์หนึ่งแล้วคำต่าง ๆ จะไฮไลต์ตามปกติ พร้อมคัดลอก ลองท่าเดียวกันใน PDF อีกไฟล์แล้วไม่มีอะไรเกิดขึ้น หรือเคอร์เซอร์คว้าทั้งหน้าเหมือนเป็นภาพถ่าย เพราะมันคือภาพถ่ายจริง ๆ ไฟล์สองไฟล์ที่ดูเหมือนกันบนหน้าจอสามารถถูกสร้างต่างกันโดยสิ้นเชิงข้างใต้ นี่คือวิธีบอกว่าคุณมีแบบไหน และควรทำอย่างไรกับแบบที่ต้านทานการคัดลอก
PDF สองแบบที่ต่างกัน
PDF สามารถเก็บหน้าไว้ได้สองวิธีที่ต่างกันมาก ใน PDF แบบข้อความ ตัวอักษรทุกตัวคืออ็อบเจ็กต์ตัวอักษรที่มีค่า Unicode ฟอนต์ และตำแหน่ง เหมือนกับที่หน้าเว็บเก็บข้อความ: โปรแกรมดูสามารถเลือก ค้นหา และ screen reader อ่านออกเสียงได้ ใน PDF แบบภาพ หน้าคือภาพแบนหนึ่งภาพ มักสร้างจากสแกนเนอร์ แฟกซ์ หรือขั้นตอน "print to PDF" ที่ใช้กับภาพถ่ายของเอกสาร ตัวอักษรดูเหมือนกันในสายตาคุณ แต่สำหรับฟอร์แมตไฟล์แล้วไม่มีตัวอักษรอยู่ข้างใต้เลย มีแค่พิกเซล

วิธีเช็กด่วนว่าคุณมีแบบไหน
กด Ctrl+F หรือ Cmd+F แล้วค้นหาคำที่คุณเห็นชัดเจนบนหน้า หากการค้นหาพบและไฮไลต์มัน หน้านั้นมีเลเยอร์ข้อความจริง หากการค้นหาไม่พบอะไรเลยในเอกสารทั้งหมด หน้านั้นคือภาพ ไม่ว่ามันจะคมชัดแค่ไหนหรือดูเหมือนเอกสารที่พิมพ์แค่ไหนก็ตาม การลากเมาส์เพื่อเลือกบรรทัดก็ให้คำตอบเดียวกัน: การไฮไลต์เทียบกับการเลือกสี่เหลี่ยมธรรมดา
สร้างข้อความใหม่ด้วย OCR
Optical Character Recognition (OCR) อ่านพิกเซลของหน้าแบบภาพแล้วจับคู่รูปทรงกับโมเดลตัวอักษรที่ฝึกมาสำหรับภาษาหนึ่ง ๆ จากนั้นสร้างเลเยอร์ข้อความใหม่โดยวางตัวอักษรที่รู้จำได้ในตำแหน่งที่ปรากฏ เครื่องมืออย่าง ocr ทำสิ่งนี้ทั้งหมดในเบราว์เซอร์: ไม่มีอะไรถูกอัปโหลด และผลลัพธ์คือไฟล์ข้อความล้วนที่คุณค้นหา คัดลอก หรือแก้ไขได้ ความแม่นยำขึ้นอยู่กับต้นฉบับ: สแกนที่คมชัด ตรง ความละเอียดสูงในภาษาที่รองรับดีจะรู้จำได้แม่นยำ ในขณะที่หน้าที่เอียง เบลอ คอนทราสต์ต่ำ หรือลายมือเขียนจะเกิดข้อผิดพลาดมากขึ้น บางครั้งอ่านตัวอักษรผิดหรือคำผิด

เมื่อไฟล์มีข้อความอยู่แล้วแต่การดึงออกมาดูผิดปกติ
หาก PDF ของคุณมีเลเยอร์ข้อความจริงอยู่แล้ว แต่เครื่องมืออย่าง pdf-to-text ให้ข้อความออกมาในลำดับแปลก ๆ คอลัมน์รวมกันหรือระยะห่างหายไป นั่นเป็นปัญหาที่ต่างออกไปและไม่เกี่ยวข้องกัน: อ็อบเจ็กต์ข้อความมีอยู่จริง แต่ลำดับการอ่านบนหน้าไม่ได้ถูกเก็บไว้ในแบบที่สคริปต์คาดหวังตามธรรมชาติ นั่นเป็นความแปลกประหลาดของเลย์เอาต์ที่ต้องแก้ไขหลังการดึงข้อมูล ไม่ใช่สัญญาณว่าข้อความหายไป และไม่ต้องใช้ OCR แก้ไข
เครื่องมือที่กล่าวถึงในบทความนี้
- OCR · รูปภาพ/PDF เป็นข้อความดึงข้อความจากรูปภาพที่สแกนหรือ PDF ทั้งหมดในเบราว์เซอร์ของคุณ, ทำงานออฟไลน์ ไม่ต้องอัปโหลด
- PDF เป็นข้อความดึงเนื้อหาข้อความจาก PDF และดาวน์โหลดเป็นไฟล์ .txt โดยไม่มีการอัปโหลด
- PDF OCR · ทำให้ค้นหาได้แปลง PDF ที่สแกนให้ค้นหาและเลือกข้อความได้ทั้งหมดในเบราว์เซอร์ของคุณ ไม่มีการอัปโหลด
คำถามที่พบบ่อย
PDF ของฉันดูเหมือนเอกสารที่พิมพ์ปกติแต่ยังเลือกข้อความไม่ได้เลย ทำไม
มันน่าจะเป็นหน้าที่สแกนหรือถ่ายภาพแล้วบันทึกเป็น PDF หรือเอกสารที่ทำให้แบนเป็นภาพโดยตั้งใจ ทางสายตามันแยกไม่ออกจาก PDF แบบข้อความ ความแตกต่างจะปรากฏก็ต่อเมื่อคุณลองค้นหาหรือเลือกมันเท่านั้น การรันผ่าน OCR จะสร้างเลเยอร์ข้อความจริงที่เลือกได้จากพิกเซลขึ้นมาใหม่
OCR ทำงานได้ดีเท่ากันในทุกภาษาหรือไม่
ไม่ ความแม่นยำขึ้นอยู่กับว่ามีโมเดลที่ฝึกมาสำหรับภาษาและอักษรนั้นหรือไม่ และคุณภาพของสแกน ภาษาที่รองรับดีบนสแกนที่คมชัดและตรงจะรู้จำได้แม่นยำ ลายมือเขียน ภาพความละเอียดต่ำ หรือภาษาที่มีข้อมูลฝึกน้อยกว่าจะเกิดข้อผิดพลาดมากขึ้น ผลลัพธ์ OCR เป็นการถอดความแบบพยายามให้ดีที่สุดเสมอ ควรตรวจทานอย่างรวดเร็วก่อนพึ่งพามัน