PDF OCR · ทำให้ค้นหาได้ ทำงานอย่างไร
PDF OCR แปลง PDF ที่สแกนไว้ ซึ่งประกอบด้วยภาพหน้ากระดาษโดยไม่มีข้อความจริง ให้กลายเป็น PDF ที่ค้นหาได้: ภาพหน้าเดิม บวกกับเลเยอร์ข้อความที่มองไม่เห็นวางทับตำแหน่งคำที่รู้จักแต่ละคำ เปิดผลลัพธ์ในโปรแกรมอ่าน PDF ใดก็ได้ และตอนนี้คุณสามารถใช้ Ctrl+F เพื่อค้นหาคำ เลือกและคัดลอกย่อหน้า หรือให้เสิร์ชเอนจินจัดทำดัชนีเอกสารได้ ซึ่งเป็นสิ่งที่ภาพสแกนธรรมดาทำไม่ได้ การรู้จำตัวอักษรทำงานด้วย tesseract.js (เอนจิน OCR แบบ self-hosted ตัวเดียวกับที่เครื่องมือ OCR ใช้) และการเรนเดอร์หน้าใช้ pdf.js ทั้งสองทำงานอยู่ภายในแท็บเบราว์เซอร์ของคุณทั้งหมด และไฟล์ของคุณจะไม่ถูกอัปโหลดเลย
เครื่องมือนี้ซื่อสัตย์กับสิ่งที่ทำได้และทำไม่ได้ มันไม่ได้สร้างเลย์เอาต์ ตาราง หรือฟอนต์ขึ้นใหม่ และไม่ใช่ตัวแปลงเป็นเอกสารที่แก้ไขได้ หน้าที่มองเห็นยังคงเป็นภาพเหมือนต้นฉบับสแกนทุกประการ โดยมีเลเยอร์ข้อความที่ซ่อนอยู่เพิ่มไว้ใต้รูปลักษณ์เดิม ความแม่นยำของการรู้จำขึ้นอยู่กับคุณภาพของภาพสแกน คำแนะนำแบบเดียวกับเอนจิน OCR ทั่วไปคือ 200 DPI ขึ้นไป คอนทราสต์สูง และหน้าตรง หากคุณต้องการเพียงข้อความที่แยกออกมาแบบข้อความล้วน ไม่ใช่ PDF ที่ค้นหาได้ภายใน เครื่องมือ OCR จะสร้างไฟล์ .txt แทน และเร็วกว่าสำหรับงานนั้นโดยเฉพาะ