ไม่มีการอัปโหลด, 100% ในเครื่อง, ไม่มีบัญชี

ทำให้ PDF ที่สแกนค้นหาได้

วาง PDF ที่สแกนแล้วรับหน้าเดิมพร้อมเลเยอร์ข้อความที่มองไม่เห็นและค้นหาได้เพิ่มเข้ามา การรู้จำทำงานทั้งหมดในเบราว์เซอร์ของคุณ (บนอุปกรณ์ ออฟไลน์หลังจากโหลดครั้งแรก) ไม่มีการอัปโหลด

PDF OCR · ทำให้ค้นหาได้ ทำงานอย่างไร

PDF OCR แปลง PDF ที่สแกนไว้ ซึ่งประกอบด้วยภาพหน้ากระดาษโดยไม่มีข้อความจริง ให้กลายเป็น PDF ที่ค้นหาได้: ภาพหน้าเดิม บวกกับเลเยอร์ข้อความที่มองไม่เห็นวางทับตำแหน่งคำที่รู้จักแต่ละคำ เปิดผลลัพธ์ในโปรแกรมอ่าน PDF ใดก็ได้ และตอนนี้คุณสามารถใช้ Ctrl+F เพื่อค้นหาคำ เลือกและคัดลอกย่อหน้า หรือให้เสิร์ชเอนจินจัดทำดัชนีเอกสารได้ ซึ่งเป็นสิ่งที่ภาพสแกนธรรมดาทำไม่ได้ การรู้จำตัวอักษรทำงานด้วย tesseract.js (เอนจิน OCR แบบ self-hosted ตัวเดียวกับที่เครื่องมือ OCR ใช้) และการเรนเดอร์หน้าใช้ pdf.js ทั้งสองทำงานอยู่ภายในแท็บเบราว์เซอร์ของคุณทั้งหมด และไฟล์ของคุณจะไม่ถูกอัปโหลดเลย

เครื่องมือนี้ซื่อสัตย์กับสิ่งที่ทำได้และทำไม่ได้ มันไม่ได้สร้างเลย์เอาต์ ตาราง หรือฟอนต์ขึ้นใหม่ และไม่ใช่ตัวแปลงเป็นเอกสารที่แก้ไขได้ หน้าที่มองเห็นยังคงเป็นภาพเหมือนต้นฉบับสแกนทุกประการ โดยมีเลเยอร์ข้อความที่ซ่อนอยู่เพิ่มไว้ใต้รูปลักษณ์เดิม ความแม่นยำของการรู้จำขึ้นอยู่กับคุณภาพของภาพสแกน คำแนะนำแบบเดียวกับเอนจิน OCR ทั่วไปคือ 200 DPI ขึ้นไป คอนทราสต์สูง และหน้าตรง หากคุณต้องการเพียงข้อความที่แยกออกมาแบบข้อความล้วน ไม่ใช่ PDF ที่ค้นหาได้ภายใน เครื่องมือ OCR จะสร้างไฟล์ .txt แทน และเร็วกว่าสำหรับงานนั้นโดยเฉพาะ

วิธีใช้ PDF OCR · ทำให้ค้นหาได้ ทีละขั้นตอน

  1. วาง PDF ที่สแกนไว้ (หนึ่งภาพต่อหนึ่งหน้า ไม่มีเลเยอร์ข้อความอยู่แล้ว) ลงบนพื้นที่อัปโหลด
  2. เลือกภาษาหลักของเอกสารจากเมนูเลือกภาษา
  3. หากนี่เป็นครั้งแรกที่ใช้เครื่องมือนี้ ให้รอให้เอนจิน tesseract.js ดาวน์โหลด (เกิดขึ้นเพียงครั้งเดียว)
  4. คลิกเริ่มและรอในขณะที่แต่ละหน้าถูกเรนเดอร์และรู้จำตามลำดับ
  5. ดาวน์โหลด PDF ที่ค้นหาได้: หน้าตาเดิม แต่ตอนนี้มีเลเยอร์ข้อความอยู่ข้างใต้

กรณีการใช้งานที่พบบ่อย

  • สัญญาที่สแกนไว้ต้องการให้ค้นหาได้ เพื่อให้พบข้อกำหนดเฉพาะด้วย Ctrl+F แทนที่จะอ่านทุกหน้า
  • ใบแจ้งหนี้ที่สแกนไว้เป็นชุดต้องเข้าคลังเอกสารที่ดัชนีค้นหาอ่านเฉพาะข้อความ PDF จริง
  • แบบฟอร์มที่ถ่ายภาพหรือสแกนไว้ต้องการให้ป้ายกำกับที่พิมพ์ไว้เลือกได้ เพื่อคัดลอกย่อหน้าไปวางในอีเมล
  • คลังรายงานที่สแกนไว้เป็นภาษาเยอรมันต้องการค้นหาข้อความแบบเต็ม เลือกภาษาเยอรมันก่อนรันเครื่องมือ

คำถามที่พบบ่อย

เครื่องมือนี้ต่างจากเครื่องมือ OCR ธรรมดาอย่างไร?

เครื่องมือ OCR แยกข้อความล้วนออกมาเป็นไฟล์ .txt โดยละทิ้งเลย์เอาต์และภาพต้นฉบับทั้งหมด ส่วน PDF OCR เก็บภาพหน้า PDF ต้นฉบับไว้เหมือนเดิมทุกประการ และเพิ่มเลเยอร์ข้อความที่ค้นหาได้แบบมองไม่เห็นไว้ข้างใต้ ใช้ OCR เมื่อต้องการเฉพาะคำ ใช้ PDF OCR เมื่อต้องการเก็บเอกสารไว้เป็น PDF แต่ให้ค้นหาและเลือกข้อความได้

PDF ผลลัพธ์จะดูต่างจากภาพสแกนของฉันหรือไม่?

ไม่ต่าง แต่ละหน้าถูกเรนเดอร์จาก PDF ต้นฉบับของคุณและฝังกลับเป็นภาพ เหมือนพิกเซลต่อพิกเซลกับภาพสแกนต้นฉบับ (โดยอนุโลมการเข้ารหัส JPEG ใหม่) คำที่รู้จำจะถูกวาดทับด้วยความทึบเป็นศูนย์ จึงไม่มีอะไรใหม่ที่มองเห็นได้ การค้นหาข้อความหรือการเลือกข้อความเป็นวิธีเดียวที่จะสังเกตเห็นเลเยอร์ที่เพิ่มเข้ามา

เครื่องมือสร้างตาราง คอลัมน์ หรือฟอนต์ขึ้นใหม่หรือไม่?

ไม่สร้าง ผลลัพธ์เก็บหน้าไว้เป็นภาพแบนราบภาพเดียว เลเยอร์ข้อความที่มองไม่เห็นจะตามตำแหน่งคำที่รู้จำ แต่ไม่รักษาโครงสร้างตาราง ลำดับการอ่านแบบหลายคอลัมน์เกินกว่าที่ tesseract.js จะอนุมานได้ หรือฟอนต์ต้นฉบับ นี่คือเลเยอร์เพื่อความค้นหาได้ ไม่ใช่การแปลงเอกสารเป็นข้อความที่แก้ไขได้

เอกสารที่สแกนของฉันถูกส่งไปที่ใดระหว่างการประมวลผลหรือไม่?

ไม่ถูกส่งไปที่ใด หลังจากดาวน์โหลดเอนจิน tesseract.js และแพ็กภาษาจากไซต์นี้ (การดาวน์โหลดครั้งเดียวขนาดหลายเมกะไบต์ในการใช้งานครั้งแรก) การเรนเดอร์ทุกหน้าและการรู้จำทุกครั้งเกิดขึ้นภายในแท็บเบราว์เซอร์ของคุณทั้งหมด สัญญาที่สแกน บันทึกทางการแพทย์ หรือเอกสารที่ละเอียดอ่อนอื่น ๆ จะไม่ไปถึงเซิร์ฟเวอร์เลย

ทำไม PDF ที่ยาวถึงใช้เวลาประมวลผลนาน?

แต่ละหน้าจะถูกเรนเดอร์เป็นภาพและรัน OCR บนภาพนั้นทีละหน้า ทั้งหมดภายในแท็บเบราว์เซอร์ของคุณ ดังนั้นเวลาประมวลผลจึงแปรผันตามจำนวนหน้า แถบความคืบหน้าสะท้อนความคืบหน้าจริงต่อหน้า และไฟล์ถูกจำกัดที่ 80 MB เพื่อให้ทั้งกระบวนการอยู่ในงบหน่วยความจำของแท็บเบราว์เซอร์

ถ้า PDF ของฉันมีข้อความที่เลือกได้อยู่แล้วล่ะ?

การรัน OCR บน PDF ที่มีเลเยอร์ข้อความจริงอยู่แล้วเป็นสิ่งไม่จำเป็น เพราะเปิดในโปรแกรมอ่านแล้วกด Ctrl+F ก็ใช้ได้อยู่แล้ว เครื่องมือนี้มีไว้สำหรับ PDF ที่ประกอบด้วยภาพหน้าโดยไม่มีข้อความอยู่เบื้องหลัง ซึ่งเป็นผลลัพธ์ทั่วไปจากเครื่องสแกนแบบแท่นราบหรือการ "พิมพ์เป็น PDF" ของเอกสารที่ถ่ายภาพไว้