ไม่มีการอัปโหลด, 100% ในเครื่อง, ไม่มีบัญชี

วิธีทำ

ทำให้ PDF ที่สแกนค้นหาได้

PDF ที่สแกนแล้วดูเหมือนเอกสารปกติ แต่จริง ๆ แล้วคือภาพของหน้ากระดาษ: Ctrl+F ค้นหาอะไรไม่เจอ และคุณเลือกหรือคัดลอกคำใดคำหนึ่งไม่ได้เลย เครื่องมือ PDF OCR แก้ปัญหานี้โดยไม่เปลี่ยนแปลงว่าไฟล์คืออะไร มันอ่านภาพแต่ละหน้า รู้จำตัวอักษรด้วยเอนจิน OCR บนอุปกรณ์ แล้ววางข้อความที่รู้จำได้แบบมองไม่เห็นทับลงบนภาพเดิม ดังนั้น PDF จึงยังหน้าตาและพิมพ์ออกมาเหมือนเดิมทุกประการ แต่ตอนนี้ตอบสนองต่อการค้นหาและการเลือกข้อความได้แล้ว ไฟล์ไม่เคยออกจากอุปกรณ์ของคุณเลย

ทีละขั้นตอน

  1. เปิดเครื่องมือ PDF OCR แล้ววาง PDF ที่สแกนไว้ลงไป รับเฉพาะไฟล์ PDF เท่านั้น และไฟล์จำกัดที่ 80 MB ซึ่งเอกสารสแกนหลายหน้าทั่วไปมีขนาดต่ำกว่านั้นมาก
  2. เลือกภาษาของเอกสารจากดรอปดาวน์ (อังกฤษ ฝรั่งเศส เยอรมัน สเปน โปรตุเกส หรืออิตาลี) และแก้ชื่อไฟล์ผลลัพธ์ได้หากต้องการ ค่าเริ่มต้นจะคงนามสกุล .pdf ให้อัตโนมัติ
  3. คลิก Run แล้วรอให้ทุกหน้าถูกประมวลผล แต่ละหน้าจะถูกเรนเดอร์ ผ่านเอนจิน OCR และได้รับเลเยอร์ข้อความที่มองไม่เห็นของตัวเองก่อนที่เครื่องมือจะไปหน้าถัดไป ดังนั้นเอกสารยาวจึงใช้เวลานานกว่าเอกสารหน้าเดียว ดาวน์โหลดผลลัพธ์: มันเปิดและพิมพ์เหมือนต้นฉบับทุกประการ แต่ Ctrl+F การเลือกข้อความ และการคัดลอกวางใช้งานได้แล้ว

PDF ที่ค้นหาได้หรือข้อความล้วน: คุณต้องการอันไหนจริง ๆ

เครื่องมือนี้และเครื่องมือ OCR ธรรมดาแก้ปัญหาพื้นฐานเดียวกัน คือการรู้จำข้อความในภาพที่สแกน แต่ทั้งสองเก็บสิ่งต่างกันไว้ เครื่องมือ OCR ทิ้งภาพหน้าไปแล้วคืนไฟล์ .txt ล้วนให้: ใช้เมื่อคุณต้องการวางคำลงในโปรแกรมแก้ไข แปล หรือค้นหาเป็นข้อความ และไม่สนใจการรักษาหน้าตาเดิมของเอกสาร ส่วนเครื่องมือ PDF OCR ที่นี่คง PDF ต้นฉบับไว้ทุกประการ ทั้งภาพหน้าและทุกอย่าง แล้วเพิ่มเพียงเลเยอร์ข้อความที่ซ่อนอยู่ข้างใต้เท่านั้น: ใช้เมื่อเอกสารยังต้องคงเป็น PDF ที่พิมพ์ ส่งอีเมล หรือเก็บถาวรได้ แต่คุณก็ต้องการค้นหาหรือคัดลอกจากมันได้ด้วย ไม่มีเครื่องมือใดสร้างเลย์เอาต์ใหม่เป็นข้อความที่แก้ไขได้พร้อมฟอนต์และตารางจริง ทั้งสองทำงานจากข้อความที่รู้จำเดียวกัน เพียงแต่บรรจุต่างกัน

ทำไมผลลัพธ์ขึ้นอยู่กับคุณภาพสแกน และข้อจำกัดอยู่ตรงไหน

ความแม่นยำของการรู้จำตามคุณภาพของภาพต้นฉบับ เหมือนกับ OCR ธรรมดา: สแกนที่คมชัดและตรงที่ราว 200 ถึง 300 DPI จะรู้จำได้แม่นยำ ในขณะที่ภาพเบลอ หน้าที่เอียง หรือเงาหนักจะทำให้อ่านคำผิดมากขึ้น หากหน้าออกมาเอียง ให้ปรับให้ตรงด้วยเครื่องมือ PDF deskew ก่อนรัน OCR เพื่อให้ขั้นตอนการรู้จำอ่านข้อความที่เรียบได้ เครื่องมือครอบคลุมหกภาษา (อังกฤษ ฝรั่งเศส เยอรมัน สเปน โปรตุเกส อิตาลี) เอกสารในภาษาที่ไม่รองรับจะรู้จำไม่ถูกต้อง การประมวลผลทำทีละหน้าในแท็บเบราว์เซอร์ของคุณ ดังนั้นเอกสารที่มีหลายสิบหน้าจะใช้เวลานานกว่าสแกนสองหน้าอย่างเห็นได้ชัด และไฟล์จำกัดที่ 80 MB PDF ผลลัพธ์ยังมีแนวโน้มมีขนาดใกล้เคียงต้นฉบับ เพราะภาพหน้าเองไม่ถูกแตะต้อง หากต้องการไฟล์ที่เล็กลงทีหลัง ให้นำไปบีบอัดด้วยตัวบีบอัด PDF

เลเยอร์ข้อความที่มองไม่เห็นถูกสร้างขึ้นอย่างไร

แต่ละหน้า PDF จะถูกแปลงเป็นภาพ canvas ในเบราว์เซอร์ของคุณก่อน ซึ่งเป็นขั้นตอนการเรนเดอร์เดียวกับที่เครื่องมือ PDF เป็นภาพใช้ เอนจิน OCR (Tesseract ที่คอมไพล์เป็น WebAssembly) อ่านภาพนั้นแล้วคืนทุกคำที่รู้จำได้พร้อมกรอบขอบเขตของมัน คือตำแหน่งบนหน้า จากนั้นคำเหล่านั้นจะถูกวาดกลับลงบนสำเนาของหน้า PDF เดิมที่ตำแหน่งที่รู้จำได้ แต่ที่ความทึบเป็นศูนย์ ดังนั้นจึงไม่มีอะไรเปลี่ยนแปลงทางสายตา: ภาพหน้าที่คุณเห็นและพิมพ์ออกมาคือภาพที่สแกนไว้เดิม ซึ่งวางอยู่ด้านบน ฟีเจอร์ค้นหาและเลือกข้อความของโปรแกรมอ่าน PDF จะมองเห็นเฉพาะเลเยอร์ข้อความที่มองไม่เห็นนั้นเท่านั้น นี่คือเหตุผลที่ไฟล์ค้นหาและเลือกได้โดยไม่มีอะไรดูต่างไปเลย ทั้งหมดนี้ ทั้งการเรนเดอร์ การรู้จำ และการประกอบใหม่ เกิดขึ้นภายในแท็บเบราว์เซอร์ของคุณ PDF ถูกอ่านจากดิสก์ในเครื่องและไม่เคยถูกส่งไปที่ไหนเลย

เครื่องมือที่ใช้ในคู่มือนี้

คำถามที่พบบ่อย

PDF ที่ค้นหาได้จะยังหน้าตาและพิมพ์ออกมาเหมือนสแกนต้นฉบับทุกประการหรือไม่

ใช่ เครื่องมือนี้ไม่เคยแก้ไขภาพหน้า มันเพิ่มเพียงเลเยอร์ข้อความที่มองไม่เห็นไว้ข้างใต้เท่านั้น บนหน้าจอและบนกระดาษ ผลลัพธ์เหมือนกับสแกนที่คุณวางลงไปทุกประการ สิ่งที่เปลี่ยนไปคือเครื่องมือค้นหาและเลือกข้อความของโปรแกรมอ่านตอนนี้พบและคว้าคำที่รู้จำได้แล้ว เพราะมันอ่านจากเลเยอร์ที่ซ่อนอยู่นั้น

ทำไมเครื่องมือนี้ถึงมีอยู่คู่กับเครื่องมือ OCR ธรรมดา

ทั้งสองตอบโจทย์ที่ต่างกันจากขั้นตอนการรู้จำเดียวกัน เครื่องมือ OCR ให้ไฟล์ข้อความล้วนแก่คุณ ซึ่งเหมาะถ้าคุณจะวาง แก้ไข หรือแปลคำเหล่านั้น และไม่จำเป็นต้องเก็บเอกสารเป็น PDF ส่วนเครื่องมือนี้คงไฟล์เป็น PDF พร้อมภาพหน้าเดิมไว้ครบถ้วน ซึ่งเหมาะถ้าเอกสารยังต้องพิมพ์ เก็บถาวร หรือส่งอีเมลตามสภาพเดิม แต่คุณก็ต้องการค้นหาหรือคัดลอกข้อความจากมันได้ด้วย

แหล่งข้อมูล