ไม่มีการอัปโหลด, 100% ในเครื่อง, ไม่มีบัญชี

PDF → การดึงข้อความ

ดึงข้อความที่อ่านได้ทั้งหมดจาก PDF ดาวน์โหลดเป็นไฟล์ .txt ทุกอย่างอยู่ในเบราว์เซอร์ของคุณ, ไม่มีการส่งไฟล์ไปยังเซิร์ฟเวอร์

PDF เป็นข้อความ ทำงานอย่างไร

PDF to Text ดึงชั้นข้อความที่มีอยู่จาก PDF และบันทึกเป็นไฟล์ .txt ธรรมดา การดึงข้อมูลทำโดย pdf.js ภายในเบราว์เซอร์ของคุณ อ่าน text content object ที่ฝังอยู่ใน page stream ของ PDF เอกสารไม่เคยออกจากอุปกรณ์ของคุณ ผลลัพธ์ถูกประกอบในท้องถิ่นและเสนอให้ดาวน์โหลดโดยตรง

เครื่องมือนี้อ่านชั้นข้อความที่มีอยู่แล้วในไฟล์ หาก PDF ของคุณถูกสร้างโดยโปรแกรมประมวลคำหรือเครื่องมือส่งออก มักจะมีชั้นข้อความและการดึงข้อมูลจะทำงานได้ดี หาก PDF เป็นสแกนของเอกสารกระดาษ หน้าต่างๆ มีข้อมูลภาพเท่านั้นและไม่มีชั้นข้อความให้ดึง ในกรณีนั้น เครื่องมือนี้จะส่งคืนผลลัพธ์ว่างเปล่าหรือไม่ครบถ้วน PDF ที่สแกนต้องการ optical character recognition (OCR) เพื่อสร้างข้อความ ซึ่งเป็นกระบวนการแยกต่างหากที่ไม่ทำโดยเครื่องมือนี้ ตรวจสอบว่า PDF ของคุณมีข้อความที่เลือกได้ในโปรแกรมดูก่อนใช้เครื่องมือนี้

วิธีใช้ PDF เป็นข้อความ ทีละขั้นตอน

  1. โหลด PDF ของคุณเข้าสู่เครื่องมือดึงข้อความ
  2. รอให้ pdf.js อ่านชั้นข้อความจากทุกหน้า
  3. ตรวจสอบตัวอย่างข้อความที่ดึงออกมา
  4. คลิก download เพื่อบันทึกไฟล์ .txt

กรณีการใช้งานที่พบบ่อย

  • ดึงข้อความจาก PDF บทความวิจัยเพื่อวางในแอปพลิเคชันจดบันทึกหรือประมวลผลด้วยเครื่องมือสรุป
  • ดึงเนื้อหาจาก PDF ใบแจ้งหนี้ลงในสเปรดชีตสำหรับการทำบัญชีโดยไม่ต้องพิมพ์ด้วยมือ
  • กู้คืนข้อความจาก PDF ที่เสียหายหรือมีเค้าโครงล็อกซึ่งการคัดลอกวางในโปรแกรมดูใช้งานไม่ได้
  • แปลง PDF บทความเป็นข้อความธรรมดาสำหรับประมวลผลด้วยสคริปต์หรือเครื่องมือบรรทัดคำสั่ง

คำถามที่พบบ่อย

ทำไมข้อความที่ดึงออกมาจึงว่างเปล่าหรือเสียหายสำหรับ PDF บางไฟล์

สาเหตุที่พบบ่อยที่สุดคือ PDF เป็นสแกน: หน้าเป็นภาพและไม่มีชั้นข้อความ สาเหตุอื่นรวมถึง PDF ที่ข้อความเก็บเป็นเส้นโครงร่างหรือการเข้ารหัสฟอนต์ที่กำหนดเองซึ่ง pdf.js ไม่สามารถแมปกับตัวอักษรที่อ่านได้ สำหรับเอกสารสแกน จำเป็นต้องใช้ OCR เพื่อสร้างข้อความ

เครื่องมือนี้ทำ OCR บน PDF ที่สแกนหรือไม่

ไม่ เครื่องมือนี้อ่านชั้นข้อความที่มีอยู่จาก PDF ไม่ทำ optical character recognition สำหรับ PDF ที่สแกน ให้ใช้เครื่องมือ OCR ซึ่งส่งภาพหน้าผ่านเครื่องมือ OCR ท้องถิ่นในเบราว์เซอร์ของคุณ

การดึงข้อความทำบนเซิร์ฟเวอร์หรือในเบราว์เซอร์ของฉัน

ในเบราว์เซอร์ของคุณ pdf.js อ่านโครงสร้าง PDF ในท้องถิ่น แยกวิเคราะห์ text content object จาก page stream แต่ละอัน และประกอบผลลัพธ์ในหน่วยความจำเบราว์เซอร์ ข้อมูล PDF ไม่เคยออกจากอุปกรณ์ของคุณในระหว่างกระบวนการนี้

การจัดรูปแบบและเค้าโครงจะถูกเก็บรักษาในผลลัพธ์ข้อความหรือไม่

ไม่ ข้อความธรรมดาไม่มีข้อมูลฟอนต์ ขนาด สี หรือตำแหน่ง ผลลัพธ์เป็นข้อความที่ไม่มีรูปแบบตามลำดับการอ่านที่ pdf.js กำหนด ตาราง เค้าโครงหลายคอลัมน์ และการจัดรูปแบบพิเศษจะถูกทำให้แบน สำหรับการเก็บรักษาเค้าโครงที่สมบูรณ์ โปรแกรมแปลง PDF เป็น HTML เหมาะกว่า

ฉันสามารถดึงข้อความจาก PDF ที่มีรหัสผ่านได้หรือไม่

หาก PDF มีรหัสผ่านผู้ใช้แบบเปิด คุณต้องให้รหัสผ่านเพื่อให้ PDF อ่านได้ ข้อจำกัดการดึงระดับเจ้าของอาจบล็อกการทำงานด้วย ลบข้อจำกัดเหล่านั้นก่อนโดยใช้เครื่องมือ PDF Unlock จากนั้นลองดึงใหม่

ฉันต้องสร้างบัญชีเพื่อดึงข้อความจาก PDF หรือไม่?

ไม่ต้อง ไม่มีการสมัครสมาชิกและไม่มีบัญชี วางไฟล์ อ่านตัวอย่างข้อความที่ดึงออกมา แล้วดาวน์โหลดไฟล์ .txt

PDF to Text ทำงานบนเบราว์เซอร์มือถือได้ไหม?

ได้ pdf.js ทำงานเหมือนกันทั้งบนเบราว์เซอร์มือถือและเดสก์ท็อป คัดลอกหรือดาวน์โหลดข้อความที่ดึงออกมาได้โดยตรงจากหน้ามือถือทันทีที่การดึงข้อความเสร็จสิ้น