ไม่มีการอัปโหลด, 100% ในเครื่อง, ไม่มีบัญชี

วิธีทำ

วิธีดึงรูปภาพที่ฝังอยู่ออกจาก PDF

คำว่าดึงรูปภาพออกจาก PDF นั้นมีความหมายต่างกันสองแบบ และต้องใช้เครื่องมือคนละตัว คู่มือนี้พูดถึงการดึงไฟล์รูปภาพต้นฉบับที่ถูกวางไว้ภายในเอกสารออกมา ไม่ว่าจะเป็นภาพถ่ายที่นักออกแบบใส่ลงในโบรชัวร์ โลโก้ในรายงาน หรือภาพสแกนภายในสัญญา ซึ่งไม่เหมือนกับการเปลี่ยนแต่ละหน้าให้กลายเป็นภาพ หากคุณต้องการภาพรวมว่าทั้งหน้าหน้าตาเป็นอย่างไร รวมถึงข้อความและเลย์เอาต์ ให้ใช้เครื่องมือ PDF เป็น JPG แทน ส่วนตัวดึงรูปภาพตรงนี้จะอ่านวัตถุภาพแบบแรสเตอร์ที่เก็บไว้ใน PDF แล้วคืนภาพต้นฉบับกลับมาให้คุณที่ความละเอียดเดิม ทั้งหมดในเบราว์เซอร์ของคุณ

ทีละขั้นตอน

  1. เปิดเครื่องมือดึงรูปภาพจาก PDF แล้ววางไฟล์ของคุณลงไป เครื่องมือจะอ่านเอกสารแบบในเครื่องและแสดงจำนวนรูปภาพที่ฝังอยู่ที่พบ ไม่มีอะไรถูกส่งไปไหนทั้งสิ้น เพราะการประมวลผลเกิดขึ้นในแท็บเบราว์เซอร์บนอุปกรณ์ของคุณเอง
    เครื่องมือดึงรูปภาพจาก PDF ที่โหลดเอกสารไว้ แสดงจำนวนรูปภาพที่ฝังอยู่ที่พบ
  2. ปล่อยให้เครื่องมือสแกนวัตถุรูปภาพที่ฝังอยู่ มันจะไล่ไปทุกหน้า เก็บภาพแรสเตอร์ทุกภาพที่พบ และลบสำเนาซอฟต์มาสก์ที่ซ้ำกันออกไป เพื่อไม่ให้คุณได้ภาพเดียวกันสองเวอร์ชัน ไม่มีการตั้งค่าหน้าหรือฟอร์แมตให้เลือก เพราะเป้าหมายคือการคืนภาพต้นฉบับให้ตรงตามที่ถูกเก็บไว้ ไม่ใช่การเข้ารหัสใหม่
  3. ดาวน์โหลดผลลัพธ์ หากมีภาพเดียวก็จะได้กลับมาเป็นไฟล์เดียว ส่วนหลายภาพจะถูกเสนอให้ดาวน์โหลดแยกกัน ตั้งชื่อและเรียงลำดับไว้เรียบร้อย แต่ละไฟล์จะคงฟอร์แมตเดิมที่อยู่ภายใน PDF โดยทั่วไปคือ JPEG สำหรับภาพถ่าย และ PNG สำหรับกราฟิกที่มีความโปร่งใส
    รูปภาพที่ดึงออกมาแล้วพร้อมดาวน์โหลด ไฟล์ละหนึ่งภาพ

รูปภาพที่ฝังอยู่ เทียบกับหน้าที่ถูกแปลงเป็นภาพ

นี่คือความแตกต่างที่ตัดสินว่าคุณต้องใช้เครื่องมือตัวไหน รูปภาพที่ฝังอยู่คือภาพถ่ายหรือกราฟิกที่ผู้สร้างวางไว้ภายใน PDF ตัวดึงรูปภาพนี้จะคืนไฟล์นั้นกลับมาตามที่ถูกเก็บไว้ ที่ขนาดพิกเซลจริง โดยไม่มีอะไรวาดอยู่รอบ ๆ ส่วนการเรนเดอร์หน้าให้กลายเป็นภาพนั้นตรงข้ามกัน เครื่องมือ PDF เป็น JPG จะวาดทุกอย่างบนหน้า (ข้อความ รูปทรงเวกเตอร์ พื้นหลัง และรูปภาพที่ฝังอยู่ทั้งหมดรวมกัน) ลงในภาพแรสเตอร์แบนเดียวที่ความละเอียดที่คุณเลือก ใช้ตัวดึงรูปภาพเมื่อคุณต้องการได้ไฟล์ต้นฉบับกลับมา เช่น เพื่อนำภาพสินค้ามาใช้ใหม่ และใช้ PDF เป็น JPG เมื่อคุณต้องการภาพรวมของหน้าที่ตรงกับสิ่งที่ผู้อ่านเห็น

ทำไมการทำในเครื่องจึงสำคัญ

รูปภาพที่ฝังลึกอยู่ใน PDF มักเป็นส่วนที่อ่อนไหวที่สุด เช่น ภาพถ่ายบัตรประชาชนที่สแกน หน้าที่ลงนามแล้ว ภาพหน้าจอภายใน หรืองานศิลป์ส่วนตัว การส่งเอกสารไปยังตัวดึงรูปภาพออนไลน์เท่ากับมอบทั้งหมดนั้นให้เซิร์ฟเวอร์ที่คุณควบคุมไม่ได้ พร้อมทั้งชั้นข้อความและเมตาดาทาต่าง ๆ ตัวดึงรูปภาพตรงนี้จะเปิด PDF ด้วย PDF.js ภายในเบราว์เซอร์ของคุณ และดึงวัตถุรูปภาพออกมาบนเครื่องของคุณ ดังนั้นไฟล์และทุกสิ่งที่อยู่ในนั้นจึงยังคงอยู่บนอุปกรณ์ของคุณ

วิธีที่การดึงภาพจาก PDF ทำงาน

การดึงภาพจาก PDF แตกต่างจากการแปลงหน้าเป็น raster screenshot ภายในไฟล์ PDF ภาพถูกเก็บเป็น /XObject stream dictionary แยกต่างหากที่มีข้อมูล binary ดิบ (โดยทั่วไปคือ DCTDecode/JPEG, Flate, JPX หรือ CCITT encoding) พร้อม metadata สำหรับขนาดและ color space เครื่องมือดึงข้อมูลที่เหมาะสมจะแยกวิเคราะห์ stream เหล่านี้โดยตรง ดึงแต่ละภาพออกโดยไม่ต้องเข้ารหัสใหม่ เนื่องจาก byte ดิบถูกอ่านแทนการเรนเดอร์ใหม่ ไฟล์ที่ดึงออกมาจึงรักษาความละเอียด color profile และคุณภาพที่มีอยู่ตอนฝังภาพครั้งแรกไว้อย่างแน่นอน ไม่มีขั้นตอนการบีบอัดใหม่หมายความว่าไม่มีการสูญเสียคุณภาพเพิ่มเติม ไม่ว่า PDF จะถูกบันทึกใหม่กี่ครั้งก็ตาม

เครื่องมือที่ใช้ในคู่มือนี้

คำถามที่พบบ่อย

ฉันจะได้รูปภาพต้นฉบับ หรือภาพหน้าจอของแต่ละหน้า

เป็นรูปภาพต้นฉบับ เครื่องมือนี้จะคืนไฟล์รูปภาพที่ฝังอยู่ตามที่ถูกเก็บไว้ใน PDF ที่ความละเอียดเดิมและในฟอร์แมตต้นฉบับ หากคุณต้องการภาพของแต่ละหน้าเต็มหน้าแทน รวมถึงข้อความและเลย์เอาต์ นั่นเป็นคนละงานกัน ให้ใช้เครื่องมือ PDF เป็น JPG ซึ่งจะแปลงทั้งหน้าเป็นภาพแรสเตอร์ที่ความละเอียดที่คุณเลือก

ทำไมเครื่องมือถึงพบรูปภาพน้อยกว่าที่ฉันคาดไว้

PDF จะมีรูปภาพที่ฝังอยู่เฉพาะตรงที่ผู้สร้างวางไฟล์แรสเตอร์ไว้จริงเท่านั้น กราฟิกเวกเตอร์ แผนภูมิที่วาดด้วยคำสั่งวาดของ PDF และข้อความ ไม่ถือเป็นรูปภาพ จึงไม่ถูกดึงออกมา เครื่องมือยังลบสำเนาซอฟต์มาสก์ที่ซ้ำกันซึ่งการส่งออกบางแบบสร้างขึ้น ทำให้จำนวนลดลงได้ หากหน้าใดเป็นภาพสแกนอยู่แล้ว มักจะมีรูปภาพเต็มหน้าเพียงภาพเดียว ซึ่งนั่นคือสิ่งที่คุณจะได้กลับมา