วิธีทำ
วิธีดึงรูปภาพที่ฝังอยู่ออกจาก PDF
คำว่าดึงรูปภาพออกจาก PDF นั้นมีความหมายต่างกันสองแบบ และต้องใช้เครื่องมือคนละตัว คู่มือนี้พูดถึงการดึงไฟล์รูปภาพต้นฉบับที่ถูกวางไว้ภายในเอกสารออกมา ไม่ว่าจะเป็นภาพถ่ายที่นักออกแบบใส่ลงในโบรชัวร์ โลโก้ในรายงาน หรือภาพสแกนภายในสัญญา ซึ่งไม่เหมือนกับการเปลี่ยนแต่ละหน้าให้กลายเป็นภาพ หากคุณต้องการภาพรวมว่าทั้งหน้าหน้าตาเป็นอย่างไร รวมถึงข้อความและเลย์เอาต์ ให้ใช้เครื่องมือ PDF เป็น JPG แทน ส่วนตัวดึงรูปภาพตรงนี้จะอ่านวัตถุภาพแบบแรสเตอร์ที่เก็บไว้ใน PDF แล้วคืนภาพต้นฉบับกลับมาให้คุณที่ความละเอียดเดิม ทั้งหมดในเบราว์เซอร์ของคุณ
ทีละขั้นตอน
- เปิดเครื่องมือดึงรูปภาพจาก PDF แล้ววางไฟล์ของคุณลงไป เครื่องมือจะอ่านเอกสารแบบในเครื่องและแสดงจำนวนรูปภาพที่ฝังอยู่ที่พบ ไม่มีอะไรถูกส่งไปไหนทั้งสิ้น เพราะการประมวลผลเกิดขึ้นในแท็บเบราว์เซอร์บนอุปกรณ์ของคุณเอง

- ปล่อยให้เครื่องมือสแกนวัตถุรูปภาพที่ฝังอยู่ มันจะไล่ไปทุกหน้า เก็บภาพแรสเตอร์ทุกภาพที่พบ และลบสำเนาซอฟต์มาสก์ที่ซ้ำกันออกไป เพื่อไม่ให้คุณได้ภาพเดียวกันสองเวอร์ชัน ไม่มีการตั้งค่าหน้าหรือฟอร์แมตให้เลือก เพราะเป้าหมายคือการคืนภาพต้นฉบับให้ตรงตามที่ถูกเก็บไว้ ไม่ใช่การเข้ารหัสใหม่
- ดาวน์โหลดผลลัพธ์ หากมีภาพเดียวก็จะได้กลับมาเป็นไฟล์เดียว ส่วนหลายภาพจะถูกเสนอให้ดาวน์โหลดแยกกัน ตั้งชื่อและเรียงลำดับไว้เรียบร้อย แต่ละไฟล์จะคงฟอร์แมตเดิมที่อยู่ภายใน PDF โดยทั่วไปคือ JPEG สำหรับภาพถ่าย และ PNG สำหรับกราฟิกที่มีความโปร่งใส

รูปภาพที่ฝังอยู่ เทียบกับหน้าที่ถูกแปลงเป็นภาพ
นี่คือความแตกต่างที่ตัดสินว่าคุณต้องใช้เครื่องมือตัวไหน รูปภาพที่ฝังอยู่คือภาพถ่ายหรือกราฟิกที่ผู้สร้างวางไว้ภายใน PDF ตัวดึงรูปภาพนี้จะคืนไฟล์นั้นกลับมาตามที่ถูกเก็บไว้ ที่ขนาดพิกเซลจริง โดยไม่มีอะไรวาดอยู่รอบ ๆ ส่วนการเรนเดอร์หน้าให้กลายเป็นภาพนั้นตรงข้ามกัน เครื่องมือ PDF เป็น JPG จะวาดทุกอย่างบนหน้า (ข้อความ รูปทรงเวกเตอร์ พื้นหลัง และรูปภาพที่ฝังอยู่ทั้งหมดรวมกัน) ลงในภาพแรสเตอร์แบนเดียวที่ความละเอียดที่คุณเลือก ใช้ตัวดึงรูปภาพเมื่อคุณต้องการได้ไฟล์ต้นฉบับกลับมา เช่น เพื่อนำภาพสินค้ามาใช้ใหม่ และใช้ PDF เป็น JPG เมื่อคุณต้องการภาพรวมของหน้าที่ตรงกับสิ่งที่ผู้อ่านเห็น
ทำไมการทำในเครื่องจึงสำคัญ
รูปภาพที่ฝังลึกอยู่ใน PDF มักเป็นส่วนที่อ่อนไหวที่สุด เช่น ภาพถ่ายบัตรประชาชนที่สแกน หน้าที่ลงนามแล้ว ภาพหน้าจอภายใน หรืองานศิลป์ส่วนตัว การส่งเอกสารไปยังตัวดึงรูปภาพออนไลน์เท่ากับมอบทั้งหมดนั้นให้เซิร์ฟเวอร์ที่คุณควบคุมไม่ได้ พร้อมทั้งชั้นข้อความและเมตาดาทาต่าง ๆ ตัวดึงรูปภาพตรงนี้จะเปิด PDF ด้วย PDF.js ภายในเบราว์เซอร์ของคุณ และดึงวัตถุรูปภาพออกมาบนเครื่องของคุณ ดังนั้นไฟล์และทุกสิ่งที่อยู่ในนั้นจึงยังคงอยู่บนอุปกรณ์ของคุณ
วิธีที่การดึงภาพจาก PDF ทำงาน
การดึงภาพจาก PDF แตกต่างจากการแปลงหน้าเป็น raster screenshot ภายในไฟล์ PDF ภาพถูกเก็บเป็น /XObject stream dictionary แยกต่างหากที่มีข้อมูล binary ดิบ (โดยทั่วไปคือ DCTDecode/JPEG, Flate, JPX หรือ CCITT encoding) พร้อม metadata สำหรับขนาดและ color space เครื่องมือดึงข้อมูลที่เหมาะสมจะแยกวิเคราะห์ stream เหล่านี้โดยตรง ดึงแต่ละภาพออกโดยไม่ต้องเข้ารหัสใหม่ เนื่องจาก byte ดิบถูกอ่านแทนการเรนเดอร์ใหม่ ไฟล์ที่ดึงออกมาจึงรักษาความละเอียด color profile และคุณภาพที่มีอยู่ตอนฝังภาพครั้งแรกไว้อย่างแน่นอน ไม่มีขั้นตอนการบีบอัดใหม่หมายความว่าไม่มีการสูญเสียคุณภาพเพิ่มเติม ไม่ว่า PDF จะถูกบันทึกใหม่กี่ครั้งก็ตาม
เครื่องมือที่ใช้ในคู่มือนี้
คำถามที่พบบ่อย
ฉันจะได้รูปภาพต้นฉบับ หรือภาพหน้าจอของแต่ละหน้า
เป็นรูปภาพต้นฉบับ เครื่องมือนี้จะคืนไฟล์รูปภาพที่ฝังอยู่ตามที่ถูกเก็บไว้ใน PDF ที่ความละเอียดเดิมและในฟอร์แมตต้นฉบับ หากคุณต้องการภาพของแต่ละหน้าเต็มหน้าแทน รวมถึงข้อความและเลย์เอาต์ นั่นเป็นคนละงานกัน ให้ใช้เครื่องมือ PDF เป็น JPG ซึ่งจะแปลงทั้งหน้าเป็นภาพแรสเตอร์ที่ความละเอียดที่คุณเลือก
ทำไมเครื่องมือถึงพบรูปภาพน้อยกว่าที่ฉันคาดไว้
PDF จะมีรูปภาพที่ฝังอยู่เฉพาะตรงที่ผู้สร้างวางไฟล์แรสเตอร์ไว้จริงเท่านั้น กราฟิกเวกเตอร์ แผนภูมิที่วาดด้วยคำสั่งวาดของ PDF และข้อความ ไม่ถือเป็นรูปภาพ จึงไม่ถูกดึงออกมา เครื่องมือยังลบสำเนาซอฟต์มาสก์ที่ซ้ำกันซึ่งการส่งออกบางแบบสร้างขึ้น ทำให้จำนวนลดลงได้ หากหน้าใดเป็นภาพสแกนอยู่แล้ว มักจะมีรูปภาพเต็มหน้าเพียงภาพเดียว ซึ่งนั่นคือสิ่งที่คุณจะได้กลับมา