ट्यूटोरियल
किसी PDF में लगी इमेज को कैसे निकालें
PDF से इमेज निकालने का लोग दो अलग-अलग मतलब निकालते हैं, और दोनों के लिए अलग टूल चाहिए। यह गाइड दस्तावेज़ के भीतर रखी गई मूल इमेज फाइलों को बाहर खींचने के बारे में है: किसी ब्रोशर में डिज़ाइनर द्वारा डाली गई फोटो, किसी रिपोर्ट में लगा लोगो, किसी अनुबंध के अंदर के स्कैन। यह हर पेज को तस्वीर में बदलने जैसा नहीं है। अगर आपको पूरा पेज कैसा दिखता है (उसका टेक्स्ट और लेआउट सहित) उसका स्नैपशॉट चाहिए, तो इसके बजाय PDF से JPG टूल इस्तेमाल करें। यहाँ का एक्सट्रैक्टर PDF में संग्रहीत रास्टर ऑब्जेक्ट को पढ़ता है और आपको उन्हीं स्रोत इमेज को उनके मूल रिज़ॉल्यूशन पर, पूरी तरह आपके ब्राउज़र में ही, वापस देता है।
चरण दर चरण
- PDF इमेज एक्सट्रैक्टर खोलें और अपनी फाइल उसमें डालें। टूल दस्तावेज़ को स्थानीय रूप से पढ़ता है और बताता है कि उसमें कितनी लगी हुई इमेज मिलीं। कुछ भी कहीं नहीं भेजा जाता: पार्सिंग आपके अपने डिवाइस के ब्राउज़र टैब में ही होती है।

- उसे लगी हुई इमेज ऑब्जेक्ट को स्कैन करने दें। यह हर पेज पर घूमता है, मिलने वाले हर रास्टर को इकट्ठा करता है, और डुप्लिकेट सॉफ्ट-मास्क प्रतियाँ हटा देता है ताकि आपको एक ही तस्वीर के दो रूप न मिलें। चुनने के लिए कोई पेज या फॉर्मेट सेटिंग नहीं होती: मकसद यही है कि मूल इमेज ठीक वैसी ही लौटाई जाएँ जैसी वे संग्रहीत थीं, उन्हें दोबारा एन्कोड न किया जाए।
- नतीजे डाउनलोड करें। एक ही इमेज एक फाइल के रूप में वापस आती है; कई इमेज को अलग-अलग डाउनलोड के रूप में दिया जाता है, नामित और क्रमबद्ध ताकि वे व्यवस्थित रहें। हर फाइल वही फॉर्मेट रखती है जो PDF के अंदर थी, आम तौर पर फोटो के लिए JPEG और पारदर्शिता वाले ग्राफिक्स के लिए PNG।

लगी हुई इमेज बनाम तस्वीर में बदले गए पेज
यही फर्क तय करता है कि आपको कौन-सा टूल चाहिए। लगी हुई इमेज वह फोटो या ग्राफिक है जिसे लेखक ने PDF के अंदर रखा था; यह एक्सट्रैक्टर उस फाइल को ठीक वैसा ही लौटाता है जैसा वह संग्रहीत थी, उसके असली पिक्सेल आकार पर, उसके चारों ओर कुछ भी बनाए बिना। किसी पेज को तस्वीर में बदलना इसका उल्टा है: PDF से JPG पेज पर मौजूद हर चीज़ (टेक्स्ट, वेक्टर आकृतियाँ, बैकग्राउंड और लगी हुई इमेज सब एक साथ) को आपके चुने हुए रिज़ॉल्यूशन पर एक सपाट रास्टर में बना देता है। जब आपको स्रोत सामग्री वापस चाहिए, जैसे किसी उत्पाद की फोटो दोबारा इस्तेमाल करनी हो, तब एक्सट्रैक्टर का उपयोग करें। जब आपको पेज का ठीक वैसा स्नैपशॉट चाहिए जैसा कोई पाठक देखता है, तब PDF से JPG का उपयोग करें।
यह काम स्थानीय रूप से करना क्यों मायने रखता है
PDF में दबी हुई इमेज अक्सर उसका सबसे संवेदनशील हिस्सा होती हैं: स्कैन की गई पहचान फोटो, हस्ताक्षरित पेज, आंतरिक स्क्रीनशॉट, निजी कलाकृति। दस्तावेज़ को किसी ऑनलाइन एक्सट्रैक्टर पर भेजने का मतलब है यह सब, टेक्स्ट लेयर और किसी भी मेटाडेटा समेत, किसी ऐसे सर्वर को सौंप देना जिस पर आपका नियंत्रण नहीं है। यहाँ का एक्सट्रैक्टर आपके ब्राउज़र के भीतर PDF.js से PDF खोलता है और इमेज ऑब्जेक्ट को आपकी ही मशीन पर निकालता है, इसलिए फाइल और उसके अंदर की हर चीज़ आपके डिवाइस पर ही रहती है।
PDF image extraction कैसे काम करती है
PDF से images extract करना किसी page को raster screenshot में convert करने से अलग है। PDF file के अंदर, images separate /XObject stream dictionaries के रूप में stored हैं जिनमें raw binary data (आमतौर पर DCTDecode/JPEG, Flate, JPX, या CCITT encoding में) और dimensions और color space के लिए metadata होता है। एक proper extraction tool इन streams को directly parse करता है, बिना re-encoding के प्रत्येक image को बाहर निकालता है। क्योंकि raw bytes re-rendered होने के बजाय read किए जाते हैं, extracted file में exact resolution, color profile, और quality preserve होती है जो image पहली बार embed होने पर थी। कोई recompression step नहीं होता, यानी कोई additional quality loss नहीं होता, चाहे PDF को कितनी बार resave किया गया हो।
इस गाइड में इस्तेमाल किए गए टूल
अक्सर पूछे जाने वाले सवाल
क्या मुझे मूल इमेज मिलेंगी या पेजों के स्क्रीनशॉट?
मूल इमेज ही। यह टूल लगी हुई इमेज फाइलों को वैसा ही लौटाता है जैसा वे PDF में संग्रहीत थीं, उनके मूल रिज़ॉल्यूशन और मूल फॉर्मेट में। अगर इसके बजाय आपको हर पूरे पेज की तस्वीर चाहिए, उसके टेक्स्ट और लेआउट सहित, तो वह अलग काम है: PDF से JPG टूल इस्तेमाल करें, जो पूरे पेज को आपके चुने हुए रिज़ॉल्यूशन पर रास्टराइज़ करता है।
इसे मेरी उम्मीद से कम इमेज क्यों मिलीं?
किसी PDF में लगी हुई इमेज सिर्फ वहीं होती हैं जहाँ लेखक ने सचमुच रास्टर फाइलें रखी हों। वेक्टर ग्राफिक्स, PDF ड्रॉइंग कमांड से बने चार्ट, और टेक्स्ट इमेज नहीं होते, इसलिए वे नहीं निकाले जाते। टूल कुछ एक्सपोर्ट द्वारा बनाई गई डुप्लिकेट सॉफ्ट-मास्क प्रतियाँ भी हटा देता है, जिससे गिनती घट सकती है। अगर कोई पेज खुद एक स्कैन है, तो उसमें आम तौर पर एक पूरे-पेज की इमेज होती है, और वही आपको वापस मिलेगी।