कोई अपलोड नहीं, 100% स्थानीय, कोई खाता नहीं

लेख

PDF में टेक्स्ट काला करना अक्सर क्यों नाकाम रहता है

किसी पैराग्राफ़ पर बना काला रेक्टेंगल ऐसा दिखता है जैसे टेक्स्ट चला गया हो, लेकिन ज़्यादातर PDF एडिटर में ऐसा नहीं होता। जो अक्षर आपने ढके थे वे अभी भी फ़ाइल में सिलेक्ट करने लायक कैरेक्टर के रूप में स्टोर हैं; बॉक्स सिर्फ़ उनके ऊपर बैठा एक नया शेप है। पेज कॉपी करें, इसे सर्च करें, या इसे किसी दूसरे व्यूअर में खोलें, और "रिडैक्ट" किया गया वाक्य दोबारा दिख सकता है। यहां है कि ऐसा क्यों होता है, और एक रिडैक्शन तरीका जो टेक्स्ट को छिपाने की बजाय असल में हटाता है।

ऊपर बना शेप डिलीशन नहीं है

PDF पेज दो चीज़ों को अलग-अलग रखता है: टेक्स्ट ऑब्जेक्ट, हर एक पोज़िशन और फ़ॉन्ट वाला एक कैरेक्टर, और पेज पर रखे ड्रॉइंग ऑब्जेक्ट, जिनमें आपका जोड़ा कोई भी रेक्टेंगल, हाइलाइट या एनोटेशन शामिल है। जब आप किसी PDF व्यूअर में काला बॉक्स बनाते हैं, आप मौजूदा टेक्स्ट ऑब्जेक्ट के ऊपर एक नया ड्रॉइंग ऑब्जेक्ट जोड़ रहे होते हैं। पेज अब रिडैक्ट किया हुआ दिखता है क्योंकि बॉक्स विज़ुअली अक्षरों को ढक देता है। कुछ भी फ़ाइल को नीचे के टेक्स्ट ऑब्जेक्ट हटाने के लिए नहीं कहता, इसलिए वे बिल्कुल वहीं रहते हैं जहां थे, वही पोज़िशन, वही कंटेंट।

दो लेयर में बंटे PDF पेज का डायग्राम: नीचे टेक्स्ट ऑब्जेक्ट और ऊपर रखा एक ड्रॉइंग-ऑब्जेक्ट बॉक्स, अक्षरों को विज़ुअली ढकता हुआ लेकिन डिलीट नहीं करता।

मूल टेक्स्ट दोबारा कैसे सामने आता है

चूंकि टेक्स्ट ऑब्जेक्ट कभी फ़ाइल से गए ही नहीं, चार सामान्य काम उन्हें उजागर कर सकते हैं: "काली की गई" लाइन सिलेक्ट और कॉपी करना, दस्तावेज़ में टेक्स्ट सर्च चलाना, किसी PDF-to-text टूल से रॉ टेक्स्ट निकालना, या फ़ाइल को ऐसे व्यूअर में खोलना जो टेक्स्ट ऑब्जेक्ट को ड्रॉइंग ऑब्जेक्ट के ऊपर अलग क्रम में रेंडर करता हो। इनमें से किसी के लिए भी खास हुनर नहीं चाहिए। यह सार्वजनिक रूप से एक बार से ज़्यादा हो चुका है: संवेदनशील हिस्सों पर काले बॉक्स के साथ जारी की गई PDF में नीचे पढ़ने और कॉपी करने लायक टेक्स्ट मिला, और यह गलती छिपी रहने की बजाय खबर बन गई।

पहले पेज को इमेज में बदलना

इसका फ़िक्स है रिडैक्ट करने से पहले टेक्स्ट लेयर हटाना, बाद में नहीं। pdf-to-image जैसे टूल से PDF पेज को प्लेन इमेज में बदलें, फिर उस इमेज पर संवेदनशील एरिया के ऊपर image-redact से बनाएं। उस पल पेज पर कोई टेक्स्ट ऑब्जेक्ट नहीं बचता, सिर्फ़ पिक्सल, इसलिए बॉक्स किसी रिकवर करने लायक चीज़ के ऊपर नहीं बैठा। image-to-pdf से रिडैक्ट की गई इमेज को दोबारा PDF में जोड़ें और पहले संवेदनशील रहा टेक्स्ट अब बस मौजूद नहीं है, सिर्फ़ एक पेज की तस्वीर है जिसका हिस्सा ढका हुआ है।

वर्कफ़्लो डायग्राम: PDF पेज इमेज में बदला जाता है, पिक्सल पर ओपेक बॉक्स से रिडैक्ट किया जाता है, फिर एक नई PDF में दोबारा जोड़ा जाता है जिसमें नीचे रिकवर करने लायक कोई टेक्स्ट नहीं बचता।

इसमें क्या ट्रेड होता है

किसी पेज को रास्टराइज़ करना असली, सर्चेबल टेक्स्ट को एक स्टैटिक तस्वीर में बदल देता है, इसलिए बाद में रिडैक्ट किया गया पेज पढ़ने वाला कोई भी उस पेज का टेक्स्ट अब सिलेक्ट या सर्च नहीं कर सकता, रिडैक्ट किया हो या नहीं। जिस पेज को आप सुरक्षित कर रहे हैं उसके लिए यह एक स्वीकार्य ट्रेड-ऑफ़ है: विकल्प, टेक्स्ट लेयर बरकरार रखना और उम्मीद करना कि कोई इसे जांचेगा नहीं, वही गलती है जिससे यह लेख शुरू हुआ। अगर उसी दस्तावेज़ के दूसरे पेजों में कोई संवेदनशील कंटेंट नहीं है, तो उन्हें बिना छुए छोड़ा जा सकता है और सिर्फ़ ज़रूरत वाले पेज ही रास्टराइज़ किए जा सकते हैं।

ठोस बॉक्स इस्तेमाल करें, और मेटाडेटा भी जांचें

टेक्स्ट के लिए, पूरी तरह ओपेक काला या सॉलिड-कलर बॉक्स ज़्यादा सुरक्षित चुनाव है; अगर धुंधलापन हल्का हो तो बड़े, प्लेन टेक्स्ट के लिए ब्लर फ़िल्टर को कभी-कभी उलटकर पढ़ा जा सकता है, इसलिए यह वाक्यों की बजाय चेहरों या फ़ोटो के लिए ज़्यादा मुफ़ीद है। दिखने वाले पेज को रिडैक्ट करना फ़ाइल के मेटाडेटा को नहीं छूता: लेखक का नाम, सॉफ़्टवेयर वर्ज़न, एम्बेडेड फ़ोटो पर GPS निर्देशांक, या एडिट हिस्ट्री पेज कंटेंट से अलग लीक हो सकते हैं। अगर यह आपके दस्तावेज़ के लिए मायने रखता है, तो शेयर करने से पहले जांचें कि आपकी फ़ाइल का अपना मेटाडेटा क्या उजागर करता है।

इस लेख में उल्लेखित टूल्स

अक्सर पूछे जाने वाले सवाल

क्या PDF व्यूअर में सीधे काला रेक्टेंगल बनाने से नीचे का टेक्स्ट असल में डिलीट हो जाता है?

आमतौर पर नहीं। जब तक टूल में कोई खास रिडैक्शन फ़ीचर न हो जो नीचे के टेक्स्ट ऑब्जेक्ट हटाता हो, कोई शेप बनाना सिर्फ़ पेज के ऊपर एक लेयर जोड़ता है। मूल कैरेक्टर फ़ाइल में बने रहते हैं और आम टूल से सिलेक्ट, सर्च या निकाले जा सकते हैं।

क्या संवेदनशील टेक्स्ट को ब्लर करना बॉक्स से ढकने से ज़्यादा सुरक्षित है?

टेक्स्ट के लिए, नहीं। बड़े, प्लेन टेक्स्ट पर लगाया हल्का ब्लर कभी-कभी इतना अच्छे से उलटा जा सकता है कि मूल कैरेक्टर का अंदाज़ा लगाया जा सके, खासकर छोटे शब्दों या नंबरों के साथ। टेक्स्ट के लिए ठोस, पूरी तरह ओपेक बॉक्स, या पहले रास्टराइज़ करके टेक्स्ट लेयर को पूरी तरह हटाना, ज़्यादा सुरक्षित विकल्प है; ब्लर चेहरों या सामान्य फ़ोटो कंटेंट के लिए ज़्यादा मुफ़ीद है।

क्या रिडैक्ट करने से पहले PDF को इमेज में कन्वर्ट करने से कुछ ज़रूरी खोता है?

इससे आप कन्वर्ट किए पेजों पर टेक्स्ट सिलेक्ट या सर्च करने की क्षमता खो देते हैं, क्योंकि वे प्लेन तस्वीरें बन जाते हैं। जिस पेज को आप सक्रिय रूप से रिडैक्ट कर रहे हैं, उसके लिए यही तो मकसद है: संवेदनशील टेक्स्ट अब निकाले जा सकने वाले कैरेक्टर के रूप में मौजूद नहीं रहता। जिन पेजों में कोई संवेदनशील कंटेंट नहीं है, वे सामान्य PDF पेज बने रह सकते हैं अगर आप सिर्फ़ ज़रूरत वाले पेज ही रास्टराइज़ करें।