कोई अपलोड नहीं, 100% स्थानीय, कोई खाता नहीं

लेख

PDF में टेक्स्ट काला करना अक्सर क्यों नाकाम रहता है

किसी पैराग्राफ़ पर बना काला रेक्टेंगल ऐसा दिखता है जैसे टेक्स्ट चला गया हो, लेकिन ज़्यादातर PDF एडिटर में ऐसा नहीं होता। जो अक्षर आपने ढके थे वे अभी भी फ़ाइल में सिलेक्ट करने लायक कैरेक्टर के रूप में स्टोर हैं; बॉक्स सिर्फ़ उनके ऊपर बैठा एक नया शेप है। पेज कॉपी करें, इसे सर्च करें, या इसे किसी दूसरे व्यूअर में खोलें, और "रिडैक्ट" किया गया वाक्य दोबारा दिख सकता है। यहां है कि ऐसा क्यों होता है, और एक रिडैक्शन तरीका जो टेक्स्ट को छिपाने की बजाय असल में हटाता है।

ऊपर बना शेप डिलीशन नहीं है

PDF पेज दो चीज़ों को अलग-अलग रखता है: टेक्स्ट ऑब्जेक्ट, हर एक पोज़िशन और फ़ॉन्ट वाला एक कैरेक्टर, और पेज पर रखे ड्रॉइंग ऑब्जेक्ट, जिनमें आपका जोड़ा कोई भी रेक्टेंगल, हाइलाइट या एनोटेशन शामिल है। जब आप किसी PDF व्यूअर में काला बॉक्स बनाते हैं, आप मौजूदा टेक्स्ट ऑब्जेक्ट के ऊपर एक नया ड्रॉइंग ऑब्जेक्ट जोड़ रहे होते हैं। पेज अब रिडैक्ट किया हुआ दिखता है क्योंकि बॉक्स विज़ुअली अक्षरों को ढक देता है। कुछ भी फ़ाइल को नीचे के टेक्स्ट ऑब्जेक्ट हटाने के लिए नहीं कहता, इसलिए वे बिल्कुल वहीं रहते हैं जहां थे, वही पोज़िशन, वही कंटेंट।

दो लेयर में बंटे PDF पेज का डायग्राम: नीचे टेक्स्ट ऑब्जेक्ट और ऊपर रखा एक ड्रॉइंग-ऑब्जेक्ट बॉक्स, अक्षरों को विज़ुअली ढकता हुआ लेकिन डिलीट नहीं करता।

मूल टेक्स्ट दोबारा कैसे सामने आता है

चूंकि टेक्स्ट ऑब्जेक्ट कभी फ़ाइल से गए ही नहीं, चार सामान्य काम उन्हें उजागर कर सकते हैं: "काली की गई" लाइन सिलेक्ट और कॉपी करना, दस्तावेज़ में टेक्स्ट सर्च चलाना, किसी PDF-to-text टूल से रॉ टेक्स्ट निकालना, या फ़ाइल को ऐसे व्यूअर में खोलना जो टेक्स्ट ऑब्जेक्ट को ड्रॉइंग ऑब्जेक्ट के ऊपर अलग क्रम में रेंडर करता हो। इनमें से किसी के लिए भी खास हुनर नहीं चाहिए। यह सार्वजनिक रूप से एक बार से ज़्यादा हो चुका है: संवेदनशील हिस्सों पर काले बॉक्स के साथ जारी की गई PDF में नीचे पढ़ने और कॉपी करने लायक टेक्स्ट मिला, और यह गलती छिपी रहने की बजाय खबर बन गई।

पहले पेज को इमेज में बदलना

इसका फ़िक्स है रिडैक्ट करने से पहले टेक्स्ट लेयर हटाना, बाद में नहीं। pdf-to-image जैसे टूल से PDF पेज को प्लेन इमेज में बदलें, फिर उस इमेज पर संवेदनशील एरिया के ऊपर image-redact से बनाएं। उस पल पेज पर कोई टेक्स्ट ऑब्जेक्ट नहीं बचता, सिर्फ़ पिक्सल, इसलिए बॉक्स किसी रिकवर करने लायक चीज़ के ऊपर नहीं बैठा। image-to-pdf से रिडैक्ट की गई इमेज को दोबारा PDF में जोड़ें और पहले संवेदनशील रहा टेक्स्ट अब बस मौजूद नहीं है, सिर्फ़ एक पेज की तस्वीर है जिसका हिस्सा ढका हुआ है।

वर्कफ़्लो डायग्राम: PDF पेज इमेज में बदला जाता है, पिक्सल पर ओपेक बॉक्स से रिडैक्ट किया जाता है, फिर एक नई PDF में दोबारा जोड़ा जाता है जिसमें नीचे रिकवर करने लायक कोई टेक्स्ट नहीं बचता।

इसमें क्या ट्रेड होता है

किसी पेज को रास्टराइज़ करना असली, सर्चेबल टेक्स्ट को एक स्टैटिक तस्वीर में बदल देता है, इसलिए बाद में रिडैक्ट किया गया पेज पढ़ने वाला कोई भी उस पेज का टेक्स्ट अब सिलेक्ट या सर्च नहीं कर सकता, रिडैक्ट किया हो या नहीं। जिस पेज को आप सुरक्षित कर रहे हैं उसके लिए यह एक स्वीकार्य ट्रेड-ऑफ़ है: विकल्प, टेक्स्ट लेयर बरकरार रखना और उम्मीद करना कि कोई इसे जांचेगा नहीं, वही गलती है जिससे यह लेख शुरू हुआ। अगर उसी दस्तावेज़ के दूसरे पेजों में कोई संवेदनशील कंटेंट नहीं है, तो उन्हें बिना छुए छोड़ा जा सकता है और सिर्फ़ ज़रूरत वाले पेज ही रास्टराइज़ किए जा सकते हैं।

ठोस बॉक्स इस्तेमाल करें, और मेटाडेटा भी जांचें

टेक्स्ट के लिए, पूरी तरह ओपेक काला या सॉलिड-कलर बॉक्स ज़्यादा सुरक्षित चुनाव है। बड़े, प्लेन टेक्स्ट के लिए हल्के gaussian ब्लर को कभी-कभी उलटकर पढ़ा जा सकता है, इसी वजह से यह साइट इसकी जगह पिक्सेलेशन इस्तेमाल करती है: हर ब्लॉक को उसके औसत रंग से बदल दिया जाता है, ताकि मूल पिक्सेल धुंधले नहीं होते, बल्कि पूरी तरह मिट जाते हैं। दिखने वाले पेज को रिडैक्ट करना फ़ाइल के मेटाडेटा को नहीं छूता: लेखक का नाम, सॉफ़्टवेयर वर्ज़न, एम्बेडेड फ़ोटो पर GPS निर्देशांक, या एडिट हिस्ट्री पेज कंटेंट से अलग लीक हो सकते हैं। अगर यह आपके दस्तावेज़ के लिए मायने रखता है, तो शेयर करने से पहले जांचें कि आपकी फ़ाइल का अपना मेटाडेटा क्या उजागर करता है।

इस लेख में उल्लेखित टूल्स

अक्सर पूछे जाने वाले सवाल

क्या PDF व्यूअर में सीधे काला रेक्टेंगल बनाने से नीचे का टेक्स्ट असल में डिलीट हो जाता है?

आमतौर पर नहीं। जब तक टूल में कोई खास रिडैक्शन फ़ीचर न हो जो नीचे के टेक्स्ट ऑब्जेक्ट हटाता हो, कोई शेप बनाना सिर्फ़ पेज के ऊपर एक लेयर जोड़ता है। मूल कैरेक्टर फ़ाइल में बने रहते हैं और आम टूल से सिलेक्ट, सर्च या निकाले जा सकते हैं।

क्या संवेदनशील टेक्स्ट को ब्लर करना बॉक्स से ढकने से ज़्यादा सुरक्षित है?

टेक्स्ट के लिए ठोस, पूरी तरह ओपेक बॉक्स, या पहले रास्टराइज़ करके टेक्स्ट लेयर को पूरी तरह हटाना, सही जवाब है। बड़े, प्लेन कैरेक्टर पर लगाया हल्का gaussian ब्लर कभी-कभी इतना अच्छे से उलटा जा सकता है कि उनका अंदाज़ा लगाया जा सके, यही वजह है कि यहां का रिडैक्शन टूल ब्लर लगाता ही नहीं: इसका ब्लर विकल्प हर ब्लॉक को एक ही औसत रंग से बदल देता है, और औसत को वापस नहीं पलटा जा सकता।

क्या रिडैक्ट करने से पहले PDF को इमेज में कन्वर्ट करने से कुछ ज़रूरी खोता है?

इससे आप कन्वर्ट किए पेजों पर टेक्स्ट सिलेक्ट या सर्च करने की क्षमता खो देते हैं, क्योंकि वे प्लेन तस्वीरें बन जाते हैं। जिस पेज को आप सक्रिय रूप से रिडैक्ट कर रहे हैं, उसके लिए यही तो मकसद है: संवेदनशील टेक्स्ट अब निकाले जा सकने वाले कैरेक्टर के रूप में मौजूद नहीं रहता। जिन पेजों में कोई संवेदनशील कंटेंट नहीं है, वे सामान्य PDF पेज बने रह सकते हैं अगर आप सिर्फ़ ज़रूरत वाले पेज ही रास्टराइज़ करें।