कोई अपलोड नहीं, 100% स्थानीय, कोई खाता नहीं

लेख

ब्राउज़र का PDF टूलकिट: साफ़ करें, लेआउट करें और संरचना दें

ज़्यादातर PDF काम तीन श्रेणियों में आते हैं: किसी दस्तावेज़ को पढ़ने योग्य बनाना, उसके पेजों को सतह पर व्यवस्थित करना, और उससे जुड़े डेटा को संपादित करना। यह साइट लगभग ग्यारह छोटे टूल देती है जो इन श्रेणियों को कवर करते हैं, और इनमें से हर एक आपके ब्राउज़र टैब के भीतर ही फ़ाइल पर काम करता है। PDF को आपके डिवाइस से बाहर निकले बिना खोला, बदला और सहेजा जाता है, इसलिए वही टूल एक वेतन पर्ची और एक गोपनीय अनुबंध दोनों के लिए समान रूप से काम करता है।

स्कैन को साफ़ करें और ठीक करें

स्कैनर या फ़ोन कैमरे से आया कोई पेज अक्सर रखने लायक होने से पहले कुछ सुधार मांगता है। रोटेट टूल उन पेजों को घुमाता है जो बगल में या उल्टे आए थे, 90 डिग्री के चरणों में, और स्कैन किए गए PDF को घुमाने की पुरानी गाइड की जगह लेता है। डीस्क्यू टूल उस टेक्स्ट को सीधा करता है जो हल्के कोण पर बैठा होता है, जो तब मायने रखता है जब आप बाद में टेक्स्ट पहचान चलाने की योजना बनाते हैं। ग्रेस्केल टूल रंग चैनल हटा देता है, जिससे फ़ाइल छोटी होती है और वह हल्की रंगत हट जाती है जो फ़्लैटबेड स्कैनर सफ़ेद कागज़ पर जोड़ देते हैं। रिपेयर टूल अपनी सीमाओं के बारे में ईमानदार है: यह किसी क्षतिग्रस्त PDF के उन हिस्सों को फिर से बनाता है जिन्हें pdf-lib पढ़ और दोबारा सहेज सकता है, इसलिए यह कई ऐसी फ़ाइलें बचा लेता है जिन्हें दूसरे रीडर अस्वीकार कर देते हैं, पर यह वह कंटेंट दोबारा नहीं बना सकता जो फ़ाइल में कभी लिखा ही नहीं गया था। इसे ऐसे दस्तावेज़ पर पहले प्रयास के रूप में इस्तेमाल करें जो नहीं खुलता, किसी गारंटी के रूप में नहीं।

एक तिरछा, धुंधला स्कैन किया गया पेज उसी पेज के बगल में जो डीस्क्यू और ग्रेस्केल सफाई के बाद सीधा और पढ़ने योग्य हो गया है।

पेजों का लेआउट तय करें

जब कोई दस्तावेज़ पढ़ने योग्य हो जाए, तो आपको यह बदलने की ज़रूरत पड़ सकती है कि पेज शीट पर कैसे बैठते हैं। क्रॉप टूल हाशिए छाँटता है या किसी पेज को उस क्षेत्र तक काट देता है जिसकी आपको परवाह है। रीसाइज़ टूल पेज के आयाम बदलता है, उदाहरण के लिए US Letter से A4 में, ताकि कोई दस्तावेज़ दूसरे देश में सही तरीके से प्रिंट हो। एन-अप टूल एक ही शीट पर कई पेज अगल-बगल रखता है, जो हैंडआउट के लिए या कागज़ बचाने के लिए सुविधाजनक है। ऑल्टरनेट-मिक्स टूल दो फ़ाइलों को पेज दर पेज एक साथ पिरोता है, और इसे इस्तेमाल करने की आम वजह सिंगल-साइडेड स्कैनर पर किया गया डुप्लेक्स स्कैन है: आप सामने वाले पन्ने एक फ़ाइल में स्कैन करते हैं, ढेरी पलटते हैं और पीछे वाले पन्ने दूसरी फ़ाइल में स्कैन करते हैं, फिर उन्हें मिलाते हैं ताकि पेज अपने मूल क्रम में वापस आ जाएँ। इनमें से कोई भी टूल आपके टेक्स्ट को रास्टराइज़ नहीं करता, इसलिए डिजिटल रूप से बनी PDF लेआउट बदलने के बाद भी अपना चयन योग्य टेक्स्ट बनाए रखती है।

मेटाडेटा और संरचना

आख़िरी श्रेणी वह डेटा है जो पेजों के चारों ओर लिपटा रहता है। मेटाडेटा टूल शीर्षक, लेखक, विषय और कीवर्ड फ़ील्ड पढ़ता और दोबारा लिखता है, और किसी दस्तावेज़ को साझा करने से पहले उन्हें मिटाने देता है, जो गोपनीयता का एक छोटा पर असली कदम है। बुकमार्क टूल वह क्लिक करने योग्य रूपरेखा बनाता है जो PDF रीडर अपने साइड पैनल में दिखाता है, ताकि एक लंबी रिपोर्ट में आना-जाना आसान हो जाए। HTML-से-PDF टूल उल्टी दिशा में जाता है और चिपकाए गए मार्कअप को PDF में बदल देता है, एक साफ़ चेतावनी के साथ: यह परिणाम को पेज की एक छवि के रूप में प्रस्तुत करता है, इसलिए आउटपुट चयन योग्य टेक्स्ट नहीं होता। जब आपको वाकई किसी PDF से शब्द निकालने हों, तो दो अलग रास्ते मौजूद हैं। अगर फ़ाइल डिजिटल रूप से बनी थी, तो PDF-से-टेक्स्ट टूल उसका एम्बेडेड टेक्स्ट सीधे और सटीक पढ़ लेता है। अगर फ़ाइल एक स्कैन है, तो पढ़ने के लिए कोई टेक्स्ट होता ही नहीं, इसलिए आपको ऑप्टिकल कैरेक्टर रिकग्निशन चाहिए, जो तस्वीर से अक्षरों का अनुमान लगाता है और गलतियाँ कर सकता है। यह जानना कि आप किस स्थिति में हैं, बहुत सारी उलझन बचा लेता है।

PDF internal structure और XREF tables

PDF फाइल कोई linear document नहीं है; यह discrete objects (dictionaries, arrays, streams और numeric values) का एक database है जो फाइल के अंत में एक Cross-Reference (XREF) table से जुड़े होते हैं। XREF table प्रत्येक object ID को उसके exact byte offset से map करती है। कुछ डेस्कटॉप एडिटर बदलावों को incremental update के रूप में सेव करते हैं: फाइल में एक नया XREF section जोड़ा जाता है जो केवल modified objects को override करता है, जबकि मूल bytes नीचे वैसे ही बने रहते हैं। pdf-lib पर बने browser-based tools अलग तरीके से काम करते हैं: वे पूरे दस्तावेज़ को एक in-memory object graph में parse करते हैं, माँगा गया बदलाव लागू करते हैं (जैसे कि page के Rotate entry को 0 से 90 में बदलना), फिर पूरी फाइल को शुरू से एक नई, ताज़ा PDF के रूप में reserialize करते हैं। इस पूरे rewrite का मतलब है कि टूल चलते समय पूरा दस्तावेज़ memory में समाना चाहिए, इसीलिए हर टूल एक अधिकतम input size लागू करता है; यह इसमें से कुछ भी कभी server पर अपलोड नहीं करता।

एक PDF फ़ाइल की संरचना: header, ऑब्जेक्ट्स, वह xref टेबल जो हर ऑब्जेक्ट को बाइट ऑफ़सेट से इंडेक्स करती है, और trailer।

Stream compression और PDF repair कैसे काम करती है

PDF में page content (text drawing commands, vector paths, raster images) Stream objects के अंदर रहती है, जो लगभग हमेशा FlateDecode (zlib) से compress होती हैं। जब PDF corrupt होती है, तो damage आमतौर पर या तो malformed XREF table या truncated compressed stream होती है। एक repair tool damaged XREF table को पूरी तरह bypass करता है और raw byte stream का linear scan करता है, obj और endobj markers खोजता है जो individual objects को bound करते हैं। यह उन objects को extract करता है, उनसे associated streams को decompress करने का प्रयास करता है, और scratch से एक नई, well-formed XREF table बनाता है। यदि corruption एक Flate-compressed stream के अंदर पड़ती है, तो उस specific object का data recoverable नहीं है; document structure restore हो सकती है लेकिन affected pages blank हो सकती हैं या images गायब हो सकती हैं।

इस लेख में उल्लेखित टूल्स

अक्सर पूछे जाने वाले सवाल

क्या ये PDF टूल मेरी फ़ाइल को किसी सर्वर पर अपलोड करते हैं?

नहीं। इनमें से हर टूल JavaScript और WebAssembly का इस्तेमाल करके PDF को आपके ब्राउज़र टैब के भीतर ही खोलता, संपादित और सहेजता है। फ़ाइल आपकी डिस्क से पढ़कर पेज में लाई जाती है और परिणाम सीधे एक डाउनलोड में लिख दिया जाता है, इसलिए नेटवर्क पर कुछ नहीं भेजा जाता। आप इसकी पुष्टि किसी टूल का उपयोग करते समय अपने ब्राउज़र का नेटवर्क पैनल खोलकर कर सकते हैं, या पेज लोड होने के बाद इंटरनेट से कनेक्शन तोड़कर और टूल को फिर भी काम करते देखकर कर सकते हैं।

क्या रिपेयर टूल किसी भी टूटी हुई PDF को ठीक कर सकता है?

हर फ़ाइल को नहीं। रिपेयर टूल दस्तावेज़ को दोबारा पार्स करता है और एक नई, सही-संरचित प्रति लिखता है, जो टूटी क्रॉस-रेफरेंस तालिकाओं और कई संरचनात्मक खराबियों को ठीक कर देता है जो PDF को खुलने से रोकती हैं। यह वह डेटा नहीं गढ़ सकता जो सचमुच गायब है, और न ही मजबूत एन्क्रिप्शन हटा सकता है। इसे एक त्वरित पहले प्रयास की तरह लें: अगर यह आपकी फ़ाइल बचा लेता है तो काम पूरा हुआ, और अगर नहीं, तो आपने कुछ खोया नहीं और मूल फ़ाइल ढूँढ़ सकते हैं।