ट्यूटोरियल
स्कैन की गई PDF को सर्चेबल बनाएं
स्कैन की गई PDF एक सामान्य दस्तावेज़ जैसी दिखती है लेकिन असल में एक पेज की तस्वीर होती है: Ctrl+F कुछ नहीं ढूंढता, और आप एक भी शब्द सिलेक्ट या कॉपी नहीं कर सकते। PDF OCR टूल फ़ाइल की पहचान बदले बिना यह ठीक करता है। यह हर पेज इमेज पढ़ता है, ऑन-डिवाइस OCR इंजन से कैरेक्टर पहचानता है, और पहचाने गए टेक्स्ट को उसी इमेज के ऊपर अदृश्य रूप से रख देता है, इसलिए PDF पहले जैसी ही दिखती और प्रिंट होती है लेकिन अब सर्च और टेक्स्ट सिलेक्शन का जवाब देती है। फ़ाइल आपकी डिवाइस से कभी बाहर नहीं जाती।
चरण दर चरण
- PDF OCR टूल खोलें और अपनी स्कैन की गई PDF ड्रॉप करें। सिर्फ़ PDF फ़ाइलें स्वीकार की जाती हैं, और फ़ाइल 80 MB तक सीमित है; आम मल्टी-पेज स्कैन इससे काफ़ी कम होता है।
- ड्रॉपडाउन से दस्तावेज़ की भाषा चुनें (English, French, German, Spanish, Portuguese या Italian) और चाहें तो आउटपुट फ़ाइल का नाम एडिट करें। डिफ़ॉल्ट .pdf एक्सटेंशन अपने आप बना रहता है।
- Run क्लिक करें और हर पेज प्रोसेस होने का इंतज़ार करें। अगले पेज पर जाने से पहले हर पेज रेंडर होता है, OCR इंजन से गुज़रता है और उसे अपनी अदृश्य टेक्स्ट लेयर मिलती है, इसलिए लंबे दस्तावेज़ में एक अकेले पेज से ज़्यादा समय लगता है। नतीजा डाउनलोड करें: यह मूल के बिल्कुल जैसा खुलता और प्रिंट होता है, लेकिन अब Ctrl+F, टेक्स्ट सिलेक्शन और कॉपी-पेस्ट काम करते हैं।
सर्चेबल PDF या प्लेन टेक्स्ट: आपको असल में किसकी ज़रूरत है
यह टूल और प्लेन OCR टूल एक जैसी अंदरूनी समस्या हल करते हैं, स्कैन की गई इमेज में टेक्स्ट पहचानना, लेकिन दोनों अलग-अलग चीज़ें बनाए रखते हैं। OCR टूल पेज इमेज हटा देता है और आपको एक प्लेन .txt फ़ाइल वापस देता है: जब आप शब्दों को किसी एडिटर में पेस्ट करना, अनुवाद करना या टेक्स्ट के रूप में खोजना चाहें, और दस्तावेज़ की मूल शक्ल बनाए रखने की परवाह न हो, तब इसे इस्तेमाल करें। यहां का PDF OCR टूल मूल PDF को बिल्कुल जैसा है वैसा ही रखता है, पेज इमेज सहित, और सिर्फ़ नीचे एक छिपी टेक्स्ट लेयर जोड़ता है: जब दस्तावेज़ को अब भी PDF बने रहना हो, जिसे आप प्रिंट, ईमेल या आर्काइव कर सकें, लेकिन आप उसमें से सर्च या कॉपी भी करना चाहें, तब इसे इस्तेमाल करें। कोई भी टूल लेआउट को असली फ़ॉन्ट और टेबल के साथ एडिटेबल टेक्स्ट के रूप में दोबारा नहीं बनाता; दोनों एक ही पहचाने गए टेक्स्ट से काम करते हैं, बस अलग-अलग तरीके से पैक करके।
नतीजा स्कैन पर क्यों निर्भर करता है, और सीमाएं कहां हैं
पहचान की सटीकता सोर्स इमेज की क्वालिटी पर चलती है, ठीक वैसे जैसे प्लेन OCR के लिए होती है: लगभग 200 से 300 DPI का साफ़, सीधा स्कैन भरोसेमंद तरीके से पहचाना जाता है, जबकि धुंधली फ़ोटो, तिरछा पेज या भारी शैडो ज़्यादा गलत पढ़े गए शब्द देते हैं। अगर कोई पेज टेढ़ा आया हो, तो OCR चलाने से पहले उसे PDF deskew टूल से सीधा करें ताकि पहचान वाला स्टेप सीधा टेक्स्ट पढ़े। टूल छह भाषाएं कवर करता है (English, French, German, Spanish, Portuguese, Italian); किसी असमर्थित भाषा में दस्तावेज़ सही से नहीं पहचाना जाएगा। प्रोसेसिंग आपके ब्राउज़र टैब में पेज दर पेज चलती है, इसलिए दर्जनों पेजों वाले दस्तावेज़ में दो पेज के स्कैन से साफ़ ज़्यादा समय लगता है, और फ़ाइल 80 MB तक सीमित है। आउटपुट PDF का साइज़ भी मूल जैसा ही रहता है, क्योंकि पेज इमेज को खुद नहीं छुआ जाता; बाद में छोटी फ़ाइल चाहिए तो इसे PDF compressor से चलाएं।
अदृश्य टेक्स्ट लेयर कैसे बनती है
हर PDF पेज पहले आपके ब्राउज़र में एक कैनवस इमेज में रास्टराइज़ होता है, वही रेंडरिंग स्टेप जो PDF-to-image टूल इस्तेमाल करता है। OCR इंजन (Tesseract, WebAssembly में कम्पाइल किया गया) उस इमेज को पढ़ता है और हर पहचाने गए शब्द को उसके बाउंडिंग बॉक्स, पेज पर उसकी पोज़िशन के साथ लौटाता है। फिर वे शब्द मूल PDF पेज की एक कॉपी पर उनकी पहचानी गई पोज़िशन पर, लेकिन शून्य ओपैसिटी पर, दोबारा खींचे जाते हैं, ताकि विज़ुअली कुछ न बदले: आप जो पेज इमेज देखते और प्रिंट करते हैं वह वही है जो स्कैन हुई थी, ऊपर बैठी हुई। PDF व्यूअर की सर्च और टेक्स्ट-सिलेक्शन सुविधाएं सिर्फ़ उस अदृश्य टेक्स्ट लेयर को देखती हैं, इसीलिए फ़ाइल बिना अलग दिखे सर्चेबल और सिलेक्ट करने लायक बन जाती है। यह सब, रेंडरिंग, पहचान और दोबारा असेंबली, आपके ब्राउज़र टैब के अंदर होता है; PDF लोकल डिस्क से पढ़ी जाती है और कभी कहीं ट्रांसमिट नहीं होती।
इस गाइड में इस्तेमाल किए गए टूल
- PDF OCR · सर्चेबल बनाएंस्कैन की गई PDF को पूरी तरह ब्राउज़र में सर्चेबल, सिलेक्ट करने योग्य PDF बनाएं, कोई अपलोड नहीं।
- OCR · छवि/PDF से टेक्स्टस्कैन की गई छवियों या PDF से पूरी तरह अपने ब्राउज़र में टेक्स्ट निकालें, ऑफ़लाइन चलता है, कोई अपलोड नहीं।
- स्कैन किए पृष्ठों को सीधा करेंतिरछी स्कैन PDF या छवियों को पूरी तरह अपने ब्राउज़र में सीधा करें, कोई अपलोड नहीं।
- PDF कम्प्रेस करेंPDF की आंतरिक संरचना को बिना डेटा हानि के अनुकूलित कर फ़ाइल का आकार घटाएं, बिना अपलोड किए।
अक्सर पूछे जाने वाले सवाल
क्या सर्चेबल PDF अब भी मूल स्कैन जैसी बिल्कुल दिखेगी और प्रिंट होगी?
हां। टूल कभी पेज इमेज में बदलाव नहीं करता; यह सिर्फ़ नीचे एक अदृश्य टेक्स्ट लेयर जोड़ता है। स्क्रीन पर और कागज़ पर, आउटपुट आपके ड्रॉप किए स्कैन जैसा ही विज़ुअली दिखता है। जो बदलता है वह यह है कि व्यूअर के सर्च और टेक्स्ट-सिलेक्शन टूल अब पहचाने गए शब्द ढूंढ और पकड़ सकते हैं, क्योंकि वे उस छिपी लेयर से पढ़ते हैं।
प्लेन OCR टूल के साथ-साथ यह टूल क्यों मौजूद है?
वे एक ही पहचान वाले स्टेप से अलग-अलग ज़रूरतों का जवाब देते हैं। OCR टूल आपको एक प्लेन टेक्स्ट फ़ाइल देता है, जो तब चाहिए जब आप शब्दों को पेस्ट, एडिट या अनुवाद करना चाहते हों और दस्तावेज़ को PDF रखने की परवाह न करते हों। यह टूल फ़ाइल को मूल पेज इमेज सहित PDF ही रखता है, जो तब चाहिए जब दस्तावेज़ को अब भी वैसा ही प्रिंट, आर्काइव या ईमेल करना हो, लेकिन आप उसमें से सर्च या कॉपी भी करना चाहते हों।