कोई अपलोड नहीं, 100% स्थानीय, कोई खाता नहीं

स्कैन की गई PDF को सर्चेबल बनाएं

स्कैन की गई PDF ड्रॉप करें और वही पेज वापस पाएं, ऊपर एक अदृश्य, सर्चेबल टेक्स्ट लेयर जुड़ी हुई। पहचान (recognition) पूरी तरह आपके ब्राउज़र में चलती है (ऑन-डिवाइस, पहली लोडिंग के बाद ऑफ़लाइन), कुछ भी अपलोड नहीं होता।

PDF OCR · सर्चेबल बनाएं कैसे काम करता है

PDF OCR किसी स्कैन की गई PDF को, जो सिर्फ़ पेज इमेज से बनी होती है और जिसमें असली टेक्स्ट नहीं होता, एक सर्च करने योग्य PDF में बदल देता है: वही पेज इमेज, साथ में हर पहचाने गए शब्द के ऊपर रखी गई एक अदृश्य टेक्स्ट लेयर। रिज़ल्ट को किसी भी PDF रीडर में खोलें और अब आप किसी शब्द को खोजने के लिए Ctrl+F इस्तेमाल कर सकते हैं, किसी पैराग्राफ़ को सेलेक्ट और कॉपी कर सकते हैं, या सर्च इंजन को डॉक्यूमेंट इंडेक्स करने दे सकते हैं। ये सभी काम एक सादे स्कैन से संभव नहीं हैं। पहचान (recognition) खुद tesseract.js से चलती है (वही सेल्फ़-होस्टेड OCR इंजन जो OCR टूल इस्तेमाल करता है), और पेज रेंडरिंग pdf.js से होती है; दोनों पूरी तरह आपके ब्राउज़र टैब के अंदर चलते हैं, और आपकी फ़ाइल कभी अपलोड नहीं होती।

यह टूल इस बारे में ईमानदार है कि यह क्या करता है और क्या नहीं। यह लेआउट, टेबल या फ़ॉन्ट को दोबारा नहीं बनाता, और यह किसी एडिटेबल-डॉक्यूमेंट कन्वर्टर की तरह काम नहीं करता: दिखने वाला पेज एक तस्वीर ही रहता है, बिल्कुल सोर्स स्कैन जैसा, बस उसके नीचे एक छिपी हुई टेक्स्ट लेयर जोड़ दी जाती है। पहचान की सटीकता स्कैन की क्वालिटी पर निर्भर करती है, वही 200 DPI या उससे बेहतर, अच्छे कॉन्ट्रास्ट और सीधे पेज वाली सलाह जो किसी भी OCR इंजन पर लागू होती है। अगर आपको सिर्फ़ निकाला गया सादा टेक्स्ट चाहिए, न कि सर्च करने योग्य PDF, तो OCR टूल इसके बजाय एक .txt फ़ाइल बनाता है और इस खास काम के लिए तेज़ है।

PDF OCR · सर्चेबल बनाएं: चरण दर चरण उपयोग विधि

  1. अपनी स्कैन की गई PDF (हर पेज पर एक इमेज, बिना मौजूदा टेक्स्ट लेयर के) अपलोड क्षेत्र में ड्रॉप करें।
  2. लैंग्वेज ड्रॉपडाउन से डॉक्यूमेंट की मुख्य भाषा चुनें।
  3. अगर आप पहली बार यह टूल इस्तेमाल कर रहे हैं, तो tesseract.js इंजन के डाउनलोड होने का इंतज़ार करें (यह केवल एक बार होता है)।
  4. रन पर क्लिक करें और इंतज़ार करें जब तक हर पेज बारी-बारी से रेंडर और पहचाना जाता है।
  5. सर्च करने योग्य PDF डाउनलोड करें: दिखने में वही, पर अब नीचे एक टेक्स्ट लेयर के साथ।

सामान्य उपयोग के मामले

  • किसी स्कैन किए गए कॉन्ट्रैक्ट को सर्च करने योग्य बनाना ताकि किसी खास क्लॉज़ को हर पेज पढ़ने के बजाय Ctrl+F से ढूँढा जा सके।
  • स्कैन किए गए इनवॉइस के एक बैच को डॉक्यूमेंट आर्काइव में डालना, जहाँ सर्च इंडेक्स केवल असली PDF टेक्स्ट पढ़ता है।
  • किसी फ़ोटो खींचे या स्कैन किए गए फॉर्म के छपे हुए लेबल को सेलेक्ट करने लायक बनाना ताकि किसी पैराग्राफ़ को ईमेल में कॉपी किया जा सके।
  • जर्मन भाषा में स्कैन की गई रिपोर्ट्स की लाइब्रेरी को फ़ुल-टेक्स्ट सर्च योग्य बनाना; टूल चलाने से पहले भाषा के रूप में जर्मन चुनें।

अक्सर पूछे जाने वाले प्रश्न

यह सादे OCR टूल से कैसे अलग है?

OCR टूल सादा टेक्स्ट निकालकर एक .txt फ़ाइल बनाता है, और मूल लेआउट व इमेज पूरी तरह छोड़ देता है। PDF OCR मूल PDF पेज इमेज को बिल्कुल वैसा ही रखता है जैसा वह दिखता है और उसके नीचे एक अदृश्य, सर्च करने योग्य टेक्स्ट लेयर जोड़ देता है। जब आपको सिर्फ़ शब्द चाहिए हों तो OCR इस्तेमाल करें; जब आप डॉक्यूमेंट को PDF ही रखना चाहते हों पर उसे सर्च करने योग्य और सेलेक्ट करने योग्य बनाना चाहते हों, तो PDF OCR इस्तेमाल करें।

क्या आउटपुट PDF मेरे स्कैन से अलग दिखेगी?

नहीं। हर पेज को आपकी सोर्स PDF से रेंडर करके एक इमेज के रूप में दोबारा एम्बेड किया जाता है, जो मूल स्कैन जितना ही पिक्सेल-समान होता है (JPEG री-एनकोडिंग की गुंजाइश छोड़कर)। पहचाने गए शब्द ऊपर शून्य ओपैसिटी पर बनाए जाते हैं, इसलिए कुछ भी नया दिखाई नहीं देता; टेक्स्ट सर्च या टेक्स्ट सेलेक्शन ही इस जोड़ी गई लेयर को नोटिस करने का एकमात्र तरीका है।

क्या यह टूल टेबल, कॉलम या फ़ॉन्ट को दोबारा बनाता है?

नहीं। आउटपुट पेज को एक सिंगल फ्लैट इमेज के रूप में रखता है; अदृश्य टेक्स्ट लेयर पहचाने गए शब्दों की पोज़िशन को फॉलो करती है, पर टेबल की संरचना, tesseract.js जितना अनुमान लगाता है उससे आगे मल्टी-कॉलम पढ़ने का क्रम, या मूल फ़ॉन्ट को सुरक्षित नहीं रखती। यह एक सर्चेबिलिटी लेयर है, एडिटेबल टेक्स्ट में डॉक्यूमेंट कन्वर्जन नहीं।

क्या प्रोसेसिंग के दौरान मेरे स्कैन किए गए डॉक्यूमेंट कहीं भेजे जाते हैं?

नहीं। इस साइट से tesseract.js इंजन और लैंग्वेज पैक डाउनलोड होने के बाद (पहली बार इस्तेमाल पर कुछ मेगाबाइट का वन-टाइम फ़ेच), हर पेज रेंडर और हर पहचान पास पूरी तरह आपके ब्राउज़र टैब के अंदर होता है। स्कैन किए गए कॉन्ट्रैक्ट, मेडिकल रिकॉर्ड या दूसरे संवेदनशील डॉक्यूमेंट कभी सर्वर तक नहीं पहुँचते।

लंबी PDF को प्रोसेस होने में समय क्यों लगता है?

हर पेज को एक इमेज में रेंडर किया जाता है और उस इमेज पर अलग से OCR चलाया जाता है, यह सब आपके ब्राउज़र टैब के अंदर होता है, इसलिए प्रोसेसिंग टाइम पेज की संख्या के हिसाब से बढ़ता है। प्रोग्रेस बार असली पेज-दर-पेज प्रगति दिखाता है, और पूरी पाइपलाइन को ब्राउज़र टैब के मेमोरी बजट के भीतर रखने के लिए फ़ाइलों की सीमा 80 MB रखी गई है।

अगर मेरी PDF में पहले से ही सेलेक्ट करने योग्य टेक्स्ट है तो क्या होगा?

जिस PDF में पहले से असली टेक्स्ट लेयर मौजूद है, उस पर OCR चलाना ज़रूरी नहीं है: उसे रीडर में खोलकर Ctrl+F दबाना पहले से ही काम करता है। यह टूल उन PDF के लिए है जो पेज इमेज से बनी होती हैं और जिनमें कोई अंडरलाइंग टेक्स्ट नहीं होता। यह आमतौर पर किसी फ़्लैटबेड स्कैनर या किसी फ़ोटो खींचे गए डॉक्यूमेंट के "प्रिंट टू PDF" का नतीजा होता है।