PDF OCR · सर्चेबल बनाएं कैसे काम करता है
PDF OCR किसी स्कैन की गई PDF को, जो सिर्फ़ पेज इमेज से बनी होती है और जिसमें असली टेक्स्ट नहीं होता, एक सर्च करने योग्य PDF में बदल देता है: वही पेज इमेज, साथ में हर पहचाने गए शब्द के ऊपर रखी गई एक अदृश्य टेक्स्ट लेयर। रिज़ल्ट को किसी भी PDF रीडर में खोलें और अब आप किसी शब्द को खोजने के लिए Ctrl+F इस्तेमाल कर सकते हैं, किसी पैराग्राफ़ को सेलेक्ट और कॉपी कर सकते हैं, या सर्च इंजन को डॉक्यूमेंट इंडेक्स करने दे सकते हैं। ये सभी काम एक सादे स्कैन से संभव नहीं हैं। पहचान (recognition) खुद tesseract.js से चलती है (वही सेल्फ़-होस्टेड OCR इंजन जो OCR टूल इस्तेमाल करता है), और पेज रेंडरिंग pdf.js से होती है; दोनों पूरी तरह आपके ब्राउज़र टैब के अंदर चलते हैं, और आपकी फ़ाइल कभी अपलोड नहीं होती।
यह टूल इस बारे में ईमानदार है कि यह क्या करता है और क्या नहीं। यह लेआउट, टेबल या फ़ॉन्ट को दोबारा नहीं बनाता, और यह किसी एडिटेबल-डॉक्यूमेंट कन्वर्टर की तरह काम नहीं करता: दिखने वाला पेज एक तस्वीर ही रहता है, बिल्कुल सोर्स स्कैन जैसा, बस उसके नीचे एक छिपी हुई टेक्स्ट लेयर जोड़ दी जाती है। पहचान की सटीकता स्कैन की क्वालिटी पर निर्भर करती है, वही 200 DPI या उससे बेहतर, अच्छे कॉन्ट्रास्ट और सीधे पेज वाली सलाह जो किसी भी OCR इंजन पर लागू होती है। अगर आपको सिर्फ़ निकाला गया सादा टेक्स्ट चाहिए, न कि सर्च करने योग्य PDF, तो OCR टूल इसके बजाय एक .txt फ़ाइल बनाता है और इस खास काम के लिए तेज़ है।