PDF से टेक्स्ट कैसे काम करता है
PDF to Text किसी PDF से मौजूदा टेक्स्ट लेयर निकालता है और उसे एक सादे .txt फ़ाइल के रूप में सहेजता है। निष्कर्षण आपके ब्राउज़र में pdf.js द्वारा किया जाता है, जो PDF के पेज-स्ट्रीम में एम्बेडेड टेक्स्ट कंटेंट ऑब्जेक्ट पढ़ता है। दस्तावेज़ कभी आपके डिवाइस को नहीं छोड़ता; परिणाम लोकल रूप से असेंबल होता है और सीधे डाउनलोड के रूप में दिया जाता है।
यह टूल एक ऐसी टेक्स्ट लेयर पढ़ता है जो फ़ाइल में पहले से मौजूद है। यदि आपकी PDF किसी वर्ड प्रोसेसर या एक्सपोर्ट टूल द्वारा बनाई गई है, तो इसमें लगभग निश्चित रूप से एक टेक्स्ट लेयर है और निष्कर्षण अच्छी तरह काम करेगा। यदि PDF किसी कागज़ी दस्तावेज़ की स्कैन है, तो पृष्ठों में केवल इमेज डेटा है और निकालने के लिए कोई टेक्स्ट लेयर नहीं है; उस स्थिति में यह टूल खाली या अधूरा आउटपुट देगा। स्कैन की गई PDF को टेक्स्ट बनाने के लिए OCR की आवश्यकता होती है, जो इस टूल द्वारा नहीं की जाती। इस टूल का उपयोग करने से पहले जांचें कि व्यूअर में आपकी PDF में चयनयोग्य टेक्स्ट है।