कोई अपलोड नहीं, 100% स्थानीय, कोई खाता नहीं

PDF → टेक्स्ट निष्कर्षण

अपने PDF से सभी पठनीय टेक्स्ट निकालें। .txt फ़ाइल के रूप में डाउनलोड करें। सब कुछ आपके ब्राउज़र में रहता है, कोई फ़ाइल सर्वर को नहीं भेजी जाती।

PDF से टेक्स्ट कैसे काम करता है

PDF to Text किसी PDF से मौजूदा टेक्स्ट लेयर निकालता है और उसे एक सादे .txt फ़ाइल के रूप में सहेजता है। निष्कर्षण आपके ब्राउज़र में pdf.js द्वारा किया जाता है, जो PDF के पेज-स्ट्रीम में एम्बेडेड टेक्स्ट कंटेंट ऑब्जेक्ट पढ़ता है। दस्तावेज़ कभी आपके डिवाइस को नहीं छोड़ता; परिणाम लोकल रूप से असेंबल होता है और सीधे डाउनलोड के रूप में दिया जाता है।

यह टूल एक ऐसी टेक्स्ट लेयर पढ़ता है जो फ़ाइल में पहले से मौजूद है। यदि आपकी PDF किसी वर्ड प्रोसेसर या एक्सपोर्ट टूल द्वारा बनाई गई है, तो इसमें लगभग निश्चित रूप से एक टेक्स्ट लेयर है और निष्कर्षण अच्छी तरह काम करेगा। यदि PDF किसी कागज़ी दस्तावेज़ की स्कैन है, तो पृष्ठों में केवल इमेज डेटा है और निकालने के लिए कोई टेक्स्ट लेयर नहीं है; उस स्थिति में यह टूल खाली या अधूरा आउटपुट देगा। स्कैन की गई PDF को टेक्स्ट बनाने के लिए OCR की आवश्यकता होती है, जो इस टूल द्वारा नहीं की जाती। इस टूल का उपयोग करने से पहले जांचें कि व्यूअर में आपकी PDF में चयनयोग्य टेक्स्ट है।

PDF से टेक्स्ट: चरण दर चरण उपयोग विधि

  1. अपनी PDF को टेक्स्ट एक्सट्रैक्शन टूल में लोड करें।
  2. pdf.js के सभी पृष्ठों से टेक्स्ट लेयर पढ़ने की प्रतीक्षा करें।
  3. निकाले गए टेक्स्ट का प्रिव्यू देखें।
  4. .txt फ़ाइल सहेजने के लिए Download पर क्लिक करें।

सामान्य उपयोग के मामले

  • रिसर्च पेपर PDF से टेक्स्ट निकालना और नोट-टेकिंग एप्लिकेशन में पेस्ट करना या सारांश करने के लिए उपयोग करना।
  • PDF इनवॉइस से कंटेंट को मैन्युअल री-टाइपिंग के बिना बुककीपिंग के लिए स्प्रेडशीट में लाना।
  • दूषित या लॉक-लेआउट PDF से टेक्स्ट रिकवर करना जहां व्यूअर में कॉपी-पेस्ट टूटा हुआ है।
  • PDF आर्टिकल को किसी स्क्रिप्ट या कमांड-लाइन टूल से प्रोसेसिंग के लिए सादे टेक्स्ट में बदलना।

अक्सर पूछे जाने वाले प्रश्न

कुछ PDF के लिए निकाला गया टेक्स्ट खाली या अस्पष्ट क्यों आता है?

सबसे सामान्य कारण यह है कि PDF एक स्कैन है: पृष्ठ इमेज हैं और कोई टेक्स्ट लेयर नहीं है। अन्य कारणों में ऐसी PDF शामिल हैं जहां टेक्स्ट आउटलाइन या कस्टम फ़ॉन्ट एन्कोडिंग के रूप में संग्रहीत है जिसे pdf.js पठनीय अक्षरों में मैप नहीं कर सकता। स्कैन दस्तावेज़ों के लिए टेक्स्ट बनाने के लिए OCR की आवश्यकता है।

क्या यह टूल स्कैन की गई PDF पर OCR करता है?

नहीं। यह टूल PDF से मौजूदा टेक्स्ट लेयर पढ़ता है। यह ऑप्टिकल कैरेक्टर रेकग्निशन नहीं करता। स्कैन की गई PDF के लिए, OCR टूल का उपयोग करें, जो आपके ब्राउज़र में एक लोकल OCR इंजन के माध्यम से पेज इमेज को प्रोसेस करता है।

क्या टेक्स्ट निष्कर्षण सर्वर पर होता है या मेरे ब्राउज़र में?

आपके ब्राउज़र में। pdf.js PDF संरचना को लोकल रूप से पढ़ता है, प्रत्येक पेज-स्ट्रीम से टेक्स्ट कंटेंट ऑब्जेक्ट पार्स करता है, और ब्राउज़र मेमोरी में आउटपुट असेंबल करता है। इस प्रक्रिया में PDF डेटा किसी भी बिंदु पर आपके डिवाइस को नहीं छोड़ता।

क्या टेक्स्ट आउटपुट में फॉर्मेटिंग और लेआउट संरक्षित होगा?

नहीं। सादे टेक्स्ट में फ़ॉन्ट, साइज़, रंग या स्थिति जानकारी नहीं होती। आउटपुट pdf.js द्वारा निर्धारित पढ़ने के क्रम में असंरचित टेक्स्ट है। टेबल, बहु-कॉलम लेआउट और विशेष फॉर्मेटिंग समतल हो जाती है। समृद्ध लेआउट संरक्षण के लिए, PDF to HTML कन्वर्टर बेहतर उपयुक्त हैं।

क्या मैं पासवर्ड-सुरक्षित PDF से टेक्स्ट निकाल सकता हूं?

यदि PDF में ओपन-यूज़र पासवर्ड है, तो आपको PDF पढ़ने के लिए वह प्रदान करना होगा। ओनर-लेवल एक्सट्रैक्शन प्रतिबंध भी ऑपरेशन ब्लॉक कर सकते हैं। पहले PDF Unlock टूल का उपयोग करके वे प्रतिबंध हटाएं, फिर निष्कर्षण का पुनः प्रयास करें।

क्या PDF से टेक्स्ट निकालने के लिए कोई अकाउंट बनाना पड़ता है?

नहीं। कोई साइन-अप नहीं और कोई अकाउंट नहीं। फ़ाइल छोड़ें, निकाला गया प्रीव्यू पढ़ें, और .txt फ़ाइल डाउनलोड करें।

क्या PDF to Text मोबाइल ब्राउज़र पर काम करता है?

हां। pdf.js फ़ोन ब्राउज़र पर उसी तरह चलता है जैसे डेस्कटॉप पर। निष्कर्षण पूरा होते ही मोबाइल पेज से सीधे निकाला गया टेक्स्ट कॉपी या डाउनलोड करें।