OCR · छवि/PDF से टेक्स्ट कैसे काम करता है
OCR एक स्कैन की गई इमेज या इमेज-आधारित PDF को ऐसे टेक्स्ट में बदलता है जिसे आप कॉपी, खोज और संपादित कर सकते हैं, tesseract.js का उपयोग करते हुए जो पूरी तरह आपके ब्राउज़र में चलता है। आप सेलेक्टर से दस्तावेज़ भाषा चुनते हैं, संबंधित भाषा मॉडल एक बार आपके ब्राउज़र में डाउनलोड होता है, और उसके बाद उस cached मॉडल से सभी recognition ऑफलाइन चलती है। आपकी स्कैन की गई फ़ाइलें रूपांतरण के दौरान कभी किसी सर्वर को नहीं भेजी जातीं।
Recognition सटीकता स्कैन क्वालिटी पर दृढ़ता से निर्भर करती है। 200 DPI या उससे अधिक पर साफ, उच्च-कंट्रास्ट स्कैन, न्यूनतम बैकग्राउंड शोर और सीधे पेज संरेखण के साथ, सर्वोत्तम परिणाम देते हैं। धुंधले, कम-रेज़ोल्यूशन या भारी रूप से compressed JPEG, कॉलम या जटिल लेआउट वाले पृष्ठ, और हस्तलिखित टेक्स्ट सभी सटीकता कम करते हैं। टूल एक plain text ब्लॉक आउटपुट करता है; संरक्षित टेबल या बहु-कॉलम लेआउट जैसे स्ट्रक्चर्ड आउटपुट के लिए post-processing की आवश्यकता है। OCR से पहले टेढ़े स्कैन पर PDF Deskew टूल चलाने से recognition दर सुधरती है।