Πώς λειτουργεί το PDF OCR · κάντε το αναζητήσιμο
Το PDF OCR μετατρέπει ένα σαρωμένο PDF, φτιαγμένο από εικόνες σελίδων χωρίς πραγματικό κείμενο, σε ένα αναζητήσιμο PDF: τις ίδιες εικόνες σελίδων, συν ένα αόρατο επίπεδο κειμένου τοποθετημένο πάνω από κάθε αναγνωρισμένη λέξη. Ανοίξτε το αποτέλεσμα σε οποιονδήποτε αναγνώστη PDF και μπορείτε πλέον να χρησιμοποιήσετε το Ctrl+F για να βρείτε μια λέξη, να επιλέξετε και να αντιγράψετε μια παράγραφο, ή να αφήσετε μια μηχανή αναζήτησης να ευρετηριάσει το έγγραφο, πράγματα που μια απλή σάρωση δεν μπορεί να κάνει. Η ίδια η αναγνώριση εκτελείται με το tesseract.js (τον ίδιο αυτοφιλοξενούμενο μηχανισμό OCR που χρησιμοποιεί το εργαλείο OCR), και η απόδοση σελίδων εκτελείται με το pdf.js· και τα δύο εκτελούνται εξ ολοκλήρου μέσα στην καρτέλα του browser σας, και το αρχείο σας δεν ανεβαίνει ποτέ.
Αυτό το εργαλείο είναι ειλικρινές σχετικά με το τι κάνει και τι δεν κάνει. Δεν ανασυνθέτει διάταξη, πίνακες ή γραμματοσειρές, και δεν είναι ένας μετατροπέας σε επεξεργάσιμο έγγραφο: η ορατή σελίδα παραμένει εικόνα, πανομοιότυπη με την πηγαία σάρωση, με ένα κρυφό επίπεδο κειμένου προστιθέμενο κάτω από την εμφάνιση. Η ακρίβεια αναγνώρισης εξαρτάται από την ποιότητα της σάρωσης, τις ίδιες οδηγίες 200 DPI ή καλύτερα, υψηλής αντίθεσης, ίσιας σελίδας που ισχύουν για κάθε μηχανισμό OCR. Αν χρειάζεστε μόνο το απλό εξαγόμενο κείμενο αντί για ένα PDF στο οποίο μπορείτε να κάνετε αναζήτηση, το εργαλείο OCR παράγει αντ' αυτού ένα αρχείο .txt και είναι πιο γρήγορο για αυτή τη συγκεκριμένη εργασία.