Πώς λειτουργεί το OCR · εικόνα/PDF σε κείμενο
Το OCR μετατρέπει σαρωμένη εικόνα ή PDF βασισμένο σε εικόνα σε κείμενο που μπορείτε να αντιγράψετε, να αναζητήσετε και να επεξεργαστείτε, χρησιμοποιώντας το tesseract.js που εκτελείται εξ ολοκλήρου μέσα στο πρόγραμμα περιήγησής σας. Επιλέγετε τη γλώσσα εγγράφου από τον επιλογέα, το αντίστοιχο γλωσσικό μοντέλο κατεβαίνει στο πρόγραμμα περιήγησής σας μία φορά, και όλες οι μεταγενέστερες αναγνωρίσεις εκτελούνται εκτός σύνδεσης από αυτό το μοντέλο στην κρυφή μνήμη. Τα σαρωμένα αρχεία σας δεν μεταδίδονται ποτέ σε κανέναν διακομιστή κατά τη μετατροπή.
Η ακρίβεια αναγνώρισης εξαρτάται σε μεγάλο βαθμό από την ποιότητα σάρωσης. Καθαρές σαρώσεις υψηλής αντίθεσης στα 200 DPI ή παραπάνω, με ελάχιστο θόρυβο φόντου και ευθεία ευθυγράμμιση σελίδας, παράγουν τα καλύτερα αποτελέσματα. Θολές, χαμηλής ανάλυσης ή έντονα συμπιεσμένες JPEG σαρώσεις, σελίδες με στήλες ή σύνθετες διατάξεις, και χειρόγραφο κείμενο μειώνουν την ακρίβεια. Το εργαλείο εξάγει ένα απλό μπλοκ κειμένου· για δομημένη έξοδο όπως διατηρημένοι πίνακες ή διάταξη πολλαπλών στηλών, χρειάζεται μεταεπεξεργασία. Η εκτέλεση του εργαλείου PDF Deskew σε κεκλιμένες σαρώσεις πριν το OCR βελτιώνει συνήθως τα ποσοστά αναγνώρισης.