Χωρίς μεταφόρτωση, 100% τοπικά, χωρίς λογαριασμό

OCR, εξαγωγή κειμένου από εικόνες & PDF

Αφήστε μια εικόνα ή PDF και λάβετε το αναγνωρισμένο κείμενο. Το OCR εκτελείται εξ ολοκλήρου στο πρόγραμμα περιήγησής σας (στη συσκευή, εκτός σύνδεσης μετά την πρώτη φόρτωση), τίποτα δεν μεταφορτώνεται.

Πώς λειτουργεί το OCR · εικόνα/PDF σε κείμενο

Το OCR μετατρέπει σαρωμένη εικόνα ή PDF βασισμένο σε εικόνα σε κείμενο που μπορείτε να αντιγράψετε, να αναζητήσετε και να επεξεργαστείτε, χρησιμοποιώντας το tesseract.js που εκτελείται εξ ολοκλήρου μέσα στο πρόγραμμα περιήγησής σας. Επιλέγετε τη γλώσσα εγγράφου από τον επιλογέα, το αντίστοιχο γλωσσικό μοντέλο κατεβαίνει στο πρόγραμμα περιήγησής σας μία φορά, και όλες οι μεταγενέστερες αναγνωρίσεις εκτελούνται εκτός σύνδεσης από αυτό το μοντέλο στην κρυφή μνήμη. Τα σαρωμένα αρχεία σας δεν μεταδίδονται ποτέ σε κανέναν διακομιστή κατά τη μετατροπή.

Η ακρίβεια αναγνώρισης εξαρτάται σε μεγάλο βαθμό από την ποιότητα σάρωσης. Καθαρές σαρώσεις υψηλής αντίθεσης στα 200 DPI ή παραπάνω, με ελάχιστο θόρυβο φόντου και ευθεία ευθυγράμμιση σελίδας, παράγουν τα καλύτερα αποτελέσματα. Θολές, χαμηλής ανάλυσης ή έντονα συμπιεσμένες JPEG σαρώσεις, σελίδες με στήλες ή σύνθετες διατάξεις, και χειρόγραφο κείμενο μειώνουν την ακρίβεια. Το εργαλείο εξάγει ένα απλό μπλοκ κειμένου· για δομημένη έξοδο όπως διατηρημένοι πίνακες ή διάταξη πολλαπλών στηλών, χρειάζεται μεταεπεξεργασία. Η εκτέλεση του εργαλείου PDF Deskew σε κεκλιμένες σαρώσεις πριν το OCR βελτιώνει συνήθως τα ποσοστά αναγνώρισης.

OCR · εικόνα/PDF σε κείμενο: οδηγός βήμα προς βήμα

  1. Σύρετε τη σαρωμένη εικόνα (PNG, JPG, TIFF) ή PDF βασισμένο σε εικόνα στην περιοχή αποστολής.
  2. Επιλέξτε την κύρια γλώσσα του εγγράφου από το αναπτυσσόμενο μενού γλώσσας.
  3. Αν είναι η πρώτη φορά που χρησιμοποιείτε αυτή τη γλώσσα, περιμένετε το γλωσσικό μοντέλο να κατεβεί (αυτό γίνεται μία φορά).
  4. Κάντε κλικ στο extract text και περιμένετε το tesseract.js να επεξεργαστεί κάθε σελίδα.
  5. Αντιγράψτε το αναγνωρισμένο κείμενο ή κατεβάστε το ως απλό αρχείο κειμένου.

Συνήθεις περιπτώσεις χρήσης

  • Σαρωμένη απόδειξη χρειάζεται εξαγωγή των στοιχείων της σε υπολογιστικό φύλλο· εκτελέστε OCR για να λάβετε το κείμενο, και στη συνέχεια επικολλήστε στο λογισμικό λογιστικής σας.
  • Αρχείο σαρωμένων επιστημονικών άρθρων χρειάζεται να γίνει αναζητήσιμο σε κείμενο· μετατρέψτε κάθε ένα σε κείμενο με OCR για ευρετηρίαση.
  • Φωτογραφημένος πίνακας από συνάντηση περιέχει σημειώσεις που πρέπει να μετατραπούν σε επεξεργάσιμο έγγραφο.
  • Ιστορικό σαρωμένο έγγραφο στα γερμανικά χρειάζεται εξαγωγή κειμένου για μετάφραση· επιλέξτε γερμανικά ως γλώσσα πριν εκτελέσετε OCR.

Συχνές ερωτήσεις

Γιατί χρειάζεται να κατεβάσω γλωσσικό μοντέλο πριν το OCR λειτουργήσει;

Το tesseract.js χρησιμοποιεί εκπαιδευμένα αρχεία δεδομένων νευρωνικού δικτύου ειδικά για κάθε γλώσσα. Αυτά τα αρχεία είναι αρκετά megabyte το καθένα και κατεβαίνουν μία φορά από αυτόν εδώ τον ιστότοπο (τα φιλοξενούμε εμείς οι ίδιοι, όχι κάποιο CDN τρίτου μέρους) την πρώτη φορά που επιλέγετε αυτή τη γλώσσα. Μετά την αρχική λήψη το μοντέλο αποθηκεύεται στην κρυφή μνήμη του προγράμματος περιήγησής σας, και όλες οι μεταγενέστερες αναγνωρίσεις για αυτή τη γλώσσα εκτελούνται πλήρως εκτός σύνδεσης.

Ποιοι παράγοντες επηρεάζουν περισσότερο την ακρίβεια OCR;

Ανάλυση σάρωσης (ελάχιστο 200 DPI, συνιστάται 300 DPI), ευκρίνεια εικόνας, αντίθεση μεταξύ κειμένου και φόντου, και αν η σελίδα είναι ευθεία επηρεάζουν έντονα την ακρίβεια. Έντονα συμπιεσμένες JPEG σαρώσεις, πολύ μικρές γραμματοσειρές και σελίδες με μικτούς προσανατολισμούς ή σύνθετες διατάξεις στηλών είναι οι πιο συνηθισμένες πηγές σφαλμάτων αναγνώρισης.

Μπορεί το OCR να διαβάσει χειρόγραφο κείμενο;

Το tesseract.js είναι εκπαιδευμένο κυρίως σε τυπωμένο κείμενο. Η ακρίβεια αναγνώρισης χειρογράφου είναι γενικά χαμηλή και αναξιόπιστη, ειδικά για γραφή κύρσιβ. Για χειρόγραφα έγγραφα, αφιερωμένα εργαλεία αναγνώρισης χειρογράφου παράγουν καλύτερα αποτελέσματα.

Αποστέλλονται τα σαρωμένα έγγραφά μου πουθενά κατά την εξαγωγή κειμένου;

Όχι. Μόλις το γλωσσικό μοντέλο αποθηκευτεί στην κρυφή μνήμη, κάθε εργασία αναγνώρισης γίνεται εξ ολοκλήρου στο πρόγραμμα περιήγησής σας χρησιμοποιώντας tesseract.js. Τα σαρωμένα έγγραφα μπορεί να περιέχουν προσωπικό ή εμπιστευτικό περιεχόμενο· αυτή η μόνο τοπική επεξεργασία σημαίνει ότι αυτό το περιεχόμενο δεν φτάνει ποτέ σε διακομιστή.

Διατηρεί το εργαλείο τη διάταξη της αρχικής σάρωσης;

Η έξοδος είναι απλή ροή κειμένου με σειρά ανάγνωσης. Πίνακες, στήλες, επικεφαλίδες και άλλα στοιχεία διάταξης δεν διατηρούνται ως δομή· το εργαλείο εξάγει μόνο το περιεχόμενο κειμένου. Για έξοδο με διατήρηση διάταξης, απαιτείται πιο προηγμένη ροή OCR με ανάλυση διάταξης.

Μπορώ να εκτελέσω OCR σε PDF που ήδη περιέχει επιλέξιμο κείμενο;

Το εργαλείο μπορεί να επεξεργαστεί PDF βασισμένα σε εικόνα όπου κάθε σελίδα είναι εικόνα raster χωρίς ενσωματωμένο κείμενο. Αν το PDF σας έχει ήδη επίπεδο κειμένου (μπορείτε να επιλέξετε και να αντιγράψετε κείμενο σε πρόγραμμα προβολής), η εκτέλεση OCR είναι περιττή· το υπάρχον επίπεδο κειμένου σας δίνει την ίδια πληροφορία χωρίς το βήμα αναγνώρισης.

Μπορώ να εκτελέσω OCR σε φωτογραφία που τραβήχτηκε με το τηλέφωνό μου;

Ναι, και το tesseract.js λειτουργεί σε προγράμματα περιήγησης κινητών, οπότε μπορείτε ακόμη και να ανοίξετε αυτή τη σελίδα στο ίδιο τηλέφωνο που τράβηξε τη φωτογραφία. Φωτογραφίες τραβηγμένες υπό γωνία ή με άνιση φωτεινότητα αναγνωρίζονται χειρότερα από μια σάρωση επίπεδου σαρωτή· η ευθυγράμμιση της λήψης και η αποκοπή του φόντου πρώτα βοηθούν.

Χρειάζεται να δημιουργήσω λογαριασμό ή να πληρώσω για να χρησιμοποιήσω το OCR;

Όχι. Δεν υπάρχει εγγραφή ούτε χρέωση. Η μόνη λήψη που εμπλέκεται είναι το γλωσσικό μοντέλο μίας φοράς που χρειάζεται το tesseract.js, μια εφάπαξ λήψη μηχανής, όχι συνδρομή ή τείχος πληρωμής.