Χωρίς μεταφόρτωση, 100% τοπικά, χωρίς λογαριασμό

Κάντε ένα σαρωμένο PDF αναζητήσιμο

Ρίξτε ένα σαρωμένο PDF και πάρτε πίσω τις ίδιες σελίδες με ένα αόρατο, αναζητήσιμο επίπεδο κειμένου από πάνω. Η αναγνώριση τρέχει εξ ολοκλήρου στο πρόγραμμα περιήγησής σας (στη συσκευή, εκτός σύνδεσης μετά την πρώτη φόρτωση), τίποτα δεν ανεβαίνει.

Πώς λειτουργεί το PDF OCR · κάντε το αναζητήσιμο

Το PDF OCR μετατρέπει ένα σαρωμένο PDF, φτιαγμένο από εικόνες σελίδων χωρίς πραγματικό κείμενο, σε ένα αναζητήσιμο PDF: τις ίδιες εικόνες σελίδων, συν ένα αόρατο επίπεδο κειμένου τοποθετημένο πάνω από κάθε αναγνωρισμένη λέξη. Ανοίξτε το αποτέλεσμα σε οποιονδήποτε αναγνώστη PDF και μπορείτε πλέον να χρησιμοποιήσετε το Ctrl+F για να βρείτε μια λέξη, να επιλέξετε και να αντιγράψετε μια παράγραφο, ή να αφήσετε μια μηχανή αναζήτησης να ευρετηριάσει το έγγραφο, πράγματα που μια απλή σάρωση δεν μπορεί να κάνει. Η ίδια η αναγνώριση εκτελείται με το tesseract.js (τον ίδιο αυτοφιλοξενούμενο μηχανισμό OCR που χρησιμοποιεί το εργαλείο OCR), και η απόδοση σελίδων εκτελείται με το pdf.js· και τα δύο εκτελούνται εξ ολοκλήρου μέσα στην καρτέλα του browser σας, και το αρχείο σας δεν ανεβαίνει ποτέ.

Αυτό το εργαλείο είναι ειλικρινές σχετικά με το τι κάνει και τι δεν κάνει. Δεν ανασυνθέτει διάταξη, πίνακες ή γραμματοσειρές, και δεν είναι ένας μετατροπέας σε επεξεργάσιμο έγγραφο: η ορατή σελίδα παραμένει εικόνα, πανομοιότυπη με την πηγαία σάρωση, με ένα κρυφό επίπεδο κειμένου προστιθέμενο κάτω από την εμφάνιση. Η ακρίβεια αναγνώρισης εξαρτάται από την ποιότητα της σάρωσης, τις ίδιες οδηγίες 200 DPI ή καλύτερα, υψηλής αντίθεσης, ίσιας σελίδας που ισχύουν για κάθε μηχανισμό OCR. Αν χρειάζεστε μόνο το απλό εξαγόμενο κείμενο αντί για ένα PDF στο οποίο μπορείτε να κάνετε αναζήτηση, το εργαλείο OCR παράγει αντ' αυτού ένα αρχείο .txt και είναι πιο γρήγορο για αυτή τη συγκεκριμένη εργασία.

PDF OCR · κάντε το αναζητήσιμο: οδηγός βήμα προς βήμα

  1. Αφήστε το σαρωμένο σας PDF (μία εικόνα σελίδας ανά σελίδα, χωρίς υπάρχον επίπεδο κειμένου) στην περιοχή μεταφόρτωσης.
  2. Επιλέξτε την κύρια γλώσσα του εγγράφου από το αναπτυσσόμενο μενού γλώσσας.
  3. Αν είναι η πρώτη φορά που χρησιμοποιείτε το εργαλείο, περιμένετε να κατέβει ο μηχανισμός tesseract.js (γίνεται μία φορά).
  4. Πατήστε εκτέλεση και περιμένετε όσο κάθε σελίδα αποδίδεται και αναγνωρίζεται με τη σειρά.
  5. Κατεβάστε το αναζητήσιμο PDF: ίδια εμφάνιση, τώρα με ένα επίπεδο κειμένου από κάτω.

Συνήθεις περιπτώσεις χρήσης

  • Ένα σαρωμένο συμβόλαιο πρέπει να γίνει αναζητήσιμο ώστε μια συγκεκριμένη ρήτρα να μπορεί να βρεθεί με Ctrl+F αντί να διαβαστεί κάθε σελίδα.
  • Μια παρτίδα σαρωμένων τιμολογίων πρέπει να μπει σε ένα αρχείο εγγράφων όπου το ευρετήριο αναζήτησης διαβάζει μόνο πραγματικό κείμενο PDF.
  • Μια φωτογραφημένη ή σαρωμένη φόρμα χρειάζεται οι τυπωμένες ετικέτες της να γίνουν επιλέξιμες ώστε μια παράγραφος να μπορεί να αντιγραφεί σε ένα email.
  • Μια βιβλιοθήκη σαρωμένων αναφορών στα γερμανικά χρειάζεται πλήρη αναζήτηση κειμένου· επιλέξτε γερμανικά ως γλώσσα πριν εκτελέσετε το εργαλείο.

Συχνές ερωτήσεις

Πώς διαφέρει αυτό από το απλό εργαλείο OCR;

Το εργαλείο OCR εξάγει απλό κείμενο σε ένα αρχείο .txt, αφήνοντας εντελώς την αρχική διάταξη και τις εικόνες. Το PDF OCR διατηρεί τις αρχικές εικόνες σελίδων PDF ακριβώς όπως φαίνονται και προσθέτει ένα αόρατο, αναζητήσιμο επίπεδο κειμένου από κάτω. Χρησιμοποιήστε το OCR όταν θέλετε μόνο τις λέξεις· χρησιμοποιήστε το PDF OCR όταν θέλετε να διατηρήσετε το έγγραφο ως PDF αλλά να το κάνετε αναζητήσιμο και επιλέξιμο.

Θα φαίνεται διαφορετικό το PDF εξόδου από τη σάρωσή μου;

Όχι. Κάθε σελίδα αποδίδεται από το πηγαίο σας PDF και ενσωματώνεται ξανά ως εικόνα, εικονοστοιχειακά πανομοιότυπη με την αρχική σάρωση (λαμβάνοντας υπόψη την επανακωδικοποίηση JPEG). Οι αναγνωρισμένες λέξεις σχεδιάζονται από πάνω με μηδενική αδιαφάνεια, οπότε τίποτα νέο δεν είναι ορατό· μια αναζήτηση κειμένου ή μια επιλογή κειμένου είναι ο μόνος τρόπος να παρατηρήσετε το προστιθέμενο επίπεδο.

Ανασυνθέτει το εργαλείο πίνακες, στήλες ή γραμματοσειρές;

Όχι. Η έξοδος διατηρεί τη σελίδα ως μία ενιαία επίπεδη εικόνα· το αόρατο επίπεδο κειμένου ακολουθεί τις θέσεις των αναγνωρισμένων λέξεων αλλά δεν διατηρεί τη δομή πινάκων, τη σειρά ανάγνωσης πολλαπλών στηλών πέρα από ό,τι συνάγει το tesseract.js, ούτε τις αρχικές γραμματοσειρές. Αυτό είναι ένα επίπεδο αναζητησιμότητας, όχι μια μετατροπή εγγράφου σε επεξεργάσιμο κείμενο.

Αποστέλλονται τα σαρωμένα μου έγγραφα πουθενά κατά την επεξεργασία;

Όχι. Αφού ο μηχανισμός tesseract.js και το πακέτο γλώσσας κατέβουν από αυτόν τον ιστότοπο (μια εφάπαξ λήψη μερικών megabyte κατά την πρώτη χρήση), κάθε απόδοση σελίδας και κάθε πέρασμα αναγνώρισης γίνεται εξ ολοκλήρου μέσα στην καρτέλα του browser σας. Σαρωμένα συμβόλαια, ιατρικά αρχεία ή άλλα ευαίσθητα έγγραφα δεν φτάνουν ποτέ σε έναν server.

Γιατί ένα μεγάλο PDF χρειάζεται χρόνο για να επεξεργαστεί;

Κάθε σελίδα αποδίδεται ως εικόνα και το OCR εκτελείται σε αυτή την εικόνα ξεχωριστά, όλα μέσα στην καρτέλα του browser σας, οπότε ο χρόνος επεξεργασίας κλιμακώνεται με τον αριθμό σελίδων. Η μπάρα προόδου αντικατοπτρίζει πραγματική πρόοδο ανά σελίδα, και τα αρχεία περιορίζονται στα 80 MB για να κρατηθεί όλο το pipeline μέσα στο όριο μνήμης μιας καρτέλας browser.

Τι γίνεται αν το PDF μου έχει ήδη επιλέξιμο κείμενο;

Η εκτέλεση OCR σε ένα PDF που ήδη διαθέτει πραγματικό επίπεδο κειμένου είναι περιττή: το άνοιγμά του σε έναν αναγνώστη και το πάτημα Ctrl+F λειτουργούν ήδη. Αυτό το εργαλείο είναι για PDF φτιαγμένα από εικόνες σελίδων χωρίς υποκείμενο κείμενο, το συνηθισμένο αποτέλεσμα ενός σαρωτή επίπεδης βάσης ή μιας «εκτύπωσης σε PDF» ενός φωτογραφημένου εγγράφου.