Οδηγός
Κάντε ένα σαρωμένο PDF αναζητήσιμο
Ένα σαρωμένο PDF μοιάζει με κανονικό έγγραφο αλλά είναι στην πραγματικότητα μια εικόνα μιας σελίδας: το Ctrl+F δεν βρίσκει τίποτα, και δεν μπορείτε να επιλέξετε ή να αντιγράψετε ούτε μία λέξη. Το εργαλείο PDF OCR το διορθώνει αυτό χωρίς να αλλάξει τι είναι το αρχείο. Διαβάζει την εικόνα κάθε σελίδας, αναγνωρίζει τους χαρακτήρες με μια μηχανή OCR στη συσκευή, και τοποθετεί το αναγνωρισμένο κείμενο αόρατο πάνω σε αυτή την ίδια εικόνα, ώστε το PDF να εξακολουθεί να φαίνεται και να εκτυπώνεται ακριβώς όπως πριν αλλά τώρα να ανταποκρίνεται σε αναζήτηση και επιλογή κειμένου. Το αρχείο δεν φεύγει ποτέ από τη συσκευή σας.
Βήμα προς βήμα
- Ανοίξτε το εργαλείο PDF OCR και αφήστε το σαρωμένο PDF σας. Γίνονται δεκτά μόνο αρχεία PDF, και το αρχείο περιορίζεται στα 80 MB· μια τυπική πολυσέλιδη σάρωση είναι πολύ κάτω από αυτό.
- Επιλέξτε τη γλώσσα του εγγράφου από το αναπτυσσόμενο μενού (αγγλικά, γαλλικά, γερμανικά, ισπανικά, πορτογαλικά ή ιταλικά) και, αν θέλετε, επεξεργαστείτε το όνομα αρχείου εξόδου. Η προεπιλογή διατηρεί αυτόματα την επέκταση .pdf.
- Πατήστε Εκτέλεση και περιμένετε να επεξεργαστεί κάθε σελίδα. Κάθε σελίδα αποδίδεται, περνά από τη μηχανή OCR και αποκτά το δικό της αόρατο επίπεδο κειμένου πριν το εργαλείο προχωρήσει στην επόμενη, οπότε ένα μεγάλο έγγραφο χρειάζεται περισσότερο χρόνο από μια μονή σελίδα. Κατεβάστε το αποτέλεσμα: ανοίγει και εκτυπώνεται πανομοιότυπα με το πρωτότυπο, αλλά τώρα το Ctrl+F, η επιλογή κειμένου και η αντιγραφή-επικόλληση λειτουργούν.
Αναζητήσιμο PDF ή απλό κείμενο: τι χρειάζεστε πραγματικά
Αυτό το εργαλείο και το απλό εργαλείο OCR λύνουν το ίδιο υποκείμενο πρόβλημα, την αναγνώριση κειμένου σε σαρωμένη εικόνα, αλλά διατηρούν διαφορετικά πράγματα. Το εργαλείο OCR πετάει την εικόνα της σελίδας και σας επιστρέφει ένα απλό αρχείο .txt: χρησιμοποιήστε το όταν θέλετε να επικολλήσετε τις λέξεις σε έναν επεξεργαστή, να τις μεταφράσετε ή να τις αναζητήσετε ως κείμενο, και δεν σας ενδιαφέρει να διατηρήσετε την αρχική εμφάνιση του εγγράφου. Το εργαλείο PDF OCR εδώ κρατά το αρχικό PDF ακριβώς όπως είναι, εικόνες σελίδων και όλα, και απλώς προσθέτει ένα κρυφό επίπεδο κειμένου από κάτω: χρησιμοποιήστε το όταν το έγγραφο πρέπει να παραμείνει PDF που μπορείτε ακόμα να εκτυπώσετε, να στείλετε με email ή να αρχειοθετήσετε, αλλά θέλετε επίσης να μπορείτε να το αναζητήσετε ή να αντιγράψετε από αυτό. Κανένα από τα δύο εργαλεία δεν ανακατασκευάζει τη διάταξη ως επεξεργάσιμο κείμενο με πραγματικές γραμματοσειρές και πίνακες· και τα δύο δουλεύουν από το ίδιο αναγνωρισμένο κείμενο, απλώς συσκευασμένο διαφορετικά.
Γιατί το αποτέλεσμα εξαρτάται από τη σάρωση, και πού βρίσκονται τα όρια
Η ακρίβεια αναγνώρισης ακολουθεί την ποιότητα της πηγαίας εικόνας, με τον ίδιο τρόπο όπως και για το απλό OCR: μια καθαρή, ίσια σάρωση γύρω στα 200 έως 300 DPI αναγνωρίζεται αξιόπιστα, ενώ μια θολή φωτογραφία, μια λοξή σελίδα ή έντονες σκιές παράγουν περισσότερες λανθασμένες αναγνώσεις λέξεων. Αν μια σελίδα βγήκε στραβή, ισιώστε την πρώτα με το εργαλείο ισιώματος PDF ώστε το βήμα αναγνώρισης να διαβάσει επίπεδο κείμενο. Το εργαλείο καλύπτει έξι γλώσσες (αγγλικά, γαλλικά, γερμανικά, ισπανικά, πορτογαλικά, ιταλικά)· ένα έγγραφο σε μη υποστηριζόμενη γλώσσα δεν θα αναγνωριστεί σωστά. Η επεξεργασία τρέχει σελίδα προς σελίδα στην καρτέλα του προγράμματος περιήγησής σας, οπότε ένα έγγραφο με δεκάδες σελίδες χρειάζεται αισθητά περισσότερο χρόνο από μια σάρωση δύο σελίδων, και το αρχείο περιορίζεται στα 80 MB. Το PDF εξόδου τείνει επίσης να έχει παρόμοιο μέγεθος με το πρωτότυπο, αφού οι ίδιες οι εικόνες σελίδων δεν αγγίζονται· αν χρειαστείτε μικρότερο αρχείο μετά, περάστε το από τον συμπιεστή PDF.
Πώς κατασκευάζεται το αόρατο επίπεδο κειμένου
Κάθε σελίδα PDF ρασταρίζεται πρώτα σε εικόνα canvas στο πρόγραμμα περιήγησής σας, το ίδιο βήμα απόδοσης που χρησιμοποιεί το εργαλείο PDF σε εικόνα. Η μηχανή OCR (Tesseract, μεταγλωττισμένη σε WebAssembly) διαβάζει αυτή την εικόνα και επιστρέφει κάθε αναγνωρισμένη λέξη μαζί με το οριοθετημένο πλαίσιό της, τη θέση της στη σελίδα. Αυτές οι λέξεις σχεδιάζονται μετά πίσω σε ένα αντίγραφο της αρχικής σελίδας PDF στις αναγνωρισμένες θέσεις τους, αλλά με μηδενική αδιαφάνεια, ώστε τίποτα να μην αλλάζει οπτικά: η εικόνα της σελίδας που βλέπετε και εκτυπώνετε είναι η ίδια που σαρώθηκε, από πάνω. Οι λειτουργίες αναζήτησης και επιλογής κειμένου ενός προγράμματος προβολής PDF κοιτάζουν μόνο εκείνο το αόρατο επίπεδο κειμένου, γι' αυτό το αρχείο γίνεται αναζητήσιμο και επιλέξιμο χωρίς να φαίνεται διαφορετικό. Όλα αυτά, απόδοση, αναγνώριση και επανασυναρμολόγηση, συμβαίνουν μέσα στην καρτέλα του προγράμματος περιήγησής σας· το PDF διαβάζεται από τον τοπικό δίσκο και δεν μεταδίδεται ποτέ πουθενά.
Τα εργαλεία που χρησιμοποιούνται σε αυτόν τον οδηγό
- PDF OCR · κάντε το αναζητήσιμοΜετατρέψτε ένα σαρωμένο PDF σε αναζητήσιμο PDF με επιλέξιμο κείμενο, εξ ολοκλήρου στο πρόγραμμα περιήγησής σας. Χωρίς μεταφόρτωση.
- OCR · εικόνα/PDF σε κείμενοΕξαγωγή κειμένου από σαρωμένες εικόνες ή PDF εξ ολοκλήρου στο πρόγραμμα περιήγησής σας, λειτουργεί εκτός σύνδεσης, χωρίς μεταφόρτωση.
- Διόρθωση κλίσης σαρωμένων σελίδωνΙσιώστε στραβές σαρωμένες σελίδες PDF ή εικόνες εξ ολοκλήρου στο πρόγραμμα περιήγησής σας, χωρίς μεταφόρτωση.
- Συμπίεση PDFΜειώστε το μέγεθος του αρχείου PDF με αδύνατη βελτιστοποίηση της εσωτερικής του δομής, χωρίς μεταφόρτωση.
Συχνές ερωτήσεις
Θα φαίνεται και θα εκτυπώνεται το αναζητήσιμο PDF ακριβώς όπως η αρχική σάρωση;
Ναι. Το εργαλείο δεν τροποποιεί ποτέ την εικόνα της σελίδας· απλώς προσθέτει ένα αόρατο επίπεδο κειμένου από κάτω. Στην οθόνη και στο χαρτί, η έξοδος είναι οπτικά πανομοιότυπη με τη σάρωση που αφήσατε. Αυτό που αλλάζει είναι ότι τα εργαλεία αναζήτησης και επιλογής κειμένου ενός προγράμματος προβολής μπορούν τώρα να βρουν και να πιάσουν τις αναγνωρισμένες λέξεις, επειδή διαβάζουν από εκείνο το κρυφό επίπεδο.
Γιατί υπάρχει αυτό το εργαλείο δίπλα στο απλό εργαλείο OCR;
Απαντούν σε διαφορετικές ανάγκες από το ίδιο βήμα αναγνώρισης. Το εργαλείο OCR σάς δίνει ένα απλό αρχείο κειμένου, που είναι αυτό που θέλετε αν σκοπεύετε να επικολλήσετε, να επεξεργαστείτε ή να μεταφράσετε τις λέξεις και δεν χρειάζεται να διατηρήσετε το έγγραφο ως PDF. Αυτό το εργαλείο κρατά το αρχείο ως PDF με τις αρχικές εικόνες σελίδων ανέγγιχτες, που είναι αυτό που θέλετε αν το έγγραφο πρέπει ακόμα να εκτυπωθεί, να αρχειοθετηθεί ή να σταλεί με email όπως είναι, αλλά θέλετε επίσης να μπορείτε να αναζητήσετε ή να αντιγράψετε κείμενο από αυτό.