Άρθρο
Γιατί δεν μπορείτε να αντιγράψετε κείμενο από κάποια PDF
Δοκιμάστε να επιλέξετε μια γραμμή σε ένα PDF και οι λέξεις επισημαίνονται κανονικά, έτοιμες για αντιγραφή. Δοκιμάστε την ίδια κίνηση σε άλλο PDF και δεν συμβαίνει τίποτα, ή ο δρομέας πιάνει ολόκληρη τη σελίδα σαν φωτογραφία, επειδή ακριβώς αυτό είναι. Δύο αρχεία που φαίνονται πανομοιότυπα στην οθόνη μπορεί να είναι φτιαγμένα εντελώς διαφορετικά από κάτω. Δείτε πώς να ξεχωρίσετε ποιο είδος έχετε, και τι να κάνετε με αυτό που αντιστέκεται στην αντιγραφή.
Δύο διαφορετικά είδη σελίδας PDF
Ένα PDF μπορεί να αποθηκεύσει μια σελίδα με δύο πολύ διαφορετικούς τρόπους. Σε ένα PDF βασισμένο σε κείμενο, κάθε γράμμα είναι ένα αντικείμενο χαρακτήρα με τιμή Unicode, γραμματοσειρά και θέση, με τον ίδιο τρόπο που μια ιστοσελίδα αποθηκεύει κείμενο: ένα πρόγραμμα προβολής μπορεί να το επιλέξει, να το αναζητήσει, και ένας αναγνώστης οθόνης μπορεί να το διαβάσει δυνατά. Σε ένα PDF βασισμένο σε εικόνα, η σελίδα είναι μία επίπεδη εικόνα, συχνά παραγμένη από σαρωτή, φαξ, ή ένα βήμα «εκτύπωση σε PDF» εφαρμοσμένο σε φωτογραφία ενός εγγράφου. Τα γράμματα φαίνονται ίδια στα μάτια σας, αλλά για τη μορφή του αρχείου δεν υπάρχει χαρακτήρας από κάτω, μόνο pixel.

Ένας γρήγορος τρόπος να καταλάβετε ποιο έχετε
Πατήστε Ctrl+F ή Cmd+F και αναζητήστε μια λέξη που βλέπετε καθαρά στη σελίδα. Αν η αναζήτηση τη βρει και την επισημάνει, η σελίδα έχει πραγματικό επίπεδο κειμένου. Αν η αναζήτηση δεν βρει τίποτα πουθενά στο έγγραφο, η σελίδα είναι εικόνα, όσο ευκρινής ή όσο σαν δακτυλογραφημένο έγγραφο κι αν φαίνεται. Το να σύρετε το ποντίκι για να επιλέξετε μια γραμμή δίνει την ίδια απάντηση: μια επισήμανση έναντι μιας απλής ορθογώνιας επιλογής.
Ανακατασκευή του κειμένου με OCR
Η Οπτική Αναγνώριση Χαρακτήρων (OCR) διαβάζει τα pixel μιας σελίδας βασισμένης σε εικόνα και ταιριάζει τα σχήματα με ένα εκπαιδευμένο μοντέλο γραμμάτων για μια δεδομένη γλώσσα, και μετά ανακατασκευάζει ένα επίπεδο κειμένου με τους αναγνωρισμένους χαρακτήρες τοποθετημένους εκεί που εμφανίζονταν. Ένα εργαλείο όπως το ocr το κάνει αυτό εξ ολοκλήρου στο πρόγραμμα περιήγησης: τίποτα δεν ανεβαίνει, και η έξοδος είναι ένα απλό αρχείο κειμένου που μπορείτε να αναζητήσετε, να αντιγράψετε ή να επεξεργαστείτε. Η ακρίβεια εξαρτάται από την πηγή: μια καθαρή, ίσια σάρωση υψηλής ανάλυσης σε καλά υποστηριζόμενη γλώσσα αναγνωρίζεται αξιόπιστα, ενώ μια λοξή, θολή, χαμηλής αντίθεσης ή χειρόγραφη σελίδα παράγει περισσότερα λάθη, μερικές φορές έναν λάθος χαρακτήρα ή μια λανθασμένα αναγνωσμένη λέξη.

Όταν το αρχείο έχει ήδη κείμενο αλλά η εξαγωγή φαίνεται λάθος
Αν το PDF σας έχει πράγματι πραγματικό επίπεδο κειμένου αλλά ένα εργαλείο όπως το pdf-σε-κείμενο παράγει κείμενο με παράξενη σειρά, με στήλες συγχωνευμένες ή διάστιχο συμπιεσμένο, αυτό είναι διαφορετικό, άσχετο πρόβλημα: τα αντικείμενα κειμένου υπάρχουν αλλά η σειρά ανάγνωσής τους στη σελίδα δεν αποθηκεύτηκε με τον τρόπο που φυσικά περιμένει ένα σενάριο. Αυτό είναι μια ιδιορρυθμία διάταξης προς καθαρισμό μετά την εξαγωγή, όχι ένδειξη ότι λείπει το κείμενο, και δεν χρειάζεται OCR για να διορθωθεί.
Εργαλεία αυτού του άρθρου
- OCR · εικόνα/PDF σε κείμενοΕξαγωγή κειμένου από σαρωμένες εικόνες ή PDF εξ ολοκλήρου στο πρόγραμμα περιήγησής σας, λειτουργεί εκτός σύνδεσης, χωρίς μεταφόρτωση.
- PDF σε κείμενοΕξαγωγή κειμένου από ένα PDF και λήψη ως αρχείο .txt, χωρίς αποστολή.
- PDF OCR · κάντε το αναζητήσιμοΜετατρέψτε ένα σαρωμένο PDF σε αναζητήσιμο PDF με επιλέξιμο κείμενο, εξ ολοκλήρου στο πρόγραμμα περιήγησής σας. Χωρίς μεταφόρτωση.
Συχνές ερωτήσεις
Το PDF μου μοιάζει με κανονικό δακτυλογραφημένο έγγραφο αλλά ακόμα δεν μπορώ να επιλέξω κείμενο. Γιατί;
Είναι πιθανότατα μια σαρωμένη ή φωτογραφημένη σελίδα αποθηκευμένη ως PDF, ή ένα έγγραφο επιπεδοποιημένο σκόπιμα σε εικόνα. Οπτικά μπορεί να είναι δυσδιάκριτο από ένα PDF βασισμένο σε κείμενο· η διαφορά φαίνεται μόνο όταν προσπαθήσετε να το αναζητήσετε ή να το επιλέξετε. Αν το περάσετε από OCR ανακατασκευάζεται ένα πραγματικό, επιλέξιμο επίπεδο κειμένου από τα pixel.
Δουλεύει το OCR εξίσου καλά σε κάθε γλώσσα;
Όχι. Η ακρίβεια εξαρτάται από το αν υπάρχει εκπαιδευμένο μοντέλο για εκείνη τη γλώσσα και γραφή, και από την ποιότητα της σάρωσης. Οι καλά υποστηριζόμενες γλώσσες σε καθαρή, ίσια σάρωση αναγνωρίζονται αξιόπιστα· η χειρόγραφη γραφή, οι εικόνες χαμηλής ανάλυσης, ή οι γλώσσες με λιγότερα δεδομένα εκπαίδευσης παράγουν περισσότερα σφάλματα. Η έξοδος του OCR είναι πάντα μια μεταγραφή βέλτιστης προσπάθειας, που αξίζει γρήγορο έλεγχο πριν τη βασιστείτε.