Πώς λειτουργεί το PDF σε κείμενο
Το PDF to Text εξάγει το υπάρχον επίπεδο κειμένου από ένα PDF και το αποθηκεύει ως απλό αρχείο .txt. Η εξαγωγή εκτελείται από το pdf.js μέσα στο πρόγραμμα περιήγησής σας, διαβάζοντας τα αντικείμενα περιεχομένου κειμένου ενσωματωμένα στις ροές σελίδας του PDF. Το έγγραφο δεν φεύγει ποτέ από τη συσκευή σας· το αποτέλεσμα συναρμολογείται τοπικά και σας προσφέρεται ως άμεση λήψη.
Αυτό το εργαλείο διαβάζει ένα επίπεδο κειμένου που υπάρχει ήδη στο αρχείο. Αν το PDF δημιουργήθηκε από επεξεργαστή κειμένου ή εργαλείο εξαγωγής, σχεδόν σίγουρα έχει επίπεδο κειμένου και η εξαγωγή θα λειτουργήσει καλά. Αν το PDF είναι σάρωση έντυπου εγγράφου, οι σελίδες περιέχουν μόνο δεδομένα εικόνας και δεν υπάρχει επίπεδο κειμένου για εξαγωγή· σε αυτή την περίπτωση, αυτό το εργαλείο θα επιστρέψει κενή ή ατελή έξοδο. Τα σαρωμένα PDF απαιτούν οπτική αναγνώριση χαρακτήρων (OCR) για παραγωγή κειμένου, που είναι ξεχωριστή διαδικασία που δεν εκτελεί αυτό το εργαλείο. Ελέγξτε αν το PDF σας έχει επιλέξιμο κείμενο σε ένα πρόγραμμα προβολής πριν χρησιμοποιήσετε αυτό το εργαλείο.