So funktioniert PDF zu Text
PDF zu Text extrahiert die vorhandene Textebene aus einem PDF und speichert sie als einfache .txt-Datei. Die Extraktion wird von pdf.js in Ihrem Browser durchgeführt, das die in den Seiten-Streams des PDFs eingebetteten Textinhaltsobjekte liest. Das Dokument verlässt Ihr Gerät nicht; das Ergebnis wird lokal zusammengestellt und als direkter Download angeboten.
Dieses Werkzeug liest eine Textebene, die bereits in der Datei vorhanden ist. Wenn Ihr PDF mit einem Textverarbeitungsprogramm oder einem Exportwerkzeug erstellt wurde, hat es fast sicher eine Textebene, und die Extraktion funktioniert gut. Wenn das PDF ein Scan eines Papierdokuments ist, enthalten die Seiten nur Bilddaten und es gibt keine Textebene zum Extrahieren; in diesem Fall gibt das Werkzeug leere oder unvollständige Ausgabe zurück. Gescannte PDFs erfordern optische Zeichenerkennung (OCR), um Text zu erzeugen - ein separater Prozess, der von diesem Werkzeug nicht durchgeführt wird. Überprüfen Sie in einem Betrachter, ob Ihr PDF auswählbaren Text hat, bevor Sie dieses Werkzeug verwenden.