Kein Upload, 100% lokal, kein Konto

PDF → Textextraktion

Gesamten lesbaren Text aus Ihrem PDF extrahieren. Als .txt-Datei herunterladen. Alles bleibt in Ihrem Browser, keine Datei wird an einen Server gesendet.

So funktioniert PDF zu Text

PDF zu Text extrahiert die vorhandene Textebene aus einem PDF und speichert sie als einfache .txt-Datei. Die Extraktion wird von pdf.js in Ihrem Browser durchgeführt, das die in den Seiten-Streams des PDFs eingebetteten Textinhaltsobjekte liest. Das Dokument verlässt Ihr Gerät nicht; das Ergebnis wird lokal zusammengestellt und als direkter Download angeboten.

Dieses Werkzeug liest eine Textebene, die bereits in der Datei vorhanden ist. Wenn Ihr PDF mit einem Textverarbeitungsprogramm oder einem Exportwerkzeug erstellt wurde, hat es fast sicher eine Textebene, und die Extraktion funktioniert gut. Wenn das PDF ein Scan eines Papierdokuments ist, enthalten die Seiten nur Bilddaten und es gibt keine Textebene zum Extrahieren; in diesem Fall gibt das Werkzeug leere oder unvollständige Ausgabe zurück. Gescannte PDFs erfordern optische Zeichenerkennung (OCR), um Text zu erzeugen - ein separater Prozess, der von diesem Werkzeug nicht durchgeführt wird. Überprüfen Sie in einem Betrachter, ob Ihr PDF auswählbaren Text hat, bevor Sie dieses Werkzeug verwenden.

So wird PDF zu Text verwendet, Schritt für Schritt

  1. Laden Sie Ihr PDF in das Textextraktionswerkzeug.
  2. Warten Sie, während pdf.js die Textebene aus allen Seiten liest.
  3. Überprüfen Sie die Vorschau des extrahierten Textes.
  4. Klicken Sie auf Herunterladen, um die .txt-Datei zu speichern.

Häufige Anwendungsfälle

  • Den Text aus einem Forschungsartikel-PDF extrahieren, um ihn in eine Notizanwendung einzufügen oder durch eine Zusammenfassung laufen zu lassen.
  • Den Inhalt aus einer PDF-Rechnung in eine Tabellenkalkulation für die Buchhaltung holen, ohne manuelles Abtippen.
  • Den Text aus einem beschädigten oder layoutgesperrten PDF wiederherstellen, bei dem Kopieren und Einfügen im Betrachter nicht funktioniert.
  • Einen PDF-Artikel in einfachen Text für die Verarbeitung mit einem Skript oder Befehlszeilenwerkzeug umwandeln.

Häufig gestellte Fragen

Warum ist der extrahierte Text bei manchen PDFs leer oder unleserlich?

Der häufigste Grund ist, dass das PDF ein Scan ist: die Seiten sind Bilder und enthalten keine Textebene. Weitere Ursachen sind PDFs, bei denen der Text als Konturen oder mit benutzerdefinierten Schriftkodierungen gespeichert ist, die pdf.js nicht auf lesbare Zeichen abbilden kann. Für gescannte Dokumente ist OCR erforderlich, um Text zu erzeugen.

Führt dieses Werkzeug OCR bei gescannten PDFs durch?

Nein. Dieses Werkzeug liest eine vorhandene Textebene aus dem PDF. Es führt keine optische Zeichenerkennung durch. Für gescannte PDFs verwenden Sie das OCR-Werkzeug, das die Seitenbilder durch eine lokale OCR-Engine in Ihrem Browser leitet.

Wird die Textextraktion auf einem Server oder in meinem Browser durchgeführt?

In Ihrem Browser. pdf.js liest die PDF-Struktur lokal, parst die Textinhaltsobjekte aus jedem Seitenstrom und stellt die Ausgabe im Browser-Arbeitsspeicher zusammen. Die PDF-Daten verlassen Ihr Gerät zu keinem Zeitpunkt dieses Vorgangs.

Bleibt die Formatierung und das Layout in der Textausgabe erhalten?

Nein. Einfacher Text trägt keine Schrift-, Größen-, Farb- oder Positionsinformationen. Die Ausgabe ist unformatierter Text in der von pdf.js bestimmten Lesereihenfolge. Tabellen, mehrspaltige Layouts und spezielle Formatierungen werden vereinfacht. Für die Beibehaltung des Rich-Layouts sind PDF-zu-HTML-Konverter besser geeignet.

Kann ich Text aus einem passwortgeschützten PDF extrahieren?

Wenn das PDF ein Benutzer-Öffnungspasswort hat, müssen Sie es angeben, damit das PDF überhaupt lesbar ist. Einschränkungen auf Besitzerebene für die Extraktion können den Vorgang ebenfalls blockieren. Entfernen Sie diese Einschränkungen zunächst mit dem PDF-Entsperren-Werkzeug und versuchen Sie die Extraktion dann erneut.

Muss ich ein Konto erstellen, um Text aus einem PDF zu extrahieren?

Nein. Es gibt keine Registrierung und kein Konto. Legen Sie die Datei ab, lesen Sie die extrahierte Vorschau und laden Sie die .txt-Datei herunter.

Funktioniert PDF zu Text in einem mobilen Browser?

Ja. pdf.js läuft in einem Handy-Browser genauso wie auf dem Desktop. Kopieren oder laden Sie den extrahierten Text direkt von der mobilen Seite herunter, sobald die Extraktion abgeschlossen ist.