Artikel
Warum Sie aus manchen PDFs keinen Text kopieren können
Versuchen Sie, eine Zeile in einem PDF zu markieren, und die Wörter heben sich normal hervor, bereit zum Kopieren. Versuchen Sie dieselbe Geste in einem anderen PDF, und nichts passiert, oder der Cursor greift die ganze Seite wie eine Fotografie, weil genau das sie ist. Zwei Dateien, die auf dem Bildschirm identisch aussehen, können darunter völlig unterschiedlich aufgebaut sein. Hier ist, wie Sie erkennen, welche Art Sie haben, und was Sie mit der tun, die sich gegen das Kopieren wehrt.
Zwei unterschiedliche Arten von PDF-Seiten
Ein PDF kann eine Seite auf zwei sehr unterschiedliche Arten speichern. In einem textbasierten PDF ist jeder Buchstabe ein Zeichenobjekt mit einem Unicode-Wert, einer Schriftart und einer Position, genau wie eine Webseite Text speichert: Ein Betrachter kann ihn auswählen, durchsuchen, und ein Screenreader kann ihn vorlesen. In einem bildbasierten PDF ist die Seite ein einziges flaches Bild, oft von einem Scanner, einem Fax oder einem 'Als PDF drucken'-Schritt auf ein Foto eines Dokuments erzeugt. Die Buchstaben sehen für Ihre Augen gleich aus, aber für das Dateiformat gibt es darunter kein Zeichen, nur Pixel.

Ein schneller Weg zu erkennen, welche Art Sie haben
Drücken Sie Strg+F oder Cmd+F und suchen Sie nach einem Wort, das klar auf der Seite zu sehen ist. Findet die Suche es und hebt es hervor, hat die Seite eine echte Textebene. Findet die Suche nirgendwo im Dokument etwas, ist die Seite ein Bild, egal wie scharf oder wie sehr sie wie ein getipptes Dokument aussieht. Das Ziehen der Maus zum Markieren einer Zeile ergibt dieselbe Antwort: eine Hervorhebung gegenüber einer einfachen rechteckigen Auswahl.
Den Text mit OCR rekonstruieren
Optische Zeichenerkennung (OCR) liest die Pixel einer bildbasierten Seite und gleicht die Formen mit einem trainierten Modell der Buchstaben einer bestimmten Sprache ab, dann baut sie eine Textebene mit den erkannten Zeichen dort wieder auf, wo sie erschienen. Ein Tool wie OCR macht das vollständig im Browser: Nichts wird hochgeladen, und das Ergebnis ist eine reine Textdatei, die Sie durchsuchen, kopieren oder bearbeiten können. Die Genauigkeit hängt von der Quelle ab: ein sauberer, gerader, hochauflösender Scan in einer gut unterstützten Sprache wird zuverlässig erkannt, während eine schiefe, unscharfe, kontrastarme oder handgeschriebene Seite mehr Fehler produziert, manchmal ein falsches Zeichen oder ein falsch gelesenes Wort.

Wenn die Datei bereits Text hat, aber die Extraktion falsch aussieht
Hat Ihr PDF bereits eine echte Textebene, aber ein Tool wie PDF-zu-Text erzeugt Text in seltsamer Reihenfolge, mit verschmolzenen Spalten oder zusammengefallenen Abständen, ist das ein anderes, unabhängiges Problem: Die Textobjekte existieren, aber ihre Lesereihenfolge auf der Seite wurde nicht so gespeichert, wie ein Skript sie natürlich erwartet. Das ist eine Layout-Eigenheit, die nach der Extraktion aufgeräumt werden muss, kein Zeichen dafür, dass der Text fehlt, und es braucht keine OCR zur Behebung.
Tools in diesem Artikel
- OCR · Bild/PDF zu TextText aus gescannten Bildern oder PDFs vollständig im Browser extrahieren, läuft offline, kein Upload.
- PDF zu TextTextinhalt aus einem PDF extrahieren und als .txt-Datei herunterladen, ohne hochzuladen.
- PDF OCR · durchsuchbar machenVerwandeln Sie ein gescanntes PDF vollständig in Ihrem Browser in ein durchsuchbares, auswählbares PDF, kein Upload.
Häufige Fragen
Mein PDF sieht aus wie ein normal getipptes Dokument, aber ich kann trotzdem keinen Text markieren. Warum?
Höchstwahrscheinlich handelt es sich um eine gescannte oder fotografierte, als PDF gespeicherte Seite, oder ein absichtlich zu einem Bild abgeflachtes Dokument. Visuell kann das von einem textbasierten PDF nicht zu unterscheiden sein; der Unterschied zeigt sich erst, wenn Sie versuchen, es zu durchsuchen oder zu markieren. Eine OCR-Verarbeitung baut aus den Pixeln eine echte, auswählbare Textebene wieder auf.
Funktioniert OCR in jeder Sprache gleich gut?
Nein. Die Genauigkeit hängt davon ab, ob für diese Sprache und Schrift ein trainiertes Modell existiert, und von der Qualität des Scans. Gut unterstützte Sprachen bei einem sauberen, geraden Scan werden zuverlässig erkannt; Handschrift, niedrig aufgelöste Bilder oder Sprachen mit weniger Trainingsdaten produzieren mehr Fehler. Die OCR-Ausgabe ist immer eine Transkription nach bestem Bemühen, ein kurzes Korrekturlesen lohnt sich, bevor Sie sich darauf verlassen.