Makale
Bazı PDF'lerden neden metin kopyalayamazsınız
Bir PDF'de bir satırı seçmeyi deneyin, kelimeler normal şekilde vurgulanır, kopyalamaya hazırdır. Aynı hareketi başka bir PDF'de deneyin, hiçbir şey olmaz veya imleç tüm sayfayı bir fotoğraf gibi kavrar, çünkü tam olarak öyledir. Ekranda aynı görünen iki dosya altta tamamen farklı şekilde inşa edilmiş olabilir. İşte hangi türe sahip olduğunuzu nasıl anlarsınız ve kopyalamaya direnen biriyle ne yapılır.
İki farklı PDF sayfası türü
Bir PDF bir sayfayı iki çok farklı şekilde saklayabilir. Metin tabanlı bir PDF'de her harf, bir web sayfasının metni sakladığı şekilde, Unicode değeri, bir yazı tipi ve bir konumu olan bir karakter nesnesidir: bir görüntüleyici onu seçebilir, arayabilir ve bir ekran okuyucu onu sesli okuyabilir. Görsel tabanlı bir PDF'de sayfa, genellikle bir tarayıcı, faks veya bir belgenin fotoğrafına uygulanan bir "PDF'ye yazdır" adımıyla üretilen tek bir düz resimdir. Harfler gözlerinize aynı görünür, ama dosya formatına göre altında bir karakter yoktur, yalnızca pikseller vardır.

Hangisine sahip olduğunuzu anlamanın hızlı bir yolu
Ctrl+F veya Cmd+F'ye basın ve sayfada net şekilde görebildiğiniz bir kelimeyi arayın. Arama onu bulup vurgularsa, sayfanın gerçek bir metin katmanı vardır. Arama belgenin hiçbir yerinde hiçbir şey bulamazsa, sayfa ne kadar keskin veya yazılmış bir belge gibi görünürse görünsün bir görseldir. Bir satırı seçmek için fareyi sürüklemek de aynı cevabı verir: bir vurgulama mı, yoksa düz bir dikdörtgen seçimi mi.
Metni OCR ile yeniden oluşturmak
Optik Karakter Tanıma (OCR), görsel tabanlı bir sayfanın piksellerini okur ve şekilleri belirli bir dil için eğitilmiş bir harf modeliyle eşleştirir, ardından tanınan karakterlerin göründükleri yere konumlandırıldığı bir metin katmanını yeniden oluşturur. OCR gibi bir araç bunu tamamen tarayıcıda yapar: hiçbir şey yüklenmez ve çıktı, arayabileceğiniz, kopyalayabileceğiniz veya düzenleyebileceğiniz düz bir metin dosyasıdır. Doğruluk kaynağa bağlıdır: iyi desteklenen bir dilde temiz, düz, yüksek çözünürlüklü bir tarama güvenilir şekilde tanınırken, eğik, bulanık, düşük kontrastlı veya el yazısı bir sayfa daha fazla hata üretir, bazen yanlış bir karakter veya yanlış okunan bir kelime.

Dosyada zaten metin varsa ama çıkarma yanlış görünüyorsa
PDF'niz gerçek bir metin katmanına sahipse ama pdf-to-text gibi bir araç metni garip bir sırada üretiyorsa, sütunlar birleşmiş veya boşluklar çökmüşse, bu farklı, alakasız bir sorundur: metin nesneleri vardır ama sayfadaki okuma sıraları bir betiğin doğal olarak beklediği şekilde saklanmamıştır. Bu, çıkarmadan sonra temizlenecek bir düzen tuhaflığıdır, metnin eksik olduğunun bir işareti değildir ve düzeltmek için OCR gerektirmez.
Bu makaledeki araçlar
- OCR · görüntü/PDF'den metneTaranmış görüntülerden veya PDF'lerden tamamen tarayıcınızda metin çıkarın, çevrimdışı çalışır, yükleme yok.
- PDF'den metneBir PDF'den metin içeriğini çıkarın ve yüklemeden .txt dosyası olarak indirin.
- PDF OCR · aranabilir hale getirTaranmış bir PDF'yi tamamen tarayıcınızda, yükleme yapmadan aranabilir ve seçilebilir bir PDF'ye dönüştürün.
Sıkça sorulan sorular
PDF'im normal yazılmış bir belge gibi görünüyor ama hâlâ hiç metin seçemiyorum. Neden?
Büyük olasılıkla bir PDF olarak kaydedilmiş taranmış veya fotoğraflanmış bir sayfa, ya da kasıtlı olarak bir görsele düzleştirilmiş bir belgedir. Görsel olarak metin tabanlı bir PDF'den ayırt edilemeyebilir; fark yalnızca aramayı veya seçmeyi denediğinizde ortaya çıkar. Onu OCR'dan geçirmek, piksellerden gerçek, seçilebilir bir metin katmanı yeniden oluşturur.
OCR her dilde eşit derecede iyi çalışır mı?
Hayır. Doğruluk, o dil ve yazı için eğitilmiş bir model olup olmadığına ve taramanın kalitesine bağlıdır. Temiz, düz bir taramada iyi desteklenen diller güvenilir şekilde tanınır; el yazısı, düşük çözünürlüklü görseller veya daha az eğitim verisi olan diller daha fazla hata üretir. OCR çıktısı her zaman en iyi çaba esaslı bir yazıya dökümdür, ona güvenmeden önce hızlı bir gözden geçirmeye değer.