Yükleme yok, %100 yerel, hesap yok

Makale

Bazı PDF'lerden neden metin kopyalayamazsınız

Bir PDF'de bir satırı seçmeyi deneyin, kelimeler normal şekilde vurgulanır, kopyalamaya hazırdır. Aynı hareketi başka bir PDF'de deneyin, hiçbir şey olmaz veya imleç tüm sayfayı bir fotoğraf gibi kavrar, çünkü tam olarak öyledir. Ekranda aynı görünen iki dosya altta tamamen farklı şekilde inşa edilmiş olabilir. İşte hangi türe sahip olduğunuzu nasıl anlarsınız ve kopyalamaya direnen biriyle ne yapılır.

İki farklı PDF sayfası türü

Bir PDF bir sayfayı iki çok farklı şekilde saklayabilir. Metin tabanlı bir PDF'de her harf, bir web sayfasının metni sakladığı şekilde, Unicode değeri, bir yazı tipi ve bir konumu olan bir karakter nesnesidir: bir görüntüleyici onu seçebilir, arayabilir ve bir ekran okuyucu onu sesli okuyabilir. Görsel tabanlı bir PDF'de sayfa, genellikle bir tarayıcı, faks veya bir belgenin fotoğrafına uygulanan bir "PDF'ye yazdır" adımıyla üretilen tek bir düz resimdir. Harfler gözlerinize aynı görünür, ama dosya formatına göre altında bir karakter yoktur, yalnızca pikseller vardır.

Yan yana karşılaştırma: seçilebilir, vurgulanmış bir metin satırı olan metin tabanlı bir PDF sayfası, aynı görünen metnin seçim olmadan tek bir düz resim olduğu görsel tabanlı bir PDF sayfasının yanında.

Hangisine sahip olduğunuzu anlamanın hızlı bir yolu

Ctrl+F veya Cmd+F'ye basın ve sayfada net şekilde görebildiğiniz bir kelimeyi arayın. Arama onu bulup vurgularsa, sayfanın gerçek bir metin katmanı vardır. Arama belgenin hiçbir yerinde hiçbir şey bulamazsa, sayfa ne kadar keskin veya yazılmış bir belge gibi görünürse görünsün bir görseldir. Bir satırı seçmek için fareyi sürüklemek de aynı cevabı verir: bir vurgulama mı, yoksa düz bir dikdörtgen seçimi mi.

Metni OCR ile yeniden oluşturmak

Optik Karakter Tanıma (OCR), görsel tabanlı bir sayfanın piksellerini okur ve şekilleri belirli bir dil için eğitilmiş bir harf modeliyle eşleştirir, ardından tanınan karakterlerin göründükleri yere konumlandırıldığı bir metin katmanını yeniden oluşturur. OCR gibi bir araç bunu tamamen tarayıcıda yapar: hiçbir şey yüklenmez ve çıktı, arayabileceğiniz, kopyalayabileceğiniz veya düzenleyebileceğiniz düz bir metin dosyasıdır. Doğruluk kaynağa bağlıdır: iyi desteklenen bir dilde temiz, düz, yüksek çözünürlüklü bir tarama güvenilir şekilde tanınırken, eğik, bulanık, düşük kontrastlı veya el yazısı bir sayfa daha fazla hata üretir, bazen yanlış bir karakter veya yanlış okunan bir kelime.

Hat diyagramı: taranmış bir sayfanın pikselleri OCR karakter tanımasından geçer ve yeniden oluşturulmuş, konumlandırılmış bir metin katmanı olarak çıkar.

Dosyada zaten metin varsa ama çıkarma yanlış görünüyorsa

PDF'niz gerçek bir metin katmanına sahipse ama pdf-to-text gibi bir araç metni garip bir sırada üretiyorsa, sütunlar birleşmiş veya boşluklar çökmüşse, bu farklı, alakasız bir sorundur: metin nesneleri vardır ama sayfadaki okuma sıraları bir betiğin doğal olarak beklediği şekilde saklanmamıştır. Bu, çıkarmadan sonra temizlenecek bir düzen tuhaflığıdır, metnin eksik olduğunun bir işareti değildir ve düzeltmek için OCR gerektirmez.

Bu makaledeki araçlar

Sıkça sorulan sorular

PDF'im normal yazılmış bir belge gibi görünüyor ama hâlâ hiç metin seçemiyorum. Neden?

Büyük olasılıkla bir PDF olarak kaydedilmiş taranmış veya fotoğraflanmış bir sayfa, ya da kasıtlı olarak bir görsele düzleştirilmiş bir belgedir. Görsel olarak metin tabanlı bir PDF'den ayırt edilemeyebilir; fark yalnızca aramayı veya seçmeyi denediğinizde ortaya çıkar. Onu OCR'dan geçirmek, piksellerden gerçek, seçilebilir bir metin katmanı yeniden oluşturur.

OCR her dilde eşit derecede iyi çalışır mı?

Hayır. Doğruluk, o dil ve yazı için eğitilmiş bir model olup olmadığına ve taramanın kalitesine bağlıdır. Temiz, düz bir taramada iyi desteklenen diller güvenilir şekilde tanınır; el yazısı, düşük çözünürlüklü görseller veya daha az eğitim verisi olan diller daha fazla hata üretir. OCR çıktısı her zaman en iyi çaba esaslı bir yazıya dökümdür, ona güvenmeden önce hızlı bir gözden geçirmeye değer.

Kaynaklar