Nasıl yapılır
Taranmış bir PDF'yi aranabilir yapın
Taranmış bir PDF normal bir belge gibi görünür ama aslında bir sayfanın resmidir: Ctrl+F hiçbir şey bulmaz ve tek bir kelimeyi bile seçemez veya kopyalayamazsınız. PDF OCR aracı, dosyanın ne olduğunu değiştirmeden bunu düzeltir. Her sayfa görselini okur, karakterleri cihaz üzerinde bir OCR motoruyla tanır ve tanınan metni aynı görselin üzerine görünmez şekilde yerleştirir, böylece PDF hâlâ tam olarak öncekiyle aynı görünür ve yazdırılır ama artık aramaya ve metin seçimine yanıt verir. Dosya cihazınızdan asla ayrılmaz.
Adım adım
- PDF OCR aracını açın ve taranmış PDF'nizi bırakın. Yalnızca PDF dosyaları kabul edilir ve dosya 80 MB ile sınırlıdır; tipik çok sayfalı bir tarama bunun oldukça altındadır.
- Belgenin dilini açılır menüden seçin (İngilizce, Fransızca, Almanca, İspanyolca, Portekizce veya İtalyanca) ve isterseniz çıktı dosyası adını düzenleyin. Varsayılan, .pdf uzantısını otomatik olarak korur.
- Çalıştır'a tıklayın ve her sayfanın işlenmesini bekleyin. Araç bir sonrakine geçmeden önce her sayfa işlenir, OCR motorundan geçirilir ve kendi görünmez metin katmanı verilir, bu yüzden uzun bir belge tek bir sayfadan daha uzun sürer. Sonucu indirin: orijinaliyle aynı şekilde açılır ve yazdırılır, ama artık Ctrl+F, metin seçimi ve kopyala-yapıştır çalışır.
Aranabilir PDF mi, düz metin mi: gerçekte hangisine ihtiyacınız var
Bu araç ve düz OCR aracı, taranmış bir görseldeki metni tanıma gibi aynı temel sorunu çözer, ama farklı şeyleri korurlar. OCR aracı sayfa görselini atar ve size düz bir .txt dosyası geri verir: kelimeleri bir düzenleyiciye yapıştırmak, çevirmek veya metin olarak aramak istediğinizde ve belgenin orijinal görünümünü korumayı umursamadığınızda kullanın. Buradaki PDF OCR aracı orijinal PDF'yi, sayfa görselleriyle birlikte, tam olarak olduğu gibi korur ve altına yalnızca gizli bir metin katmanı ekler: belgenin hâlâ yazdırabileceğiniz, e-postayla gönderebileceğiniz veya arşivleyebileceğiniz bir PDF kalması gerektiğinde ama aynı zamanda arayabilmek veya ondan kopyalayabilmek istediğinizde kullanın. Hiçbir araç düzeni gerçek yazı tipleri ve tablolarla düzenlenebilir metin olarak yeniden oluşturmaz; ikisi de aynı tanınan metinden çalışır, yalnızca farklı şekilde paketlenir.
Sonuç neden taramaya bağlıdır ve sınırlar nerede
Tanıma doğruluğu, düz OCR'da olduğu gibi kaynak görselin kalitesini takip eder: 200 ila 300 DPI civarında temiz, düz bir tarama güvenilir şekilde tanınır, bulanık bir fotoğraf, eğik bir sayfa veya ağır gölgeler daha fazla yanlış okunan kelime üretir. Bir sayfa eğri çıktıysa, tanıma adımının düz metni okuması için OCR çalıştırmadan önce PDF Eğrilik Düzelt aracıyla düzeltin. Araç altı dili kapsar (İngilizce, Fransızca, Almanca, İspanyolca, Portekizce, İtalyanca); desteklenmeyen bir dildeki belge doğru tanınmayacaktır. İşlem tarayıcı sekmenizde sayfa sayfa çalışır, bu yüzden onlarca sayfalı bir belge iki sayfalık bir taramadan fark edilir derecede daha uzun sürer ve dosya 80 MB ile sınırlıdır. Sayfa görsellerinin kendisine dokunulmadığından, çıktı PDF de boyut olarak orijinaline benzeme eğilimindedir; sonrasında daha küçük bir dosyaya ihtiyacınız olursa, PDF Sıkıştırıcı'dan geçirin.
Görünmez metin katmanı nasıl oluşturulur
Her PDF sayfası önce tarayıcınızda bir canvas görseline rasterleştirilir, PDF'den Görsele aracının kullandığı aynı işleme adımı. OCR motoru (WebAssembly'ye derlenmiş Tesseract) o görseli okur ve tanınan her kelimeyi sınırlayıcı kutusuyla, sayfadaki konumuyla birlikte döndürür. Bu kelimeler daha sonra orijinal PDF sayfasının bir kopyasına, tanınan konumlarında ama sıfır opaklıkta çizilir, böylece görsel olarak hiçbir şey değişmez: gördüğünüz ve yazdırdığınız sayfa görseli, üzerinde duran, taranmış olanla aynıdır. Bir PDF görüntüleyicinin arama ve metin seçme özellikleri yalnızca bu görünmez metin katmanına bakar, bu yüzden dosya hiç farklı görünmeden aranabilir ve seçilebilir hale gelir. Bunların tümü, işleme, tanıma ve yeniden birleştirme, tarayıcı sekmeniz içinde gerçekleşir; PDF yerel diskten okunur ve hiçbir yere iletilmez.
Bu rehberde kullanılan araçlar
- PDF OCR · aranabilir hale getirTaranmış bir PDF'yi tamamen tarayıcınızda, yükleme yapmadan aranabilir ve seçilebilir bir PDF'ye dönüştürün.
- OCR · görüntü/PDF'den metneTaranmış görüntülerden veya PDF'lerden tamamen tarayıcınızda metin çıkarın, çevrimdışı çalışır, yükleme yok.
- Taranmış sayfaları düzeltEğri taranmış PDF'leri veya görüntüleri tamamen tarayıcınızda düzeltin, yükleme yok.
- PDF sıkıştırPDF dosya boyutunu, iç yapısını kayıpsız optimize ederek yükleme yapmadan küçültün.
Sıkça sorulan sorular
Aranabilir PDF hâlâ orijinal tarama gibi görünüp yazdırılacak mı?
Evet. Araç sayfa görselini hiçbir zaman değiştirmez; altına yalnızca görünmez bir metin katmanı ekler. Ekranda ve kâğıtta çıktı, bıraktığınız taramayla görsel olarak aynıdır. Değişen şey, bir görüntüleyicinin arama ve metin seçme araçlarının artık tanınan kelimeleri bulup yakalayabilmesidir, çünkü bu gizli katmandan okurlar.
Bu araç neden düz OCR aracıyla birlikte var?
Aynı tanıma adımından farklı ihtiyaçlara yanıt verirler. OCR aracı size düz bir metin dosyası verir, kelimeleri yapıştırmayı, düzenlemeyi veya çevirmeyi planlıyorsanız ve belgeyi PDF olarak korumaya ihtiyacınız yoksa istediğiniz budur. Bu araç, dosyayı orijinal sayfa görselleri sağlam kalacak şekilde bir PDF olarak korur, belgenin hâlâ olduğu gibi yazdırılması, arşivlenmesi veya e-postayla gönderilmesi gerektiğinde ama aynı zamanda ondan metin arayabilmek veya kopyalayabilmek istediğinizde istediğiniz budur.