OCR · görüntü/PDF'den metne nasıl çalışır
OCR, taranmış bir görüntüyü ya da görüntü tabanlı PDF'i kopyalayabileceğiniz, arayabileceğiniz ve düzenleyebileceğiniz metne dönüştürür; bunun için tamamen tarayıcınızın içinde çalışan tesseract.js kullanır. Seçiciden belge dilini seçersiniz, ilgili dil modeli tarayıcınıza bir kez indirilir ve sonraki tüm tanıma işlemleri bu önbelleğe alınmış modelden çevrimdışı olarak çalışır. Taranmış dosyalarınız dönüştürme sırasında hiçbir sunucuya iletilmez.
Tanıma doğruluğu, tarama kalitesine güçlü biçimde bağlıdır. 200 DPI ve üzeri temiz, yüksek kontrastlı taramalar, minimal arka plan gürültüsü ve düz sayfa hizalamasıyla en iyi sonuçlar elde edilir. Bulanık, düşük çözünürlüklü ya da aşırı sıkıştırılmış JPEG'ler, sütunlu ya da karmaşık düzeni olan sayfalar ve el yazısı metin doğruluğu düşürür. Araç düz metin bloğu çıktısı verir; tablo korumalı ya da çok sütunlu çıktı gibi yapılandırılmış sonuçlar için işleme sonrası adımlar gereklidir. OCR öncesinde eğri taramalarda PDF Eğikliği Gider aracının çalıştırılması tanıma oranlarını artırır.