Cara OCR · imej/PDF ke teks berfungsi
OCR menukar imej yang diimbas atau PDF berasaskan imej kepada teks yang boleh disalin, dicari dan diedit, menggunakan tesseract.js yang berjalan sepenuhnya di dalam pelayar anda. Anda memilih bahasa dokumen dari pemilih, model bahasa yang berkaitan dimuat turun ke pelayar anda sekali, dan semua pengecaman seterusnya berjalan tanpa talian daripada model yang dicache tersebut. Fail yang diimbas tidak pernah dihantar ke mana-mana pelayan semasa penukaran.
Ketepatan pengecaman bergantung kuat pada kualiti imbasan. Imbasan bersih dan berkontras tinggi pada 200 DPI atau ke atas, dengan bunyi latar belakang yang minimum dan penjajaran halaman yang lurus, menghasilkan keputusan terbaik. JPEG yang kabur, beresolusi rendah atau termampat berat, halaman dengan lajur atau susun atur yang kompleks, dan teks tulisan tangan semuanya mengurangkan ketepatan. Alat ini menghasilkan blok teks biasa; untuk output berstruktur seperti jadual yang dikekalkan atau susun atur berbilang lajur, pemprosesan selepas diperlukan. Menjalankan alat PDF Deskew pada imbasan yang condong sebelum OCR biasanya meningkatkan kadar pengecaman.