Cara kerja OCR · gambar/PDF ke teks
OCR mengonversi gambar pindaian atau PDF berbasis gambar menjadi teks yang dapat disalin, dicari, dan diedit, menggunakan tesseract.js yang berjalan sepenuhnya di dalam browser Anda. Anda memilih bahasa dokumen dari selektor, model bahasa yang relevan diunduh ke browser Anda sekali, dan semua pengenalan berikutnya berjalan secara offline dari model yang di-cache tersebut. Berkas pindaian Anda tidak pernah dikirim ke server mana pun selama konversi.
Akurasi pengenalan sangat bergantung pada kualitas pindaian. Pindaian bersih dengan kontras tinggi pada 200 DPI atau lebih, dengan gangguan latar belakang minimal dan penyelarasan halaman yang lurus, menghasilkan hasil terbaik. JPEG yang buram, beresolusi rendah, atau sangat terkompresi, halaman dengan kolom atau tata letak yang kompleks, dan teks tulisan tangan semuanya mengurangi akurasi. Alat ini menghasilkan blok teks biasa; untuk keluaran terstruktur seperti tabel atau tata letak multi-kolom yang dipertahankan, diperlukan pasca-pemrosesan. Menjalankan alat PDF Deskew pada pindaian yang miring sebelum OCR biasanya meningkatkan tingkat pengenalan.