Cara kerja OCR PDF · jadikan dapat dicari
PDF OCR mengubah PDF hasil pindaian, yang hanya berisi gambar halaman tanpa teks sungguhan, menjadi PDF yang dapat dicari: gambar halaman yang sama, ditambah lapisan teks tak terlihat yang diposisikan di atas setiap kata yang dikenali. Buka hasilnya di penampil PDF mana pun dan Anda kini bisa menggunakan Ctrl+F untuk mencari kata, memilih dan menyalin paragraf, atau membiarkan mesin pencari mengindeks dokumen tersebut, semua hal yang tidak bisa dilakukan pindaian biasa. Pengenalannya sendiri berjalan dengan tesseract.js (mesin OCR self-hosted yang sama yang dipakai alat OCR), dan rendering halaman berjalan dengan pdf.js; keduanya berjalan sepenuhnya di dalam tab browser Anda, dan file Anda tidak pernah diunggah.
Alat ini jujur soal apa yang bisa dan tidak bisa dilakukannya. Alat ini tidak merekonstruksi tata letak, tabel, atau fon, dan ini bukan pengonversi ke dokumen yang dapat diedit: halaman yang terlihat tetap berupa gambar, identik dengan pindaian sumbernya, dengan lapisan teks tersembunyi ditambahkan di baliknya. Akurasi pengenalan bergantung pada kualitas pindaian, panduan yang sama soal 200 DPI atau lebih, kontras tinggi, dan halaman lurus yang berlaku untuk mesin OCR mana pun. Jika Anda hanya butuh teks hasil ekstraksi biasa dan bukan PDF yang bisa dicari isinya, alat OCR menghasilkan file .txt sebagai gantinya dan lebih cepat untuk kebutuhan spesifik itu.