Tutorial
Jadikan PDF hasil pindaian dapat dicari
PDF hasil pindaian terlihat seperti dokumen biasa tetapi sebenarnya adalah gambar sebuah halaman: Ctrl+F tidak menemukan apa pun, dan Anda tidak dapat menyeleksi atau menyalin satu kata pun. Alat OCR PDF memperbaiki ini tanpa mengubah jenis file itu sendiri. Alat ini membaca gambar setiap halaman, mengenali karakternya dengan mesin OCR di perangkat, dan meletakkan teks yang dikenali secara tak terlihat di atas gambar yang sama, sehingga PDF tetap tampil dan tercetak persis seperti sebelumnya tetapi kini merespons pencarian dan seleksi teks. File tidak pernah meninggalkan perangkat Anda.
Langkah demi langkah
- Buka alat OCR PDF dan jatuhkan PDF hasil pindaian Anda. Hanya file PDF yang diterima, dan file dibatasi hingga 80 MB; pindaian multi-halaman biasa jauh di bawah batas itu.
- Pilih bahasa dokumen dari menu tarik-turun (Inggris, Prancis, Jerman, Spanyol, Portugis, atau Italia) dan, jika mau, ubah nama file keluaran. Nilai default secara otomatis mempertahankan ekstensi .pdf.
- Klik Jalankan dan tunggu setiap halaman diproses. Setiap halaman dirender, dijalankan melalui mesin OCR, dan diberi lapisan teks tak terlihatnya sendiri sebelum alat ini beralih ke halaman berikutnya, sehingga dokumen yang panjang membutuhkan waktu lebih lama daripada satu halaman saja. Unduh hasilnya: hasil ini terbuka dan tercetak identik dengan aslinya, tetapi Ctrl+F, seleksi teks, dan salin-tempel kini berfungsi.
PDF yang dapat dicari atau teks polos: mana yang sebenarnya Anda butuhkan
Alat ini dan alat OCR biasa memecahkan masalah dasar yang sama, yaitu mengenali teks dalam gambar hasil pindaian, tetapi keduanya mempertahankan hal yang berbeda. Alat OCR membuang gambar halaman dan mengembalikan file .txt polos: gunakan saat Anda ingin menempelkan kata-katanya ke editor, menerjemahkannya, atau mencarinya sebagai teks, dan Anda tidak peduli mempertahankan tampilan asli dokumen. Alat OCR PDF di sini mempertahankan PDF asli persis apa adanya, lengkap dengan gambar halamannya, dan hanya menambahkan lapisan teks tersembunyi di bawahnya: gunakan saat dokumen perlu tetap berupa PDF yang masih bisa Anda cetak, kirim lewat email, atau arsipkan, tetapi Anda juga ingin dapat mencari atau menyalin teks darinya. Tidak satu pun dari kedua alat ini merekonstruksi tata letak menjadi teks yang dapat diedit dengan font dan tabel asli; keduanya bekerja dari teks hasil pengenalan yang sama, hanya dikemas secara berbeda.
Mengapa hasilnya bergantung pada pindaian, dan di mana batasannya
Akurasi pengenalan mengikuti kualitas gambar sumber, sama seperti pada OCR biasa: pindaian yang bersih dan lurus sekitar 200 hingga 300 DPI dikenali secara andal, sementara foto buram, halaman miring, atau bayangan tebal menghasilkan lebih banyak kata yang salah dikenali. Jika sebuah halaman keluar miring, luruskan dulu dengan alat Luruskan halaman yang dipindai sebelum menjalankan OCR agar tahap pengenalan membaca teks yang lurus. Alat ini mencakup enam bahasa (Inggris, Prancis, Jerman, Spanyol, Portugis, Italia); dokumen dalam bahasa yang tidak didukung tidak akan dikenali dengan benar. Pemrosesan berjalan per halaman di tab browser Anda, sehingga dokumen dengan puluhan halaman membutuhkan waktu yang jauh lebih lama daripada pindaian dua halaman, dan file dibatasi hingga 80 MB. PDF hasilnya juga cenderung berukuran mirip dengan aslinya, karena gambar halamannya sendiri tidak disentuh; jika Anda membutuhkan file yang lebih kecil setelahnya, jalankan melalui Kompres PDF.
Bagaimana lapisan teks tak terlihat dibangun
Setiap halaman PDF pertama-tama dirasterisasi menjadi gambar canvas di browser Anda, tahap render yang sama yang digunakan alat PDF ke gambar. Mesin OCR (Tesseract, dikompilasi ke WebAssembly) membaca gambar itu dan mengembalikan setiap kata yang dikenali beserta kotak batasnya, yaitu posisinya di halaman. Kata-kata itu kemudian digambar kembali ke salinan halaman PDF asli pada posisi yang dikenali, tetapi dengan opasitas nol, sehingga tidak ada yang berubah secara visual: gambar halaman yang Anda lihat dan cetak adalah gambar hasil pindaian yang sama, duduk di atasnya. Fitur pencarian dan seleksi teks pembaca PDF hanya melihat lapisan teks tak terlihat itu, itulah sebabnya file menjadi dapat dicari dan diseleksi tanpa tampak berbeda sama sekali. Semua ini, rendering, pengenalan, dan penyusunan ulang, terjadi di dalam tab browser Anda; PDF dibaca dari disk lokal dan tidak pernah dikirim ke mana pun.
Alat yang digunakan dalam panduan ini
- OCR PDF · jadikan dapat dicariUbah PDF hasil pindaian menjadi PDF yang dapat dicari dan diseleksi, sepenuhnya di browser Anda, tanpa unggah.
- OCR · gambar/PDF ke teksEkstrak teks dari gambar yang dipindai atau PDF sepenuhnya di browser Anda, berjalan offline, tanpa unggah.
- Luruskan halaman yang dipindaiLuruskan PDF yang dipindai miring atau gambar sepenuhnya di browser Anda, tanpa unggah.
- Kompres PDFKurangi ukuran file PDF dengan mengoptimalkan struktur internalnya secara lossless, tanpa upload.
Pertanyaan yang sering diajukan
Apakah PDF yang dapat dicari itu masih tampil dan tercetak persis seperti pindaian aslinya?
Ya. Alat ini tidak pernah mengubah gambar halaman; ia hanya menambahkan lapisan teks tak terlihat di bawahnya. Di layar dan di kertas, hasilnya identik secara visual dengan pindaian yang Anda jatuhkan. Yang berubah adalah fitur pencarian dan seleksi teks pembaca kini dapat menemukan dan mengambil kata-kata yang dikenali, karena fitur itu membaca dari lapisan tersembunyi tersebut.
Mengapa alat ini ada berdampingan dengan alat OCR biasa?
Keduanya menjawab kebutuhan berbeda dari tahap pengenalan yang sama. Alat OCR memberi Anda file teks polos, yang Anda inginkan jika berencana menempelkan, mengedit, atau menerjemahkan kata-katanya dan tidak perlu mempertahankan dokumen sebagai PDF. Alat ini mempertahankan file sebagai PDF dengan gambar halaman asli tetap utuh, yang Anda inginkan jika dokumen masih perlu dicetak, diarsipkan, atau dikirim lewat email apa adanya, tetapi Anda juga ingin dapat mencari atau menyalin teks darinya.