Artikel
Mengapa Anda tidak bisa menyalin teks dari sebagian PDF
Coba seleksi satu baris di sebuah PDF dan kata-katanya tersorot normal, siap disalin. Coba gestur yang sama di PDF lain dan tidak terjadi apa-apa, atau kursor menangkap seluruh halaman seperti sebuah foto, karena memang itulah adanya. Dua file yang terlihat identik di layar bisa dibangun dengan cara yang sama sekali berbeda di baliknya. Berikut cara mengetahui jenis PDF mana yang Anda miliki, dan apa yang harus dilakukan pada yang menolak untuk disalin.
Dua jenis halaman PDF yang berbeda
PDF dapat menyimpan sebuah halaman dengan dua cara yang sangat berbeda. Dalam PDF berbasis teks, setiap huruf adalah objek karakter dengan nilai Unicode, font, dan posisi, dengan cara yang sama seperti halaman web menyimpan teks: pembaca dapat menyeleksinya, mencarinya, dan pembaca layar dapat membacakannya dengan lantang. Dalam PDF berbasis gambar, halamannya adalah satu gambar datar, sering kali dihasilkan oleh pemindai, faks, atau langkah "print to PDF" yang diterapkan pada foto sebuah dokumen. Huruf-hurufnya terlihat sama di mata Anda, tetapi bagi format filenya tidak ada karakter di baliknya, hanya piksel.

Cara cepat mengetahui jenis mana yang Anda miliki
Tekan Ctrl+F atau Cmd+F dan cari kata yang jelas terlihat di halaman. Jika pencarian menemukannya dan menyorotnya, halaman itu memiliki lapisan teks sungguhan. Jika pencarian tidak menemukan apa pun di mana pun dalam dokumen, halamannya adalah gambar, tidak peduli seberapa tajam atau seberapa mirip dokumen yang diketik tampilannya. Menyeret mouse untuk menyeleksi satu baris memberikan jawaban yang sama: sorotan versus seleksi persegi panjang polos.
Merekonstruksi teks dengan OCR
Optical Character Recognition (OCR) membaca piksel halaman berbasis gambar dan mencocokkan bentuknya dengan model huruf terlatih untuk suatu bahasa, lalu membangun ulang lapisan teks dengan karakter yang dikenali diposisikan di tempat kemunculannya. Alat seperti OCR melakukan ini sepenuhnya di browser: tidak ada yang diunggah, dan hasilnya adalah file teks polos yang dapat Anda cari, salin, atau edit. Akurasinya bergantung pada sumbernya: pindaian yang bersih, lurus, dan beresolusi tinggi dalam bahasa yang didukung dengan baik dikenali secara andal, sementara halaman yang miring, buram, kontras rendah, atau tulisan tangan menghasilkan lebih banyak kesalahan, terkadang karakter yang salah atau kata yang salah dibaca.

Saat file sudah memiliki teks tetapi ekstraksinya terlihat salah
Jika PDF Anda memang memiliki lapisan teks sungguhan tetapi alat seperti PDF ke teks menghasilkan teks dalam urutan yang aneh, dengan kolom yang bergabung atau spasi yang menyusut, itu adalah masalah berbeda yang tidak berkaitan: objek teksnya ada tetapi urutan bacanya di halaman tidak tersimpan dengan cara yang secara alami diharapkan sebuah skrip. Itu adalah keanehan tata letak yang perlu dibersihkan setelah ekstraksi, bukan tanda bahwa teksnya hilang, dan tidak memerlukan OCR untuk memperbaikinya.
Alat dalam artikel ini
- OCR · gambar/PDF ke teksEkstrak teks dari gambar yang dipindai atau PDF sepenuhnya di browser Anda, berjalan offline, tanpa unggah.
- PDF ke teksEkstrak konten teks dari PDF dan unduh sebagai berkas .txt, tanpa mengunggah.
- OCR PDF · jadikan dapat dicariUbah PDF hasil pindaian menjadi PDF yang dapat dicari dan diseleksi, sepenuhnya di browser Anda, tanpa unggah.
Pertanyaan yang sering diajukan
PDF saya terlihat seperti dokumen ketik biasa tetapi saya masih tidak bisa menyeleksi teks apa pun. Mengapa?
Kemungkinan besar itu adalah halaman hasil pindaian atau foto yang disimpan sebagai PDF, atau dokumen yang sengaja diratakan menjadi gambar. Secara visual bisa tidak terbedakan dari PDF berbasis teks; perbedaannya baru muncul saat Anda mencoba mencari atau menyeleksinya. Menjalankannya melalui OCR membangun ulang lapisan teks sungguhan yang dapat diseleksi dari pikselnya.
Apakah OCR bekerja sama baiknya di semua bahasa?
Tidak. Akurasinya bergantung pada apakah ada model terlatih untuk bahasa dan skrip itu, dan pada kualitas pindaiannya. Bahasa yang didukung dengan baik pada pindaian yang bersih dan lurus dikenali secara andal; tulisan tangan, gambar beresolusi rendah, atau bahasa dengan data pelatihan yang lebih sedikit menghasilkan lebih banyak kesalahan. Hasil OCR selalu berupa transkripsi upaya terbaik, layak diperiksa ulang sekilas sebelum Anda mengandalkannya.