Tanpa unggah, 100% lokal, tanpa akun

Jadikan PDF hasil pindaian dapat dicari

Jatuhkan PDF hasil pindaian dan dapatkan kembali halaman yang sama dengan lapisan teks tak terlihat dan dapat dicari di atasnya. Pengenalan teks berjalan sepenuhnya di browser Anda (di perangkat, offline setelah pemuatan pertama), tidak ada yang diunggah.

Cara kerja OCR PDF · jadikan dapat dicari

PDF OCR mengubah PDF hasil pindaian, yang hanya berisi gambar halaman tanpa teks sungguhan, menjadi PDF yang dapat dicari: gambar halaman yang sama, ditambah lapisan teks tak terlihat yang diposisikan di atas setiap kata yang dikenali. Buka hasilnya di penampil PDF mana pun dan Anda kini bisa menggunakan Ctrl+F untuk mencari kata, memilih dan menyalin paragraf, atau membiarkan mesin pencari mengindeks dokumen tersebut, semua hal yang tidak bisa dilakukan pindaian biasa. Pengenalannya sendiri berjalan dengan tesseract.js (mesin OCR self-hosted yang sama yang dipakai alat OCR), dan rendering halaman berjalan dengan pdf.js; keduanya berjalan sepenuhnya di dalam tab browser Anda, dan file Anda tidak pernah diunggah.

Alat ini jujur soal apa yang bisa dan tidak bisa dilakukannya. Alat ini tidak merekonstruksi tata letak, tabel, atau fon, dan ini bukan pengonversi ke dokumen yang dapat diedit: halaman yang terlihat tetap berupa gambar, identik dengan pindaian sumbernya, dengan lapisan teks tersembunyi ditambahkan di baliknya. Akurasi pengenalan bergantung pada kualitas pindaian, panduan yang sama soal 200 DPI atau lebih, kontras tinggi, dan halaman lurus yang berlaku untuk mesin OCR mana pun. Jika Anda hanya butuh teks hasil ekstraksi biasa dan bukan PDF yang bisa dicari isinya, alat OCR menghasilkan file .txt sebagai gantinya dan lebih cepat untuk kebutuhan spesifik itu.

Cara menggunakan OCR PDF · jadikan dapat dicari, langkah demi langkah

  1. Jatuhkan PDF hasil pindaian Anda (satu gambar halaman per halaman, tanpa lapisan teks yang sudah ada) ke area unggah.
  2. Pilih bahasa utama dokumen dari dropdown bahasa.
  3. Jika ini pertama kali Anda menggunakan alat ini, tunggu mesin tesseract.js diunduh (ini hanya terjadi sekali).
  4. Klik jalankan dan tunggu setiap halaman dirender dan dikenali secara berurutan.
  5. Unduh PDF yang dapat dicari: tampilan sama, kini dengan lapisan teks di baliknya.

Kasus penggunaan umum

  • Kontrak hasil pindaian perlu dibuat dapat dicari agar klausul tertentu bisa ditemukan dengan Ctrl+F alih-alih membaca setiap halaman.
  • Sekumpulan faktur hasil pindaian perlu dimasukkan ke arsip dokumen yang indeks pencariannya hanya membaca teks PDF sungguhan.
  • Formulir yang difoto atau dipindai perlu label cetaknya bisa dipilih agar sebuah paragraf bisa disalin ke email.
  • Kumpulan laporan hasil pindaian dalam bahasa Jerman perlu pencarian teks lengkap; pilih Jerman sebagai bahasa sebelum menjalankan alat ini.

Pertanyaan yang sering diajukan

Apa bedanya dengan alat OCR biasa?

Alat OCR mengekstrak teks biasa ke dalam file .txt, membuang tata letak dan gambar asli sepenuhnya. PDF OCR mempertahankan gambar halaman PDF asli persis seperti tampilannya dan menambahkan lapisan teks tak terlihat yang dapat dicari di baliknya. Gunakan OCR jika Anda hanya butuh kata-katanya; gunakan PDF OCR jika Anda ingin mempertahankan dokumen sebagai PDF tetapi membuatnya dapat dicari dan dipilih.

Apakah PDF hasilnya akan terlihat berbeda dari pindaian saya?

Tidak. Setiap halaman dirender dari PDF sumber Anda dan disematkan ulang sebagai gambar, identik piksel demi piksel dengan pindaian asli (dengan toleransi pengodean ulang JPEG). Kata-kata yang dikenali digambar di atasnya dengan opasitas nol, sehingga tidak ada yang terlihat baru; pencarian teks atau pemilihan teks adalah satu-satunya cara untuk menyadari lapisan tambahan ini.

Apakah alat ini merekonstruksi tabel, kolom, atau fon?

Tidak. Hasilnya mempertahankan halaman sebagai satu gambar datar; lapisan teks tak terlihat mengikuti posisi kata yang dikenali tetapi tidak mempertahankan struktur tabel, urutan baca multi-kolom di luar yang disimpulkan tesseract.js, atau fon aslinya. Ini adalah lapisan kemampuan pencarian, bukan konversi dokumen menjadi teks yang dapat diedit.

Apakah dokumen hasil pindaian saya dikirim ke mana pun selama pemrosesan?

Tidak. Setelah mesin tesseract.js dan paket bahasa diunduh dari situs ini (pengambilan satu kali berukuran beberapa megabyte saat pertama kali digunakan), setiap rendering halaman dan setiap pengenalan berjalan sepenuhnya di tab browser Anda. Kontrak hasil pindaian, catatan medis, atau dokumen sensitif lainnya tidak pernah sampai ke server.

Mengapa PDF yang panjang butuh waktu lebih lama untuk diproses?

Setiap halaman dirender menjadi gambar dan OCR dijalankan pada gambar tersebut satu per satu, semuanya di dalam tab browser Anda, sehingga waktu pemrosesan bertambah seiring jumlah halaman. Bilah kemajuan mencerminkan progres per halaman yang sesungguhnya, dan file dibatasi hingga 80 MB agar seluruh alur tetap sesuai anggaran memori tab browser.

Bagaimana jika PDF saya sudah memiliki teks yang dapat dipilih?

Menjalankan OCR pada PDF yang sudah membawa lapisan teks sungguhan tidak perlu: membukanya di penampil dan menekan Ctrl+F sudah berfungsi. Alat ini ditujukan untuk PDF yang terdiri dari gambar halaman tanpa teks yang mendasarinya, hasil umum dari pemindai flatbed atau "cetak ke PDF" dari dokumen yang difoto.