Tutorial
Jadikan PDF imbasan boleh dicari
PDF imbasan kelihatan seperti dokumen biasa tetapi sebenarnya gambar sesebuah halaman: Ctrl+F tidak menemui apa-apa, dan anda tidak boleh memilih atau menyalin satu perkataan pun. Alat PDF OCR membetulkan ini tanpa mengubah apa fail itu sebenarnya. Ia membaca setiap imej halaman, mengenal pasti aksara dengan enjin OCR di peranti, dan meletakkan teks yang dikenal pasti secara tidak kelihatan di atas imej yang sama, jadi PDF itu masih kelihatan dan dicetak sama seperti dahulu tetapi kini bertindak balas kepada carian dan pemilihan teks. Fail itu tidak pernah meninggalkan peranti anda.
Langkah demi langkah
- Buka alat PDF OCR dan letakkan PDF imbasan anda. Hanya fail PDF diterima, dan fail dihadkan pada 80 MB; imbasan berbilang halaman biasa jauh di bawah itu.
- Pilih bahasa dokumen daripada menu lungsur (Inggeris, Perancis, Jerman, Sepanyol, Portugis atau Itali) dan, jika anda mahu, sunting nama fail keluaran. Lalai itu mengekalkan sambungan .pdf secara automatik.
- Klik Jalankan dan tunggu setiap halaman diproses. Setiap halaman dirender, dijalankan melalui enjin OCR dan diberikan lapisan teks tidak kelihatannya sendiri sebelum alat itu beralih ke halaman seterusnya, jadi dokumen yang panjang mengambil masa lebih lama daripada satu halaman. Muat turun hasilnya: ia dibuka dan dicetak sama seperti asal, tetapi Ctrl+F, pemilihan teks dan salin-tampal kini berfungsi.
PDF boleh dicari atau teks biasa: mana satu yang anda benar-benar perlukan
Alat ini dan alat OCR biasa menyelesaikan masalah asas yang sama, mengenal pasti teks dalam imej imbasan, tetapi mereka mengekalkan perkara yang berbeza. Alat OCR membuang imej halaman dan mengembalikan fail .txt biasa: gunakan apabila anda mahu menampal perkataan itu ke dalam editor, menterjemahkannya atau mencarinya sebagai teks, dan anda tidak kisah tentang mengekalkan rupa asal dokumen. Alat PDF OCR di sini mengekalkan PDF asal betul-betul seperti sedia ada, imej halaman dan segalanya, dan hanya menambah lapisan teks tersembunyi di bawahnya: gunakan apabila dokumen perlu kekal sebagai PDF yang masih boleh anda cetak, e-mel atau arkibkan, tetapi anda juga mahu dapat mencari atau menyalin daripadanya. Tiada satu alat pun membina semula susun atur sebagai teks boleh sunting dengan fon dan jadual sebenar; kedua-duanya berfungsi daripada teks yang dikenal pasti sama, hanya dibungkus secara berbeza.
Mengapa hasilnya bergantung pada imbasan, dan di mana had-hadnya
Ketepatan pengenalan mengikut kualiti imej sumber, sama seperti OCR biasa: imbasan yang bersih dan lurus sekitar 200 hingga 300 DPI mengenal pasti dengan boleh dipercayai, manakala foto kabur, halaman senget atau bayang tebal menghasilkan lebih banyak perkataan yang salah baca. Jika halaman keluar senget, luruskan dahulu dengan alat pelurus PDF supaya langkah pengenalan membaca teks yang rata. Alat ini meliputi enam bahasa (Inggeris, Perancis, Jerman, Sepanyol, Portugis, Itali); dokumen dalam bahasa yang tidak disokong tidak akan dikenal pasti dengan betul. Pemprosesan berjalan halaman demi halaman dalam tab pelayar anda, jadi dokumen dengan puluhan halaman mengambil masa yang jauh lebih lama berbanding imbasan dua halaman, dan fail dihadkan pada 80 MB. PDF keluaran juga cenderung serupa saiznya dengan asal, kerana imej halaman itu sendiri tidak disentuh; jika anda memerlukan fail yang lebih kecil selepas itu, jalankan melalui pemampat PDF.
Cara lapisan teks tidak kelihatan itu dibina
Setiap halaman PDF mula-mula dirasterkan menjadi imej kanvas dalam pelayar anda, langkah rendering yang sama digunakan oleh alat PDF ke imej. Enjin OCR (Tesseract, dikompil kepada WebAssembly) membaca imej itu dan mengembalikan setiap perkataan yang dikenal pasti berserta kotak sempadannya, kedudukannya pada halaman. Perkataan itu kemudian dilukis semula ke atas salinan halaman PDF asal pada kedudukan yang dikenal pasti, tetapi pada kelegapan sifar, jadi tiada apa-apa berubah secara visual: imej halaman yang anda lihat dan cetak adalah yang sama dengan yang diimbas, duduk di atas. Ciri carian dan pemilihan teks pemapar PDF hanya melihat lapisan teks tidak kelihatan itu, itulah sebabnya fail itu menjadi boleh dicari dan dipilih tanpa kelihatan berbeza. Semua ini, rendering, pengenalan dan penyusunan semula, berlaku di dalam tab pelayar anda; PDF dibaca daripada cakera setempat dan tidak pernah dihantar ke mana-mana.
Alat yang digunakan dalam panduan ini
- OCR PDF · jadikan boleh dicariTukar PDF imbasan kepada PDF yang boleh dicari dan dipilih sepenuhnya dalam pelayar anda, tanpa muat naik.
- OCR · imej/PDF ke teksEkstrak teks daripada imej imbasan atau PDF sepenuhnya dalam pelayar anda, berjalan luar talian, tiada muat naik.
- Luruskan halaman imbasanLuruskan PDF imbasan atau imej yang senget sepenuhnya dalam pelayar anda, tiada muat naik.
- Mampatkan PDFKurangkan saiz fail PDF dengan mengoptimumkan struktur dalaman secara lossless, tanpa muat naik.
Soalan lazim
Adakah PDF yang boleh dicari itu masih kelihatan dan dicetak betul-betul seperti imbasan asal?
Ya. Alat itu tidak pernah mengubah suai imej halaman; ia hanya menambah lapisan teks tidak kelihatan di bawahnya. Pada skrin dan di atas kertas, keluarannya identik secara visual dengan imbasan yang anda letakkan. Yang berubah ialah alat carian dan pemilihan teks pemapar kini dapat menemui dan mengambil perkataan yang dikenal pasti, kerana ia membaca daripada lapisan tersembunyi itu.
Mengapa alat ini wujud bersama alat OCR biasa?
Mereka menjawab keperluan berbeza daripada langkah pengenalan yang sama. Alat OCR memberikan anda fail teks biasa, iaitu apa yang anda mahu jika anda merancang untuk menampal, menyunting atau menterjemah perkataan itu dan tidak perlu mengekalkan dokumen sebagai PDF. Alat ini mengekalkan fail sebagai PDF dengan imej halaman asal utuh, iaitu apa yang anda mahu jika dokumen masih perlu dicetak, diarkibkan atau die-mel seadanya, tetapi anda juga mahu dapat mencari atau menyalin teks daripadanya.