Artikel
Mengapa anda tidak boleh menyalin teks daripada sesetengah PDF
Cuba pilih satu baris dalam satu PDF dan perkataan itu diserlahkan secara biasa, sedia untuk disalin. Cuba gerak isyarat yang sama dalam PDF lain dan tiada apa berlaku, atau kursor itu mengambil seluruh halaman seperti fotograf, kerana itu tepat apa ia sebenarnya. Dua fail yang kelihatan sama pada skrin boleh dibina secara sama sekali berbeza di bawahnya. Inilah cara memberitahu jenis mana yang anda ada, dan apa patut dilakukan bagi yang menolak penyalinan.
Dua jenis halaman PDF yang berbeza
PDF boleh menyimpan halaman dengan dua cara yang sangat berbeza. Dalam PDF berasaskan teks, setiap huruf ialah objek aksara dengan nilai Unicode, fon dan kedudukan, cara yang sama halaman web menyimpan teks: pemapar boleh memilihnya, mencarinya, dan pembaca skrin boleh membacanya dengan kuat. Dalam PDF berasaskan imej, halaman itu satu gambar rata, selalunya dihasilkan oleh pengimbas, faks, atau langkah "cetak ke PDF" yang diterapkan pada foto dokumen. Huruf itu kelihatan sama pada mata anda, tetapi bagi format fail tiada aksara di bawahnya, hanya piksel.

Cara pantas memberitahu yang mana anda ada
Tekan Ctrl+F atau Cmd+F dan cari perkataan yang anda boleh lihat dengan jelas pada halaman itu. Jika carian menemuinya dan menyerlahkannya, halaman itu mempunyai lapisan teks sebenar. Jika carian tidak menemui apa-apa di mana-mana dalam dokumen, halaman itu ialah imej, tidak kira setajam mana atau setepat mana ia menyerupai dokumen taip. Menyeret tetikus untuk memilih baris memberikan jawapan yang sama: penyerlahan berbanding pemilihan segi empat biasa.
Membina semula teks dengan OCR
Pengecaman Aksara Optik (OCR) membaca piksel halaman berasaskan imej dan memadankan bentuk terhadap model terlatih bagi huruf untuk bahasa tertentu, kemudian membina semula lapisan teks dengan aksara yang dikenal pasti diletakkan di mana ia muncul. Alat seperti ocr melakukan ini sepenuhnya dalam pelayar: tiada apa dimuat naik, dan keluarannya ialah fail teks biasa yang boleh anda cari, salin atau sunting. Ketepatan bergantung pada sumber: imbasan yang bersih, lurus, resolusi tinggi dalam bahasa yang disokong baik mengenal pasti dengan boleh dipercayai, manakala halaman senget, kabur, kontras rendah atau tulisan tangan menghasilkan lebih banyak kesilapan, kadangkala aksara yang salah atau perkataan yang salah baca.

Apabila fail itu sudah mempunyai teks tetapi pengekstrakan kelihatan salah
Jika PDF anda memang mempunyai lapisan teks sebenar tetapi alat seperti pdf-ke-teks menghasilkan teks dalam susunan yang pelik, dengan lajur bercampur atau jarak runtuh, itu isu berbeza yang tidak berkaitan: objek teks itu wujud tetapi susunan bacaannya pada halaman tidak disimpan cara yang dijangka semula jadi oleh skrip. Itu keanehan susun atur untuk dibersihkan selepas pengekstrakan, bukan tanda bahawa teks itu hilang, dan ia tidak memerlukan OCR untuk membetulkannya.
Alat dalam artikel ini
- OCR · imej/PDF ke teksEkstrak teks daripada imej imbasan atau PDF sepenuhnya dalam pelayar anda, berjalan luar talian, tiada muat naik.
- PDF ke teksEkstrak kandungan teks daripada PDF dan muat turun sebagai fail .txt, tanpa muat naik.
- OCR PDF · jadikan boleh dicariTukar PDF imbasan kepada PDF yang boleh dicari dan dipilih sepenuhnya dalam pelayar anda, tanpa muat naik.
Soalan lazim
PDF saya kelihatan seperti dokumen taip biasa tetapi saya masih tidak boleh memilih apa-apa teks. Mengapa?
Kemungkinan besar ia halaman yang diimbas atau difoto disimpan sebagai PDF, atau dokumen yang diratakan menjadi imej dengan sengaja. Secara visual ia boleh tidak dapat dibezakan daripada PDF berasaskan teks; perbezaannya hanya muncul apabila anda cuba mencari atau memilihnya. Menjalankannya melalui OCR membina semula lapisan teks sebenar yang boleh dipilih daripada piksel itu.
Adakah OCR berfungsi sama baiknya dalam setiap bahasa?
Tidak. Ketepatan bergantung pada sama ada model terlatih wujud bagi bahasa dan skrip itu, dan pada kualiti imbasan. Bahasa yang disokong baik pada imbasan yang bersih dan lurus mengenal pasti dengan boleh dipercayai; tulisan tangan, imej resolusi rendah, atau bahasa dengan data latihan yang kurang menghasilkan lebih banyak ralat. Keluaran OCR sentiasa transkripsi usaha terbaik, berbaloi disemak dengan cepat sebelum anda bergantung padanya.