Tiada muat naik, 100% setempat, tiada akaun

OCR, ekstrak teks daripada imej & PDF

Lepaskan imej atau PDF dan dapatkan teks yang dikenali. OCR berjalan sepenuhnya dalam pelayar anda (pada peranti, luar talian selepas muatan pertama), tiada apa dimuat naik.

Cara OCR · imej/PDF ke teks berfungsi

OCR menukar imej yang diimbas atau PDF berasaskan imej kepada teks yang boleh disalin, dicari dan diedit, menggunakan tesseract.js yang berjalan sepenuhnya di dalam pelayar anda. Anda memilih bahasa dokumen dari pemilih, model bahasa yang berkaitan dimuat turun ke pelayar anda sekali, dan semua pengecaman seterusnya berjalan tanpa talian daripada model yang dicache tersebut. Fail yang diimbas tidak pernah dihantar ke mana-mana pelayan semasa penukaran.

Ketepatan pengecaman bergantung kuat pada kualiti imbasan. Imbasan bersih dan berkontras tinggi pada 200 DPI atau ke atas, dengan bunyi latar belakang yang minimum dan penjajaran halaman yang lurus, menghasilkan keputusan terbaik. JPEG yang kabur, beresolusi rendah atau termampat berat, halaman dengan lajur atau susun atur yang kompleks, dan teks tulisan tangan semuanya mengurangkan ketepatan. Alat ini menghasilkan blok teks biasa; untuk output berstruktur seperti jadual yang dikekalkan atau susun atur berbilang lajur, pemprosesan selepas diperlukan. Menjalankan alat PDF Deskew pada imbasan yang condong sebelum OCR biasanya meningkatkan kadar pengecaman.

Cara menggunakan OCR · imej/PDF ke teks, langkah demi langkah

  1. Lepaskan imej yang diimbas (PNG, JPG, TIFF) atau PDF berasaskan imej ke kawasan muat naik.
  2. Pilih bahasa utama dokumen daripada senarai juntai bawah bahasa.
  3. Jika ini kali pertama anda menggunakan bahasa tersebut, tunggu model bahasa dimuat turun (ini berlaku sekali sahaja).
  4. Klik extract text dan tunggu tesseract.js memproses setiap halaman.
  5. Salin teks yang dikenali atau muat turunnya sebagai fail teks biasa.

Kes penggunaan biasa

  • Resit yang diimbas perlu diekstrak item barisnya ke dalam hamparan; jalankan OCR untuk mendapatkan teks, kemudian tampal ke dalam perisian perakaunan anda.
  • Arkib artikel jurnal yang diimbas perlu dibuat boleh dicari teksnya; tukar setiap satu kepada teks dengan OCR untuk pengindeksan.
  • Papan putih yang difotografi daripada mesyuarat mengandungi nota yang perlu diubah menjadi dokumen yang boleh diedit.
  • Dokumen lama yang diimbas dalam bahasa Jerman perlu diekstrak teksnya untuk terjemahan; pilih Jerman sebagai bahasa sebelum menjalankan OCR.

Soalan lazim

Mengapa saya perlu memuat turun model bahasa sebelum OCR berfungsi?

tesseract.js menggunakan fail data rangkaian neural yang dilatih khusus untuk setiap bahasa. Fail-fail ini adalah beberapa megabait setiap satu dan dimuat turun sekali daripada laman ini (kami menghoskan fail-fail ini sendiri, tanpa CDN pihak ketiga) pada kali pertama anda memilih bahasa tersebut. Selepas muat turun awal, model dicache oleh pelayar anda, dan semua pengecaman seterusnya untuk bahasa tersebut berjalan sepenuhnya tanpa talian.

Apakah faktor yang paling mempengaruhi ketepatan OCR?

Resolusi imbasan (minimum 200 DPI, 300 DPI disyorkan), ketajaman imej, kontras antara teks dan latar belakang, dan sama ada halaman lurus semuanya sangat mempengaruhi ketepatan. Imbasan JPEG yang termampat berat, fon yang sangat kecil, dan halaman dengan orientasi campuran atau susun atur lajur yang kompleks adalah punca ralat pengecaman yang paling biasa.

Bolehkah OCR membaca teks tulisan tangan?

tesseract.js dilatih terutamanya pada teks bercetak. Ketepatan pengecaman tulisan tangan secara amnya rendah dan tidak boleh dipercayai, terutamanya untuk skrip kursif. Untuk dokumen tulisan tangan, alat pengecaman tulisan tangan khusus menghasilkan keputusan yang lebih baik.

Adakah dokumen yang diimbas saya dihantar ke mana-mana semasa pengekstrakan teks?

Tidak. Selepas model bahasa dicache, setiap tugas pengecaman berlaku sepenuhnya dalam pelayar anda menggunakan tesseract.js. Dokumen yang diimbas mungkin mengandungi kandungan peribadi atau sulit; pemprosesan setempat sahaja ini bermakna kandungan tersebut tidak pernah sampai ke pelayan.

Adakah alat ini mengekalkan susun atur imbasan asal?

Output adalah aliran teks biasa mengikut urutan bacaan. Jadual, lajur, pengepala dan elemen susun atur lain tidak dikekalkan sebagai struktur; alat menghasilkan kandungan teks sahaja. Untuk output yang mengekalkan susun atur, saluran paip OCR yang lebih canggih dengan analisis susun atur diperlukan.

Bolehkah saya menjalankan OCR pada PDF yang sudah mengandungi teks yang boleh dipilih?

Alat ini boleh memproses PDF berasaskan imej di mana setiap halaman adalah imej raster tanpa teks terbenam. Jika PDF anda sudah mempunyai lapisan teks (anda boleh memilih dan menyalin teks dalam pemapar), menjalankan OCR adalah tidak perlu; lapisan teks sedia ada memberikan maklumat yang sama tanpa langkah pengecaman.

Bolehkah saya menjalankan OCR pada foto yang diambil dengan telefon saya?

Ya, dan tesseract.js berfungsi pada pelayar mudah alih, jadi anda boleh membuka halaman ini walaupun pada telefon yang mengambil gambar itu. Foto yang diambil pada sudut atau dengan pencahayaan tidak sekata dikenali dengan lebih buruk berbanding imbasan flatbed; meluruskan gambar dan memangkas latar belakang dahulu membantu.

Adakah saya perlu mencipta akaun atau membayar untuk menggunakan OCR?

Tidak. Tiada pendaftaran dan tiada bayaran. Satu-satunya muat turun yang terlibat ialah model bahasa sekali sahaja yang diperlukan oleh tesseract.js, iaitu muat turun enjin sekali sahaja, bukan langganan atau tembok bayaran.