Tanpa unggah, 100% lokal, tanpa akun

PDF → Ekstraksi teks

Ekstrak semua teks yang dapat dibaca dari PDF Anda. Unduh sebagai berkas .txt. Semuanya tetap di browser Anda, tidak ada berkas yang dikirim ke server.

Cara kerja PDF ke teks

PDF ke Teks mengekstrak lapisan teks yang ada dari PDF dan menyimpannya sebagai berkas .txt biasa. Ekstraksi dilakukan oleh pdf.js di dalam browser Anda, membaca objek konten teks yang disematkan dalam aliran halaman PDF. Dokumen tidak pernah meninggalkan perangkat Anda; hasilnya dirakit secara lokal dan ditawarkan sebagai unduhan langsung.

Alat ini membaca lapisan teks yang sudah ada dalam berkas. Jika PDF Anda dibuat oleh pengolah kata atau alat ekspor, hampir pasti memiliki lapisan teks dan ekstraksi akan berjalan dengan baik. Jika PDF adalah pindaian dokumen kertas, halaman hanya berisi data gambar dan tidak ada lapisan teks untuk diekstrak; dalam hal ini, alat ini akan mengembalikan keluaran kosong atau tidak lengkap. PDF pindaian memerlukan pengenalan karakter optis (OCR) untuk menghasilkan teks, yang merupakan proses terpisah yang tidak dilakukan oleh alat ini. Periksa apakah PDF Anda memiliki teks yang dapat dipilih di penampil sebelum menggunakan alat ini.

Cara menggunakan PDF ke teks, langkah demi langkah

  1. Muat PDF Anda ke dalam alat ekstraksi teks.
  2. Tunggu pdf.js membaca lapisan teks dari semua halaman.
  3. Tinjau pratinjau teks yang diekstrak.
  4. Klik unduh untuk menyimpan berkas .txt.

Kasus penggunaan umum

  • Ekstrak teks dari PDF makalah penelitian untuk ditempel ke aplikasi pencatatan atau diproses melalui alat peringkas.
  • Tarik konten dari faktur PDF ke spreadsheet untuk pembukuan tanpa pengetikan ulang secara manual.
  • Pulihkan teks dari PDF yang rusak atau memiliki tata letak terkunci di mana salin-tempel di penampil tidak berfungsi.
  • Konversi artikel PDF ke teks biasa untuk diproses dengan skrip atau alat baris perintah.

Pertanyaan yang sering diajukan

Mengapa teks yang diekstrak keluar kosong atau berantakan untuk beberapa PDF?

Penyebab paling umum adalah PDF merupakan pindaian: halaman-halamannya adalah gambar dan tidak mengandung lapisan teks. Penyebab lain termasuk PDF di mana teks disimpan sebagai garis atau pengkodean fon khusus yang tidak dapat dipetakan oleh pdf.js ke karakter yang dapat dibaca. Untuk dokumen pindaian, OCR diperlukan untuk menghasilkan teks.

Apakah alat ini melakukan OCR pada PDF pindaian?

Tidak. Alat ini membaca lapisan teks yang sudah ada dari PDF. Alat ini tidak melakukan pengenalan karakter optis. Untuk PDF pindaian, gunakan alat OCR, yang memproses gambar halaman melalui mesin OCR lokal di browser Anda.

Apakah ekstraksi teks dilakukan di server atau di browser saya?

Di browser Anda. pdf.js membaca struktur PDF secara lokal, mengurai objek konten teks dari setiap aliran halaman, dan merakit keluaran di memori browser. Data PDF tidak pernah meninggalkan perangkat Anda selama proses ini.

Apakah format dan tata letak akan dipertahankan dalam keluaran teks?

Tidak. Teks biasa tidak membawa informasi fon, ukuran, warna, atau posisi. Keluarannya adalah teks tanpa format dalam urutan membaca sebagaimana ditentukan oleh pdf.js. Tabel, tata letak multi-kolom, dan format khusus akan diratakan. Untuk pelestarian tata letak yang kaya, konverter PDF ke HTML lebih sesuai.

Bisakah saya mengekstrak teks dari PDF yang dilindungi kata sandi?

Jika PDF memiliki kata sandi buka-pengguna, Anda harus memberikannya agar PDF dapat dibaca sama sekali. Batasan ekstraksi tingkat pemilik juga dapat memblokir operasi. Hapus batasan tersebut terlebih dahulu menggunakan alat PDF Unlock, lalu coba ekstraksi lagi.

Apakah saya perlu membuat akun untuk mengekstrak teks dari PDF?

Tidak. Tidak ada pendaftaran dan tidak ada akun. Jatuhkan berkas, baca pratinjau hasil ekstraksi, dan unduh berkas .txt.

Apakah PDF ke Teks berfungsi di browser mobile?

Ya. pdf.js berjalan dengan cara yang sama di browser ponsel seperti di desktop. Salin atau unduh teks hasil ekstraksi langsung dari halaman mobile setelah ekstraksi selesai.