Không tải lên, 100% cục bộ, không cần tài khoản

Trích văn bản PDF → Text

Trích toàn bộ văn bản đọc được từ PDF. Tải về dưới dạng tệp .txt. Mọi thứ ở lại trong trình duyệt, không tệp nào gửi tới máy chủ.

Cách PDF sang văn bản hoạt động

PDF sang Văn bản trích xuất lớp văn bản hiện có từ PDF và lưu dưới dạng tệp .txt thuần túy. Việc trích xuất được thực hiện bởi pdf.js bên trong trình duyệt của bạn, đọc các đối tượng nội dung văn bản được nhúng trong các luồng trang của PDF. Tài liệu không bao giờ rời khỏi thiết bị của bạn; kết quả được tạo cục bộ và cung cấp dưới dạng tải xuống trực tiếp.

Công cụ này đọc lớp văn bản đã có trong tệp. Nếu PDF của bạn được tạo bởi một bộ xử lý văn bản hoặc công cụ xuất, gần như chắc chắn nó có lớp văn bản và việc trích xuất sẽ hoạt động tốt. Nếu PDF là bản quét của tài liệu giấy, các trang chỉ chứa dữ liệu hình ảnh và không có lớp văn bản để trích xuất; trong trường hợp đó, công cụ này sẽ trả về đầu ra trống hoặc không đầy đủ. Các PDF được quét yêu cầu nhận dạng ký tự quang học (OCR) để tạo ra văn bản, đây là một quá trình riêng biệt không được thực hiện bởi công cụ này. Hãy kiểm tra xem PDF của bạn có văn bản có thể chọn được trong trình xem trước khi dùng công cụ này.

Cách sử dụng PDF sang văn bản, từng bước

  1. Nạp tệp PDF vào công cụ trích xuất văn bản.
  2. Chờ pdf.js đọc lớp văn bản từ tất cả các trang.
  3. Xem lại bản xem trước văn bản đã trích xuất.
  4. Nhấn tải xuống để lưu tệp .txt.

Trường hợp sử dụng thường gặp

  • Trích xuất văn bản từ PDF bài nghiên cứu để dán vào ứng dụng ghi chú hoặc chạy qua công cụ tóm tắt.
  • Lấy nội dung từ hóa đơn PDF vào bảng tính để ghi sổ mà không cần gõ lại thủ công.
  • Khôi phục văn bản từ PDF bị hỏng hoặc bị khóa bố cục mà tính năng sao chép dán trong trình xem bị hỏng.
  • Chuyển đổi bài viết PDF thành văn bản thuần để xử lý bằng kịch bản hoặc công cụ dòng lệnh.

Câu hỏi thường gặp

Tại sao văn bản đã trích xuất ra trống hoặc bị lộn xộn với một số tệp PDF?

Nguyên nhân phổ biến nhất là tệp PDF là bản quét: các trang là hình ảnh và không chứa lớp văn bản. Các nguyên nhân khác bao gồm các PDF mà văn bản được lưu trữ dưới dạng đường viền hoặc mã hóa phông chữ tùy chỉnh mà pdf.js không thể ánh xạ sang ký tự có thể đọc. Với tài liệu được quét, cần OCR để tạo ra văn bản.

Công cụ này có thực hiện OCR trên PDF được quét không?

Không. Công cụ này đọc lớp văn bản hiện có từ PDF. Nó không thực hiện nhận dạng ký tự quang học. Với PDF được quét, hãy dùng công cụ OCR, thứ sẽ chuyển hình ảnh trang qua công cụ OCR cục bộ trong trình duyệt của bạn.

Việc trích xuất văn bản có được thực hiện trên máy chủ hay trong trình duyệt của tôi không?

Trong trình duyệt của bạn. pdf.js đọc cấu trúc PDF cục bộ, phân tích các đối tượng nội dung văn bản từ mỗi luồng trang, và tạo đầu ra trong bộ nhớ trình duyệt. Dữ liệu PDF không bao giờ rời khỏi thiết bị của bạn trong quá trình này.

Định dạng và bố cục có được bảo toàn trong đầu ra văn bản không?

Không. Văn bản thuần túy không mang thông tin về phông chữ, kích thước, màu sắc hay vị trí. Đầu ra là văn bản không định dạng theo thứ tự đọc do pdf.js xác định. Bảng, bố cục nhiều cột và định dạng đặc biệt bị làm phẳng. Để bảo toàn bố cục phong phú, các công cụ chuyển đổi PDF sang HTML phù hợp hơn.

Tôi có thể trích xuất văn bản từ PDF có mật khẩu bảo vệ không?

Nếu PDF có mật khẩu mở của người dùng, bạn phải cung cấp nó để đọc được tệp. Các hạn chế trích xuất ở cấp chủ sở hữu cũng có thể chặn thao tác. Hãy gỡ các hạn chế đó trước bằng công cụ PDF Unlock, rồi thử trích xuất lại.

Tôi có cần tạo tài khoản để trích xuất văn bản từ PDF không?

Không. Không cần đăng ký và không cần tài khoản. Thả tệp vào, đọc bản xem trước đã trích xuất, và tải xuống tệp .txt.

PDF sang Văn bản có hoạt động trên trình duyệt di động không?

Có. pdf.js chạy giống hệt trên trình duyệt điện thoại như trên máy tính để bàn. Sao chép hoặc tải xuống văn bản đã trích xuất ngay trên trang di động khi quá trình trích xuất hoàn tất.