Không tải lên, 100% cục bộ, không cần tài khoản

Bài viết

Tại sao bạn không thể sao chép văn bản từ một số PDF

Thử chọn một dòng trong một PDF và các từ được tô sáng bình thường, sẵn sàng để sao chép. Thử cùng thao tác đó trong một PDF khác và không có gì xảy ra, hoặc con trỏ chọn cả trang như một bức ảnh, vì đó chính xác là những gì nó là. Hai tệp trông giống hệt nhau trên màn hình có thể được dựng hoàn toàn khác nhau bên dưới. Đây là cách phân biệt bạn có loại nào, và phải làm gì với loại chống lại việc sao chép.

Hai loại trang PDF khác nhau

Một PDF có thể lưu một trang theo hai cách rất khác nhau. Trong một PDF dựa trên văn bản, mỗi chữ cái là một đối tượng ký tự với giá trị Unicode, một phông chữ và một vị trí, giống cách một trang web lưu văn bản: một trình xem có thể chọn nó, tìm kiếm nó, và một trình đọc màn hình có thể đọc to nó. Trong một PDF dựa trên ảnh, trang là một bức ảnh phẳng duy nhất, thường được tạo ra bởi máy quét, máy fax, hay một bước "in ra PDF" áp dụng cho một bức ảnh chụp tài liệu. Các chữ cái trông giống hệt với mắt bạn, nhưng đối với định dạng tệp thì không có ký tự nào bên dưới, chỉ có pixel.

So sánh cạnh nhau: một trang PDF dựa trên văn bản với một dòng văn bản được tô sáng, có thể chọn được, bên cạnh một trang PDF dựa trên ảnh nơi cùng văn bản trông giống hệt là một bức ảnh phẳng không thể chọn

Cách nhanh để biết bạn có loại nào

Nhấn Ctrl+F hoặc Cmd+F và tìm một từ bạn thấy rõ trên trang. Nếu tìm kiếm thấy nó và tô sáng nó, trang có một lớp văn bản thật. Nếu tìm kiếm không thấy gì ở bất kỳ đâu trong tài liệu, trang là một ảnh, dù nó trông sắc nét hay giống một tài liệu đánh máy đến mức nào. Kéo chuột để chọn một dòng cho cùng câu trả lời: một vùng tô sáng so với một vùng chọn hình chữ nhật đơn giản.

Dựng lại văn bản bằng OCR

Nhận dạng ký tự quang học (OCR) đọc pixel của một trang dựa trên ảnh và khớp các hình dạng với một mô hình đã huấn luyện về chữ cái cho một ngôn ngữ nhất định, rồi dựng lại một lớp văn bản với các ký tự nhận dạng được đặt ở vị trí chúng xuất hiện. Một công cụ như OCR làm việc này hoàn toàn trong trình duyệt: không gì được tải lên, và đầu ra là một tệp văn bản thuần bạn có thể tìm kiếm, sao chép hoặc chỉnh sửa. Độ chính xác phụ thuộc vào nguồn: một bản quét sạch, thẳng, độ phân giải cao bằng một ngôn ngữ được hỗ trợ tốt nhận dạng đáng tin cậy, trong khi một trang nghiêng, mờ, tương phản thấp hay viết tay tạo ra nhiều lỗi hơn, đôi khi một ký tự sai hay một từ đọc nhầm.

Sơ đồ quy trình: pixel của một trang quét đi qua nhận dạng ký tự OCR và ra thành một lớp văn bản được dựng lại, có vị trí

Khi tệp đã có văn bản nhưng việc trích xuất trông sai

Nếu PDF của bạn thực sự có một lớp văn bản thật nhưng một công cụ như PDF sang văn bản tạo ra văn bản theo thứ tự kỳ lạ, với các cột bị trộn lẫn hay khoảng cách bị dồn lại, đó là một vấn đề khác, không liên quan: các đối tượng văn bản tồn tại nhưng thứ tự đọc của chúng trên trang không được lưu theo cách một kịch bản tự nhiên mong đợi. Đó là một đặc điểm bố cục cần dọn dẹp sau khi trích xuất, không phải dấu hiệu văn bản bị thiếu, và không cần OCR để sửa.

Công cụ trong bài viết này

Câu hỏi thường gặp

PDF của tôi trông như một tài liệu đánh máy bình thường nhưng tôi vẫn không thể chọn văn bản nào. Tại sao?

Rất có thể đó là một trang quét hoặc chụp ảnh được lưu dưới dạng PDF, hoặc một tài liệu được làm phẳng thành ảnh một cách cố ý. Về mặt thị giác nó có thể không phân biệt được với một PDF dựa trên văn bản; sự khác biệt chỉ hiện ra khi bạn thử tìm kiếm hoặc chọn nó. Chạy nó qua OCR dựng lại một lớp văn bản thật, có thể chọn được từ pixel.

OCR có hoạt động tốt như nhau ở mọi ngôn ngữ không?

Không. Độ chính xác phụ thuộc vào việc có tồn tại một mô hình đã huấn luyện cho ngôn ngữ và bảng chữ đó không, và vào chất lượng bản quét. Các ngôn ngữ được hỗ trợ tốt trên một bản quét sạch, thẳng nhận dạng đáng tin cậy; chữ viết tay, ảnh độ phân giải thấp, hay các ngôn ngữ có ít dữ liệu huấn luyện hơn tạo ra nhiều lỗi hơn. Đầu ra OCR luôn là một bản phiên âm nỗ lực tốt nhất, đáng để đọc lại nhanh trước khi bạn tin cậy nó.

Nguồn