Cách OCR PDF · làm cho có thể tìm kiếm hoạt động
PDF OCR biến một PDF quét, vốn chỉ gồm ảnh trang không có văn bản thật, thành một PDF có thể tìm kiếm: vẫn là những ảnh trang đó, cộng thêm một lớp văn bản vô hình được đặt chồng lên từng từ đã nhận dạng. Mở kết quả trong bất kỳ trình đọc PDF nào và giờ đây bạn có thể dùng Ctrl+F để tìm một từ, chọn và sao chép một đoạn văn, hoặc để công cụ tìm kiếm lập chỉ mục tài liệu, tất cả những điều mà một bản quét thuần túy không làm được. Việc nhận dạng chạy bằng tesseract.js (cùng cơ chế OCR tự lưu trữ được dùng trong công cụ OCR), còn việc render trang chạy bằng pdf.js; cả hai đều thực thi hoàn toàn trong tab trình duyệt của bạn, và tệp của bạn không bao giờ bị tải lên.
Công cụ này trung thực về những gì nó làm được và không làm được. Nó không tái tạo bố cục, bảng biểu hay phông chữ, và đây không phải là công cụ chuyển đổi sang tài liệu có thể chỉnh sửa: trang hiển thị vẫn là một hình ảnh, giống hệt bản quét gốc, với một lớp văn bản ẩn được thêm bên dưới phần hiển thị. Độ chính xác nhận dạng phụ thuộc vào chất lượng bản quét, cùng khuyến nghị 200 DPI trở lên, độ tương phản cao, trang thẳng áp dụng cho mọi công cụ OCR. Nếu bạn chỉ cần văn bản trích xuất thuần túy thay vì một PDF có thể tìm kiếm bên trong, công cụ OCR sẽ tạo ra tệp .txt thay thế và nhanh hơn cho công việc cụ thể đó.