Cách OCR · hình ảnh/PDF sang văn bản hoạt động
OCR chuyển đổi hình ảnh đã quét hoặc PDF dựa trên hình ảnh thành văn bản bạn có thể sao chép, tìm kiếm và chỉnh sửa, bằng cách dùng tesseract.js chạy hoàn toàn bên trong trình duyệt của bạn. Bạn chọn ngôn ngữ tài liệu từ bộ chọn, mô hình ngôn ngữ liên quan tải xuống trình duyệt một lần, và tất cả nhận dạng tiếp theo chạy ngoại tuyến từ mô hình đã được lưu vào bộ nhớ đệm đó. Các tệp đã quét của bạn không bao giờ được truyền đến bất kỳ máy chủ nào trong quá trình chuyển đổi.
Độ chính xác nhận dạng phụ thuộc mạnh vào chất lượng bản quét. Các bản quét sạch, độ tương phản cao ở 200 DPI trở lên, với ít nhiễu nền và căn chỉnh trang thẳng, cho kết quả tốt nhất. Ảnh JPEG mờ, độ phân giải thấp hoặc nén nhiều, các trang có cột hoặc bố cục phức tạp, và văn bản viết tay đều giảm độ chính xác. Công cụ xuất ra một khối văn bản thuần; để có đầu ra có cấu trúc như bảng hoặc bố cục nhiều cột được bảo toàn, cần xử lý hậu kỳ. Chạy công cụ PDF Deskew trên các bản quét lệch trước OCR thường cải thiện tỷ lệ nhận dạng.