PDF OCR · 검색 가능하게 만들기 작동 방식
PDF OCR은 실제 텍스트가 없는 페이지 이미지로만 이루어진 스캔 PDF를 검색 가능한 PDF로 바꿔줍니다. 동일한 페이지 이미지 위에 각 인식된 단어의 위치에 맞춰 보이지 않는 텍스트 레이어를 추가합니다. 결과 파일을 아무 PDF 리더로 열면 이제 Ctrl+F로 단어를 찾거나, 단락을 선택해 복사하거나, 검색 엔진이 문서를 색인할 수 있습니다. 단순한 스캔본으로는 불가능했던 일들입니다. 인식 자체는 tesseract.js(OCR 도구에서 사용하는 것과 동일한 자체 호스팅 OCR 엔진)로 실행되며, 페이지 렌더링은 pdf.js로 처리됩니다. 두 과정 모두 브라우저 탭 안에서 완전히 실행되며, 파일은 업로드되지 않습니다.
이 도구는 자신이 하는 일과 하지 않는 일에 대해 정직합니다. 레이아웃, 표, 글꼴을 재구성하지 않으며, 편집 가능한 문서로 변환하는 도구도 아닙니다. 화면에 보이는 페이지는 원본 스캔과 동일한 이미지로 남아 있고, 그 아래에 숨겨진 텍스트 레이어만 추가됩니다. 인식 정확도는 스캔 품질에 좌우되며, 이는 어떤 OCR 엔진에도 적용되는 것과 같은 원칙, 즉 200DPI 이상, 높은 대비, 똑바른 페이지가 기준입니다. 검색 가능한 PDF가 아니라 순수하게 추출된 텍스트만 필요하다면, OCR 도구가 .txt 파일을 생성하며 그 용도에는 더 빠릅니다.