업로드 없음, 100% 로컬, 계정 없음

스캔한 PDF를 검색 가능하게 만들기

스캔한 PDF를 놓으면 같은 페이지에 보이지 않는 검색 가능한 텍스트 레이어가 추가되어 돌아옵니다. 인식은 전적으로 브라우저에서(기기 내, 첫 로드 이후 오프라인) 실행되며, 아무것도 업로드되지 않습니다.

PDF OCR · 검색 가능하게 만들기 작동 방식

PDF OCR은 실제 텍스트가 없는 페이지 이미지로만 이루어진 스캔 PDF를 검색 가능한 PDF로 바꿔줍니다. 동일한 페이지 이미지 위에 각 인식된 단어의 위치에 맞춰 보이지 않는 텍스트 레이어를 추가합니다. 결과 파일을 아무 PDF 리더로 열면 이제 Ctrl+F로 단어를 찾거나, 단락을 선택해 복사하거나, 검색 엔진이 문서를 색인할 수 있습니다. 단순한 스캔본으로는 불가능했던 일들입니다. 인식 자체는 tesseract.js(OCR 도구에서 사용하는 것과 동일한 자체 호스팅 OCR 엔진)로 실행되며, 페이지 렌더링은 pdf.js로 처리됩니다. 두 과정 모두 브라우저 탭 안에서 완전히 실행되며, 파일은 업로드되지 않습니다.

이 도구는 자신이 하는 일과 하지 않는 일에 대해 정직합니다. 레이아웃, 표, 글꼴을 재구성하지 않으며, 편집 가능한 문서로 변환하는 도구도 아닙니다. 화면에 보이는 페이지는 원본 스캔과 동일한 이미지로 남아 있고, 그 아래에 숨겨진 텍스트 레이어만 추가됩니다. 인식 정확도는 스캔 품질에 좌우되며, 이는 어떤 OCR 엔진에도 적용되는 것과 같은 원칙, 즉 200DPI 이상, 높은 대비, 똑바른 페이지가 기준입니다. 검색 가능한 PDF가 아니라 순수하게 추출된 텍스트만 필요하다면, OCR 도구가 .txt 파일을 생성하며 그 용도에는 더 빠릅니다.

PDF OCR · 검색 가능하게 만들기 단계별 사용 방법

  1. 텍스트 레이어가 없는 스캔 PDF(페이지당 이미지 하나)를 업로드 영역에 놓으세요.
  2. 언어 드롭다운에서 문서의 주요 언어를 선택하세요.
  3. 이 도구를 처음 사용한다면 tesseract.js 엔진이 다운로드될 때까지 기다리세요(한 번만 발생합니다).
  4. 실행 버튼을 클릭하고 각 페이지가 차례로 렌더링되고 인식되는 동안 기다리세요.
  5. 검색 가능한 PDF를 다운로드하세요. 모습은 그대로지만 아래에 텍스트 레이어가 추가됩니다.

자주 사용되는 사례

  • 스캔한 계약서에서 모든 페이지를 읽는 대신 Ctrl+F로 특정 조항을 찾을 수 있도록 검색 가능하게 만듭니다.
  • 검색 색인이 실제 PDF 텍스트만 읽는 문서 보관소에 넣기 위해 스캔한 청구서 묶음을 처리합니다.
  • 촬영하거나 스캔한 양식의 인쇄된 라벨을 선택 가능하게 만들어 한 단락을 이메일에 복사할 수 있게 합니다.
  • 독일어로 된 스캔 보고서 라이브러리에 전체 텍스트 검색이 필요할 때, 도구를 실행하기 전에 언어를 독일어로 선택합니다.

자주 묻는 질문

일반 OCR 도구와는 어떻게 다른가요?

OCR 도구는 원본 레이아웃과 이미지를 완전히 버리고 순수 텍스트를 .txt 파일로 추출합니다. PDF OCR은 원본 PDF 페이지 이미지를 보이는 그대로 유지하면서 그 아래에 보이지 않는 검색 가능한 텍스트 레이어를 추가합니다. 단어만 필요하다면 OCR 도구를, 문서를 PDF로 유지하면서 검색과 선택이 가능하게 만들고 싶다면 PDF OCR을 사용하세요.

결과 PDF가 원본 스캔과 다르게 보이나요?

아닙니다. 각 페이지는 원본 PDF에서 렌더링되어 이미지로 다시 삽입되며, JPEG 재인코딩을 감안하면 원본 스캔과 픽셀 단위로 동일합니다. 인식된 단어는 투명도 0으로 그 위에 그려지므로 새로 보이는 것은 없습니다. 텍스트 검색이나 텍스트 선택을 해봐야만 추가된 레이어를 알아챌 수 있습니다.

이 도구가 표, 열, 글꼴을 재구성하나요?

아닙니다. 결과물은 페이지를 하나의 평면 이미지로 유지합니다. 보이지 않는 텍스트 레이어는 인식된 단어의 위치를 따르지만, 표 구조나 tesseract.js가 추론하는 것 이상의 다단 읽기 순서, 원본 글꼴은 보존하지 않습니다. 이것은 검색 가능성을 더하는 레이어이지, 편집 가능한 텍스트로의 문서 변환이 아닙니다.

처리 중에 스캔한 문서가 어딘가로 전송되나요?

아닙니다. tesseract.js 엔진과 언어 팩을 이 사이트에서 다운로드한 뒤(처음 사용할 때 한 번, 수 메가바이트 크기의 다운로드), 모든 페이지 렌더링과 인식 과정은 브라우저 탭 안에서 완전히 실행됩니다. 계약서, 의료 기록 등 민감한 문서가 서버에 도달하는 일은 없습니다.

긴 PDF를 처리하는 데 왜 시간이 걸리나요?

각 페이지는 이미지로 렌더링된 뒤 개별적으로 OCR이 실행되며, 이 모든 과정이 브라우저 탭 안에서 이루어지므로 처리 시간은 페이지 수에 비례합니다. 진행률 표시줄은 실제 페이지별 진행 상황을 반영하며, 전체 파이프라인이 브라우저 탭의 메모리 한도 안에 머물도록 파일 크기는 80MB로 제한됩니다.

PDF에 이미 선택 가능한 텍스트가 있다면 어떻게 되나요?

이미 실제 텍스트 레이어가 있는 PDF에 OCR을 실행하는 것은 불필요합니다. 리더에서 열고 Ctrl+F를 누르면 이미 작동하기 때문입니다. 이 도구는 텍스트가 없는 페이지 이미지로만 이루어진 PDF, 즉 평판 스캐너나 촬영한 문서를 "PDF로 인쇄"한 결과물을 위한 것입니다.