사용법
스캔한 PDF를 검색 가능하게 만들기
스캔한 PDF는 평범한 문서처럼 보이지만 실제로는 페이지의 그림입니다: Ctrl+F로 아무것도 찾을 수 없고, 단어 하나도 선택하거나 복사할 수 없습니다. PDF OCR 도구는 파일의 본질을 바꾸지 않으면서 이를 해결합니다. 각 페이지 이미지를 읽고, 기기 내 OCR 엔진으로 문자를 인식한 다음, 그 인식된 텍스트를 같은 이미지 위에 보이지 않게 올려놓습니다. 그래서 PDF는 여전히 예전과 똑같이 보이고 인쇄되지만 이제 검색과 텍스트 선택에 반응합니다. 파일은 기기를 벗어나지 않습니다.
단계별 안내
- PDF OCR 도구를 열고 스캔한 PDF를 놓으세요. PDF 파일만 받아들여지며, 파일 크기는 80MB로 제한됩니다; 일반적인 여러 페이지 스캔은 그보다 훨씬 작습니다.
- 드롭다운에서 문서 언어(영어, 프랑스어, 독일어, 스페인어, 포르투갈어, 이탈리아어)를 고르고, 원한다면 출력 파일 이름을 편집하세요. 기본값은 .pdf 확장자를 자동으로 유지합니다.
- 실행을 클릭하고 모든 페이지가 처리될 때까지 기다리세요. 각 페이지는 렌더링되고, OCR 엔진을 거치고, 자체 보이지 않는 텍스트 레이어를 받은 다음에야 도구가 다음 페이지로 넘어가므로, 긴 문서는 한 페이지짜리보다 시간이 더 걸립니다. 결과물을 다운로드하세요: 원본과 똑같이 열리고 인쇄되지만, 이제 Ctrl+F, 텍스트 선택, 복사-붙여넣기가 작동합니다.
검색 가능한 PDF와 순수 텍스트, 실제로 무엇이 필요한가
이 도구와 순수 OCR 도구는 스캔한 이미지의 텍스트를 인식한다는 같은 근본 문제를 풀지만, 서로 다른 것을 유지합니다. OCR 도구는 페이지 이미지를 버리고 순수 .txt 파일을 돌려줍니다: 단어를 편집기에 붙여넣거나, 번역하거나, 텍스트로 검색하고 싶고 문서의 원래 모습을 보존하는 데는 신경 쓰지 않을 때 사용하세요. 여기의 PDF OCR 도구는 페이지 이미지를 포함해 원본 PDF를 정확히 그대로 유지하면서 그 아래에만 숨은 텍스트 레이어를 추가합니다: 문서가 여전히 인쇄하거나, 이메일로 보내거나, 보관할 수 있는 PDF로 남아 있어야 하지만 검색하거나 복사도 할 수 있길 원할 때 사용하세요. 어느 도구도 실제 글꼴과 표가 있는 편집 가능한 텍스트로 레이아웃을 복원하지는 않습니다; 둘 다 같은 인식된 텍스트로 작업하되 다르게 포장할 뿐입니다.
결과가 스캔에 좌우되는 이유와 한계
인식 정확도는 순수 OCR과 마찬가지로 원본 이미지의 품질을 따라갑니다: 200~300dpi 정도의 깨끗하고 반듯한 스캔은 안정적으로 인식되는 반면, 흐릿한 사진, 기울어진 페이지, 짙은 그림자는 잘못 읽는 단어를 더 많이 만듭니다. 페이지가 삐뚤게 나왔다면 OCR을 실행하기 전에 PDF 스캔 페이지 기울기 보정 도구로 바로잡아 인식 단계가 반듯한 텍스트를 읽도록 하세요. 도구는 여섯 개 언어(영어, 프랑스어, 독일어, 스페인어, 포르투갈어, 이탈리아어)를 다룹니다; 지원하지 않는 언어의 문서는 제대로 인식되지 않습니다. 처리는 브라우저 탭에서 페이지별로 이뤄지므로, 수십 페이지짜리 문서는 두 페이지짜리 스캔보다 눈에 띄게 시간이 더 걸리며, 파일 크기는 80MB로 제한됩니다. 페이지 이미지 자체는 손대지 않으므로 출력 PDF도 원본과 크기가 비슷한 편입니다; 이후 더 작은 파일이 필요하다면 PDF 압축 도구를 거치세요.
보이지 않는 텍스트 레이어가 만들어지는 방식
각 PDF 페이지는 먼저 브라우저에서 PDF를 이미지로 도구가 쓰는 것과 같은 렌더링 단계로 캔버스 이미지로 래스터화됩니다. OCR 엔진(WebAssembly로 컴파일된 Tesseract)이 그 이미지를 읽고 인식된 각 단어를 페이지 위 위치인 경계 상자와 함께 돌려줍니다. 그 단어들은 인식된 위치에 원본 PDF 페이지의 사본 위에 다시 그려지지만 불투명도 0으로 그려지므로, 시각적으로는 아무것도 바뀌지 않습니다: 보고 인쇄하는 페이지 이미지는 스캔했던 바로 그 이미지가 위에 놓인 것입니다. PDF 뷰어의 검색과 텍스트 선택 기능은 그 보이지 않는 텍스트 레이어만 보므로, 겉모습은 전혀 다르지 않으면서 파일이 검색 가능하고 선택 가능해지는 이유가 여기에 있습니다. 렌더링, 인식, 재조립까지 이 모든 것이 브라우저 탭 안에서 일어납니다; PDF는 로컬 디스크에서 읽히고 어디로도 전송되지 않습니다.
이 가이드에서 사용하는 도구
자주 묻는 질문
검색 가능한 PDF도 원본 스캔과 똑같이 보이고 인쇄되나요?
네. 도구는 페이지 이미지를 절대 수정하지 않습니다; 그 아래에 보이지 않는 텍스트 레이어만 추가할 뿐입니다. 화면과 종이 모두에서 출력물은 놓은 스캔과 시각적으로 동일합니다. 달라지는 것은 뷰어의 검색과 텍스트 선택 도구가 이제 인식된 단어를 찾고 집을 수 있다는 점입니다, 그 숨은 레이어에서 읽기 때문입니다.
왜 순수 OCR 도구와 별도로 이 도구가 존재하나요?
같은 인식 단계에서 서로 다른 필요에 답하기 때문입니다. OCR 도구는 순수 텍스트 파일을 제공하며, 단어를 붙여넣거나, 편집하거나, 번역할 계획이고 문서를 PDF로 유지할 필요가 없을 때 원하는 것입니다. 이 도구는 원본 페이지 이미지를 그대로 유지한 PDF로 파일을 유지하며, 문서를 여전히 그대로 인쇄하거나, 보관하거나, 이메일로 보내야 하지만 텍스트를 검색하거나 복사도 할 수 있길 원할 때 필요한 것입니다.