업로드 없음, 100% 로컬, 계정 없음

사용법

스캔한 PDF를 검색 가능하게 만들기

스캔한 PDF는 평범한 문서처럼 보이지만 실제로는 페이지의 그림입니다: Ctrl+F로 아무것도 찾을 수 없고, 단어 하나도 선택하거나 복사할 수 없습니다. PDF OCR 도구는 파일의 본질을 바꾸지 않으면서 이를 해결합니다. 각 페이지 이미지를 읽고, 기기 내 OCR 엔진으로 문자를 인식한 다음, 그 인식된 텍스트를 같은 이미지 위에 보이지 않게 올려놓습니다. 그래서 PDF는 여전히 예전과 똑같이 보이고 인쇄되지만 이제 검색과 텍스트 선택에 반응합니다. 파일은 기기를 벗어나지 않습니다.

단계별 안내

  1. PDF OCR 도구를 열고 스캔한 PDF를 놓으세요. PDF 파일만 받아들여지며, 파일 크기는 80MB로 제한됩니다; 일반적인 여러 페이지 스캔은 그보다 훨씬 작습니다.
  2. 드롭다운에서 문서 언어(영어, 프랑스어, 독일어, 스페인어, 포르투갈어, 이탈리아어)를 고르고, 원한다면 출력 파일 이름을 편집하세요. 기본값은 .pdf 확장자를 자동으로 유지합니다.
  3. 실행을 클릭하고 모든 페이지가 처리될 때까지 기다리세요. 각 페이지는 렌더링되고, OCR 엔진을 거치고, 자체 보이지 않는 텍스트 레이어를 받은 다음에야 도구가 다음 페이지로 넘어가므로, 긴 문서는 한 페이지짜리보다 시간이 더 걸립니다. 결과물을 다운로드하세요: 원본과 똑같이 열리고 인쇄되지만, 이제 Ctrl+F, 텍스트 선택, 복사-붙여넣기가 작동합니다.

검색 가능한 PDF와 순수 텍스트, 실제로 무엇이 필요한가

이 도구와 순수 OCR 도구는 스캔한 이미지의 텍스트를 인식한다는 같은 근본 문제를 풀지만, 서로 다른 것을 유지합니다. OCR 도구는 페이지 이미지를 버리고 순수 .txt 파일을 돌려줍니다: 단어를 편집기에 붙여넣거나, 번역하거나, 텍스트로 검색하고 싶고 문서의 원래 모습을 보존하는 데는 신경 쓰지 않을 때 사용하세요. 여기의 PDF OCR 도구는 페이지 이미지를 포함해 원본 PDF를 정확히 그대로 유지하면서 그 아래에만 숨은 텍스트 레이어를 추가합니다: 문서가 여전히 인쇄하거나, 이메일로 보내거나, 보관할 수 있는 PDF로 남아 있어야 하지만 검색하거나 복사도 할 수 있길 원할 때 사용하세요. 어느 도구도 실제 글꼴과 표가 있는 편집 가능한 텍스트로 레이아웃을 복원하지는 않습니다; 둘 다 같은 인식된 텍스트로 작업하되 다르게 포장할 뿐입니다.

결과가 스캔에 좌우되는 이유와 한계

인식 정확도는 순수 OCR과 마찬가지로 원본 이미지의 품질을 따라갑니다: 200~300dpi 정도의 깨끗하고 반듯한 스캔은 안정적으로 인식되는 반면, 흐릿한 사진, 기울어진 페이지, 짙은 그림자는 잘못 읽는 단어를 더 많이 만듭니다. 페이지가 삐뚤게 나왔다면 OCR을 실행하기 전에 PDF 스캔 페이지 기울기 보정 도구로 바로잡아 인식 단계가 반듯한 텍스트를 읽도록 하세요. 도구는 여섯 개 언어(영어, 프랑스어, 독일어, 스페인어, 포르투갈어, 이탈리아어)를 다룹니다; 지원하지 않는 언어의 문서는 제대로 인식되지 않습니다. 처리는 브라우저 탭에서 페이지별로 이뤄지므로, 수십 페이지짜리 문서는 두 페이지짜리 스캔보다 눈에 띄게 시간이 더 걸리며, 파일 크기는 80MB로 제한됩니다. 페이지 이미지 자체는 손대지 않으므로 출력 PDF도 원본과 크기가 비슷한 편입니다; 이후 더 작은 파일이 필요하다면 PDF 압축 도구를 거치세요.

보이지 않는 텍스트 레이어가 만들어지는 방식

각 PDF 페이지는 먼저 브라우저에서 PDF를 이미지로 도구가 쓰는 것과 같은 렌더링 단계로 캔버스 이미지로 래스터화됩니다. OCR 엔진(WebAssembly로 컴파일된 Tesseract)이 그 이미지를 읽고 인식된 각 단어를 페이지 위 위치인 경계 상자와 함께 돌려줍니다. 그 단어들은 인식된 위치에 원본 PDF 페이지의 사본 위에 다시 그려지지만 불투명도 0으로 그려지므로, 시각적으로는 아무것도 바뀌지 않습니다: 보고 인쇄하는 페이지 이미지는 스캔했던 바로 그 이미지가 위에 놓인 것입니다. PDF 뷰어의 검색과 텍스트 선택 기능은 그 보이지 않는 텍스트 레이어만 보므로, 겉모습은 전혀 다르지 않으면서 파일이 검색 가능하고 선택 가능해지는 이유가 여기에 있습니다. 렌더링, 인식, 재조립까지 이 모든 것이 브라우저 탭 안에서 일어납니다; PDF는 로컬 디스크에서 읽히고 어디로도 전송되지 않습니다.

이 가이드에서 사용하는 도구

자주 묻는 질문

검색 가능한 PDF도 원본 스캔과 똑같이 보이고 인쇄되나요?

네. 도구는 페이지 이미지를 절대 수정하지 않습니다; 그 아래에 보이지 않는 텍스트 레이어만 추가할 뿐입니다. 화면과 종이 모두에서 출력물은 놓은 스캔과 시각적으로 동일합니다. 달라지는 것은 뷰어의 검색과 텍스트 선택 도구가 이제 인식된 단어를 찾고 집을 수 있다는 점입니다, 그 숨은 레이어에서 읽기 때문입니다.

왜 순수 OCR 도구와 별도로 이 도구가 존재하나요?

같은 인식 단계에서 서로 다른 필요에 답하기 때문입니다. OCR 도구는 순수 텍스트 파일을 제공하며, 단어를 붙여넣거나, 편집하거나, 번역할 계획이고 문서를 PDF로 유지할 필요가 없을 때 원하는 것입니다. 이 도구는 원본 페이지 이미지를 그대로 유지한 PDF로 파일을 유지하며, 문서를 여전히 그대로 인쇄하거나, 보관하거나, 이메일로 보내야 하지만 텍스트를 검색하거나 복사도 할 수 있길 원할 때 필요한 것입니다.

출처