아티클
일부 PDF에서 텍스트를 복사할 수 없는 이유
어떤 PDF에서는 한 줄을 선택하려 하면 단어들이 정상적으로 하이라이트되어 복사할 준비가 됩니다. 다른 PDF에서 같은 동작을 하면 아무 일도 일어나지 않거나, 커서가 사진처럼 페이지 전체를 붙잡습니다, 실제로 그것이 사진이기 때문입니다. 화면에서 똑같아 보이는 두 파일이 그 밑에서는 완전히 다르게 만들어져 있을 수 있습니다. 어느 쪽인지 구분하는 방법과, 복사를 거부하는 쪽을 어떻게 다뤄야 하는지 알아봅니다.
두 가지 서로 다른 종류의 PDF 페이지
PDF는 페이지를 아주 다른 두 가지 방식으로 저장할 수 있습니다. 텍스트 기반 PDF에서는 웹페이지가 텍스트를 저장하는 것과 같은 방식으로 모든 글자가 유니코드 값, 글꼴, 위치를 가진 문자 객체입니다: 뷰어는 이를 선택하고 검색할 수 있고, 스크린 리더는 소리 내어 읽을 수 있습니다. 이미지 기반 PDF에서는 페이지가 하나의 평평한 그림이며, 흔히 스캐너, 팩스, 또는 문서 사진에 적용한 'PDF로 인쇄' 단계로 만들어집니다. 눈에는 글자가 똑같아 보이지만, 파일 형식 입장에서는 그 아래에 문자가 없고 픽셀만 있습니다.

어느 쪽인지 빠르게 알아보는 방법
Ctrl+F나 Cmd+F를 누르고 페이지에서 분명히 보이는 단어를 검색하세요. 검색이 그것을 찾아 하이라이트하면 페이지에 진짜 텍스트 레이어가 있는 것입니다. 문서 어디에서도 검색이 아무것도 찾지 못한다면, 그 페이지가 아무리 선명하고 타이핑된 문서처럼 보여도 이미지입니다. 마우스를 드래그해 한 줄을 선택해도 같은 답이 나옵니다: 하이라이트냐, 아니면 단순한 사각형 선택이냐입니다.
OCR로 텍스트 복원하기
광학 문자 인식(OCR)은 이미지 기반 페이지의 픽셀을 읽고 그 모양을 해당 언어의 학습된 문자 모델과 대조한 다음, 인식된 문자가 나타났던 위치에 배치된 텍스트 레이어를 다시 만듭니다. OCR 같은 도구는 이를 전적으로 브라우저에서 처리합니다: 아무것도 업로드되지 않으며, 결과물은 검색하고, 복사하고, 편집할 수 있는 순수 텍스트 파일입니다. 정확도는 원본에 좌우됩니다: 잘 지원되는 언어의 깨끗하고 반듯한 고해상도 스캔은 안정적으로 인식되는 반면, 기울어지거나, 흐릿하거나, 대비가 낮거나, 손글씨인 페이지는 더 많은 오류를 만듭니다, 때로는 잘못된 문자나 잘못 읽은 단어로요.

파일에 이미 텍스트가 있는데 추출 결과가 이상해 보일 때
PDF에 진짜 텍스트 레이어가 있는데도 PDF를 텍스트로 같은 도구가 열이 합쳐지거나 간격이 무너진 이상한 순서의 텍스트를 만들어 낸다면, 그것은 다르고 관련 없는 문제입니다: 텍스트 객체는 존재하지만 페이지의 읽기 순서가 스크립트가 자연스럽게 기대하는 방식으로 저장되어 있지 않은 것입니다. 이는 추출 후 정리해야 할 레이아웃 특성일 뿐, 텍스트가 없다는 신호가 아니며, 고치는 데 OCR이 필요하지 않습니다.
이 아티클의 도구
자주 묻는 질문
제 PDF는 평범한 타이핑 문서처럼 보이는데 여전히 어떤 텍스트도 선택할 수 없습니다. 왜 그런가요?
PDF로 저장된 스캔이나 사진 촬영 페이지이거나, 의도적으로 이미지로 평탄화된 문서일 가능성이 가장 큽니다. 시각적으로는 텍스트 기반 PDF와 구분이 안 될 수 있습니다; 차이는 검색하거나 선택하려 할 때만 드러납니다. OCR을 거치면 픽셀에서 진짜로 선택 가능한 텍스트 레이어가 다시 만들어집니다.
OCR은 모든 언어에서 똑같이 잘 작동하나요?
아닙니다. 정확도는 그 언어와 문자 체계에 대한 학습된 모델이 있는지, 그리고 스캔 품질에 달려 있습니다. 잘 지원되는 언어는 깨끗하고 반듯한 스캔에서 안정적으로 인식됩니다; 손글씨, 저해상도 이미지, 또는 학습 데이터가 적은 언어는 더 많은 오류를 만듭니다. OCR 결과물은 항상 최선을 다한 전사이므로, 그것에 의존하기 전에 빠르게 검토해 볼 가치가 있습니다.