PDF를 텍스트로 작동 방식
PDF to Text는 PDF에 이미 존재하는 텍스트 레이어를 추출하여 일반 .txt 파일로 저장합니다. 추출은 브라우저 안의 pdf.js가 수행하며, PDF 페이지 스트림에 포함된 텍스트 콘텐츠 객체를 읽습니다. 문서는 기기를 벗어나지 않으며, 결과는 로컬에서 조립되어 직접 다운로드로 제공됩니다.
이 도구는 파일에 이미 존재하는 텍스트 레이어를 읽습니다. 워드 프로세서나 내보내기 도구로 생성한 PDF에는 거의 확실히 텍스트 레이어가 있어 추출이 잘 됩니다. PDF가 종이 문서를 스캔한 것이라면 페이지에 이미지 데이터만 있고 텍스트 레이어가 없으므로, 이 도구는 빈 출력이나 불완전한 출력을 반환합니다. 스캔된 PDF에서 텍스트를 추출하려면 광학 문자 인식(OCR)이 필요하며, 이는 이 도구가 수행하는 별도의 프로세스입니다. 이 도구를 사용하기 전에 뷰어에서 PDF의 텍스트를 선택할 수 있는지 확인하세요.