PDF 转文本 的工作原理
PDF 转文本工具从 PDF 中提取现有文本层,并将其保存为纯 .txt 文件。提取由浏览器内的 pdf.js 执行,读取嵌入在 PDF 页面流中的文本内容对象。文档不会离开你的设备;结果在本地组装并作为直接下载提供。
此工具读取文件中已存在的文本层。如果你的 PDF 是由文字处理软件或导出工具创建的,它几乎可以肯定有文本层,提取效果会很好。如果 PDF 是纸质文档的扫描件,页面仅包含图像数据,没有可提取的文本层;在这种情况下,此工具将返回空白或不完整的输出。扫描的 PDF 需要光学字符识别(OCR)才能生成文本,这是此工具不执行的单独过程。在使用此工具之前,请先在查看器中检查你的 PDF 是否有可选择的文本。