从 PDF 提取图片 的工作原理
「从 PDF 提取图像」工具直接从 PDF 中拉取原始嵌入的位图图像,并将每张图像保存为单独的 PNG 文件。这样可以以存储时的分辨率恢复文档中放置的实际照片、logo 或扫描件,而不是渲染页面外观的截图。提取过程由 pdf-lib 在浏览器中执行,原始 PDF 不会经过网络传输。
这与将 PDF 页面转换为图像不同。页面转换以选定的 DPI 将完整页面布局(包括文本、边框和背景)渲染为单个位图图像。图像提取则遍历 PDF 的内部对象图,按原样拉取每个图像资源,保留其原始像素尺寸和色彩空间。如果某页由单张全出血照片构成,你得到的是该照片的存储尺寸,而不是页面大小的渲染图。如果 PDF 不包含嵌入的位图图像(只有矢量图形或文本),工具将找不到任何可提取的内容。