KitNelo · 全部工具 · Blog
文档与 OCR实用指南

PDF 怎么逐页转成 PNG?检查张数、页序和小字清晰度

提交系统只接受图片,手里却是一份多页 PDF。逐页截图容易漏页、带上阅读器工具栏,或把小字缩得无法辨认。这篇指南说明怎样导出每页 PNG,并确认接收方真正拿到完整、可读的页面。

KitNelo发布于 5 分钟阅读
摊开的书本展示印刷文字
配图:Finn Mund · Unsplash License

先看结论

打开文档工具的 PDF 转图片模式,导入 PDF 后执行处理,下载 pdf-pages.zip。当前实现把每页以 scale 2 渲染成 PNG,按 page-001.png 等编号打包;不提供 DPI 输入,也不会把低清扫描件变成新增细节的高清原稿。

确认需要的页和交付规则

先记录 PDF 总页数、需要提交的页面范围、允许格式、每张像素和文件体积限制。若只需要少数页面,按PDF 页面提取指南先做一份副本;当前转图会处理输入文档中的全部页面。

打开原 PDF 检查正文、旋转方向、印章和脚注是否完整。保留原件与必要的访问权限,别把受保护或重要原件覆盖为图片。若目标是复制或搜索文字,参考扫描 PDF 的 OCR 与文字层检查,这与转图片是两个任务。

导出每页 PNG 并解压

  1. 1进入文档与 PDF 工具,切换到 PDF 转图片。
  2. 2选择一份 PDF,核对文件名;先使用页数较少的工作副本确认流程。
  3. 3点击执行处理,等待下载 pdf-pages.zip;不要在页面仍处理时重复点击或关闭标签页。
  4. 4在本地解压 ZIP,按 page-001.png、page-002.png 的顺序检查。文件编号表示输入 PDF 的页面位置,不等于书上印刷的页码。
  5. 5保留一个解压目录用于验收,再把需要的 PNG 上传到接收系统,并查看上传后的效果。

下载得到的是 ZIP 中的逐页 PNG,而不是一张长图,也不是可编辑 Word。

图片像素增大不等于扫描细节变多

PDF.js 官方渲染示例说明页面通过 viewport 的 scale 控制画布尺寸,并考虑页面方向。本站当前采用固定 scale 2,按页面实际 viewport 尺寸生成画布;不能从这一设置推导所有文档都具有同一印刷 DPI。

文字和矢量线条可按页面渲染尺度生成像素,扫描页中的嵌入图片则仍受原始分辨率和清晰度约束。不要只比较 PNG 的像素数字:放大查看原本模糊的字,如果边缘仍糊,应该寻找更清晰的原稿或重新扫描。降低输出体积也可能让小字更难读。

逐页验收,不能只看 ZIP 能打开

  • 数量:PNG 张数应等于输入 PDF 页数;没有使用提取副本时,应包括全部页面。
  • 页序:核对第一张、最后一张以及中间章节转换位置,确认编号对应正文。
  • 方向和边界:检查横页、旋转页、表格右边缘和页脚,不应有不预期的裁切。
  • 文字与图形:查看小字号、细线、签字和印章;按实际用途判断可读性,不用扩展名代替质量检查。
  • 交付:在接收方页面检查上传后的图片,确认网站没有进一步压缩、缩放或只保留第一张。

建议自制验收样本:三页分别写明显的 A、B、C 标签,第二页用横向尺寸。预期得到三张按 A、B、C 排列的图片,第二张保留横向外观;这不是对所有 PDF 的处理保证。

内存、文字层和敏感内容的边界

当前流程逐页渲染并在浏览器内累积 ZIP 内容,页数多、页面大或嵌入图复杂都会增加内存需求。导出失败时先减少页面范围并重试副本;本站没有可承诺的通用文件大小或页数阈值,不保证手机与桌面同样能完成大型任务。

PNG 不保留 PDF 的可选择文字、书签、交互表单和数字签名验证能力。图片只是页面外观,不是这些功能的备份。页面转图片也不是隐私清除工具;要分享的文字、二维码和签名仍然可见。文件在当前浏览器处理,后续上传到其他系统须另行确认资料可以分享。

常见问题

我能在这里指定 300 DPI 或 JPEG 吗?

当前 PDF 转图片模式导出 PNG,使用固定 scale 2,没有用户可调的 DPI 或 JPEG 选项。需要特定规格时应选择支持该规格的转换流程并重新验收。

为什么图片尺寸很大,扫描文字还是模糊?

渲染尺度不会补回低清扫描件缺失的细节。对照原 PDF 和导出图的小字,必要时重新扫描或寻找高质量原稿。

转成 PNG 后还能搜索 PDF 的文字吗?

PNG 没有原 PDF 的可选择文字层。保留 PDF 用于搜索;如需识别扫描文字,使用 OCR 流程并人工校对,不要把转图当作 OCR。

参考资料与延伸阅读

按步骤开始处理

进入对应工具,预览处理结果,检查导出的文件。

继续阅读