KitNelo · 全部工具 · Blog
文档与 OCR实用指南

PDF 只想发其中几页?提取页码、核对顺序与交付检查

收到一份很长的 PDF,只需要发送其中的表格或说明页时,截图容易漏边,直接发整份又会带上不需要的内容。页面提取可以生成较短的新 PDF,但先要解决一个常见误差:阅读器里的第几页,不一定等于纸面上印着的页码。

KitNelo发布于 5 分钟阅读
印刷书页上的文字特写,作为检查提取文档页面的示意配图
配图:Finn Mund · Unsplash License

先看结论

先按阅读器的页面位置列出保留范围,再在 PDF 工具中选择页面提取,生成新文件。本站按原文档位置升序排列所选页并去掉重复页码;它不会按输入次序重新编排,也不会替你在保留页内进行涂黑脱敏。

把页面位置和印刷页码对上

一份文件可能先放封面、目录,再从纸面上的第 1 页开始正文。使用阅读器的页数计数或缩略图位置,确认你要提取的内容到底位于文件的哪几页。不要仅凭页脚数字输入范围。

准备一张小清单:来源文件、需要的内容、阅读器中的页位和交付目的。若你要的是正文第 1–3 页,而前面有两页封面目录,实际页面位置可能是 3–5;这是编辑示例,必须以自己的文件确认。

本站提取会怎样处理范围

页面提取使用 PDF-LIB 的页面复制能力,把选定页面放进新的文档。本站的范围输入以 1 为第一页;连续页使用短横线,多个范围使用英文逗号,例如 2-4, 7。

当前实现会合并重复页码并按来源位置升序排列。因此输入 7, 2-4,输出仍是原文档的第 2、3、4、7 页,不会让第 7 页排在前面。需要不同顺序时,要使用能明确重排页面的工作流,不能把范围输入当作排序器。

生成只包含指定页面的新 PDF

  1. 1打开PDF 工具,选择“PDF 拆分与页面提取”,添加一份有权处理的非敏感 PDF。
  2. 2在“提取页码”中输入已核对的页面位置,先用少量页面试做。不要选到“删除页码”,两种操作保留的内容不同。
  3. 3开始处理,等待生成和下载完成。页码超出总页数、格式不正确或没有有效保留页时,需要先修正输入。
  4. 4打开下载的 extracted-pages.pdf,逐页对照原文档。示例范围 2-4, 7 应得到 4 页,依次对应来源位置 2、3、4、7。
  5. 5用能说明用途的文件名保存副本,例如 project-notes-selected-pages.pdf,再检查准备发出的附件确实是新文件。

检查页数之外,还要检查内容

提取不会自动把扫描图片变成文字。结果仍不能搜索时,按扫描 PDF 文字层检查流程处理,并检查 OCR 后的内容。若下一步要组合多个片段,可以参考PDF 合并与交付检查。

  • 首页和末页都是预期内容,中间页面没有缺漏,横向页面方向正确。
  • 表格、脚注、图片边缘和跨页段落完整;若抽取页引用上一页,补上必要上下文或说明。
  • 能复制文字的原文件,在新文件中检查选择与搜索是否仍满足任务;表单、书签、链接或签名等特殊内容需要单独核对。
  • 文件名与附件预览对应,收件者不会把片段误认成完整文件。

提取页面不能替代页内脱敏

没有选择的页面不会成为本次提取结果中的页面,但被保留页上的姓名、号码、批注或其他细节仍需检查。不要把白色矩形覆盖、截图遮挡或页面拆分当作已完成专业脱敏的证明;需要删掉页内敏感内容时,使用专门的脱敏流程并核验最终文件。

本站在浏览器本地处理输入 PDF,不主动上传到转换服务器。密码保护或损坏的文件可能无法处理;工具不负责解密,也不承诺保留原有数字签名有效性或所有交互特性。重要表单或正式签署文件,先向接收方确认可接受的交付形式。

原文件保留不动。新文件能打开只是第一步,页位、上下文与分享范围都通过后再发送。

常见问题

输入 5, 1 为什么第一张不是第 5 页?

本站按来源页位升序输出,并去掉重复页码。范围是选择条件,不是自定义排序指令。

纸面上的第 10 页为什么提错了?

封面、目录或其他前置页可能使印刷页码与文件页位不同。回到阅读器的页面计数或缩略图重新对应。

提取后文件能打开,就可以放心发送吗?

还要核对所有保留页、上下文和可见敏感内容。页面提取不等于页内脱敏,特殊表单、签名和交互功能也需单独检查。

参考资料与延伸阅读

按步骤开始处理

进入对应工具,预览处理结果,检查导出的文件。

继续阅读