KitNelo · 全部工具 · Blog
文档与 OCR实用指南

扫描 PDF 不能复制文字怎么办?生成可搜索 PDF 并检查文字层

文件能打开、页面也很清晰,却选不中一句文字,往往是因为页面保存的是图像。此时需要文字识别,而不是再次把图片装进 PDF。本文解决的是“让扫描 PDF 可以查找和复制文字”,与单张图片提取 TXT 的用途不同。

KitNelo发布于 6 分钟阅读
印刷书页上的英文文字特写,部分文字因浅景深模糊,作为扫描文字识别的示意配图
配图:Finn Mund · Unsplash License

先看结论

先确认文档是否确实只有图像,再用扫描工作台的“OCR 并生成可搜索 PDF”生成新文件。下载 searchable.pdf 后逐页搜索关键词、复制整句并对照画面校对;能够搜到一个词,只能证明部分文字可检索,不能证明全文正确。

先区分没有文字层与阅读器问题

在阅读器中尝试选中一段正常大小的正文,再搜索页面上明确可见的词。换一个阅读器复查,避免把阅读器的选择模式当成文件问题。若文档已有文字层但字符乱码,不应立即重做整个文件;优先向提供者索取正常导出的原件。

保护、加密或使用权限也可能影响复制。请使用你有权处理的未加密副本,不把 OCR 当成解除访问限制的方法。保留原件,给新输出使用不同名称;有签名、附件或重要链接的原文件尤其不适合直接覆盖。

准备一两页代表性材料

先挑一页有普通正文、数字和小字号的材料试做。检查页面完整、方向正确,避免反光、遮挡和严重倾斜。对于一张拍歪的纸,旋转只能纠正角度,不能自动修复所有透视变形。

Tesseract 的识别质量文档讨论了倾斜、噪声和二值化等因素。本站的“手动纠偏”“黑白阈值”“去阴影与亮度均衡”是可尝试的图像处理选项,不能恢复原图中已经丢失的字符。

如果你的输入还是多张照片,可先按图片转 PDF 的材料与页序检查整理完整性。转换本身不会自动增加文字层;不要把合并成功当作 OCR 已经完成。

用扫描工作台生成新的文字层

  1. 1打开扫描增强与识别工作台,选择 PDF 或图片。初次使用中英文识别资源需要加载;先让小样例完成,再处理整份材料。
  2. 2根据原图调整手动纠偏。黑白阈值为零时保留灰度处理;修改阈值或亮度均衡后,比较细字、标点和浅色内容是否被削掉,不以背景越白越好作为标准。
  3. 3选择“OCR 并生成可搜索 PDF”。仅选择“增强扫描件”只会增强图像,不会完成这个文字层任务。
  4. 4等待任务完成,在输出文件区找到并下载 searchable.pdf。需要纯文本时另保存 ocr.txt;它包含文件与页码分隔信息,便于回查。保留增强图像和原件供校对。

该入口使用英语与简体中文资源,在浏览器中逐页处理。图片和 PDF 页面处理时会受到像素、缩放和设备内存约束;它不是原文件的无损编辑器。

检查最终文件的文字层、页面与交付要求

  • 查找:在不同页面各选一个确实出现的词,搜索后确认命中位置。检查中文、英文和数字,别只用封面标题做测试。
  • 复制:复制一句包含标点和数字的正文到纯文本编辑器,对照原图检查 0/O、小数点、日期、负号和换行顺序。
  • 逐页:比对总页数、方向、边缘内容和画面清晰度。多栏、页眉、脚注或表格应单独检查阅读顺序;一行可选中并不说明结构正确。
  • 交付:检查新文件的体积、文件名和接收方要求。OCR 不是压缩保证,也不保证符合所有系统的可访问性或归档标准。

校对 TXT 与 PDF 时不要混淆结果

工作台会从页面图像重新生成 OCR PDF,原有链接、签名、附件与文档结构不能视为被保留。重要原生 PDF 应尽量沿用原件;这一流程主要服务于扫描图像。

修改导出的 TXT 或表格校对区,不会自动回写 searchable.pdf 的文字层。若发现文字层中的关键错误,要使用支持文字层校正的工具或重新改善来源后识别,并再次验证最终 PDF。

单张图片只需要复制文字时,可使用图片 OCR 与逐项校对方法。手写、复杂版式及繁体内容可能不稳定;图像很模糊时,索取清晰原件比反复识别更有价值。

资源加载失败或大文件卡住时怎么处理

识别计算在本机浏览器完成,程序和语言资源仍需要加载。网络或缓存异常可能导致启动失败。先检查小文件能否完成;大型 PDF 可按合理页段另存副本后分批处理,最后合并并重新检查页数。

不要承诺任何设备都能处理固定数量的页。保持页面打开,避免反复点击启动多个任务;保存已经下载的结果。敏感材料是否允许在此设备处理,仍需按你所在组织的规则判断。

常见问题

生成后为什么仍搜不到某些字?

文字层可能有识别错误,或者该段在输入中很小、倾斜或被遮挡。比较原图与复制出来的文本,改善来源后重试;不要用单次搜索成功推断全文无误。

直接修正 ocr.txt 能修改 PDF 吗?

不能。TXT 是独立输出,修改它不会自动更新 PDF 的文字层。请分别验收你最终要交付的文件。

已经能复制的 PDF 也应该做 OCR 吗?

通常先保留正常的原生文字版本。重建扫描 PDF 可能改变画面、体积和文档结构;只有明确需要识别图像内容时再处理副本。

参考资料与延伸阅读

按步骤开始处理

进入对应工具,预览处理结果,检查导出的文件。

继续阅读