先看结论
先确认文档是否确实只有图像,再用扫描工作台的“OCR 并生成可搜索 PDF”生成新文件。下载 searchable.pdf 后逐页搜索关键词、复制整句并对照画面校对;能够搜到一个词,只能证明部分文字可检索,不能证明全文正确。
先区分没有文字层与阅读器问题
在阅读器中尝试选中一段正常大小的正文,再搜索页面上明确可见的词。换一个阅读器复查,避免把阅读器的选择模式当成文件问题。若文档已有文字层但字符乱码,不应立即重做整个文件;优先向提供者索取正常导出的原件。
保护、加密或使用权限也可能影响复制。请使用你有权处理的未加密副本,不把 OCR 当成解除访问限制的方法。保留原件,给新输出使用不同名称;有签名、附件或重要链接的原文件尤其不适合直接覆盖。
准备一两页代表性材料
先挑一页有普通正文、数字和小字号的材料试做。检查页面完整、方向正确,避免反光、遮挡和严重倾斜。对于一张拍歪的纸,旋转只能纠正角度,不能自动修复所有透视变形。
Tesseract 的识别质量文档讨论了倾斜、噪声和二值化等因素。本站的“手动纠偏”“黑白阈值”“去阴影与亮度均衡”是可尝试的图像处理选项,不能恢复原图中已经丢失的字符。
如果你的输入还是多张照片,可先按图片转 PDF 的材料与页序检查整理完整性。转换本身不会自动增加文字层;不要把合并成功当作 OCR 已经完成。
用扫描工作台生成新的文字层
- 1打开扫描增强与识别工作台,选择 PDF 或图片。初次使用中英文识别资源需要加载;先让小样例完成,再处理整份材料。
- 2根据原图调整手动纠偏。黑白阈值为零时保留灰度处理;修改阈值或亮度均衡后,比较细字、标点和浅色内容是否被削掉,不以背景越白越好作为标准。
- 3选择“OCR 并生成可搜索 PDF”。仅选择“增强扫描件”只会增强图像,不会完成这个文字层任务。
- 4等待任务完成,在输出文件区找到并下载 searchable.pdf。需要纯文本时另保存 ocr.txt;它包含文件与页码分隔信息,便于回查。保留增强图像和原件供校对。
该入口使用英语与简体中文资源,在浏览器中逐页处理。图片和 PDF 页面处理时会受到像素、缩放和设备内存约束;它不是原文件的无损编辑器。
检查最终文件的文字层、页面与交付要求
- 查找:在不同页面各选一个确实出现的词,搜索后确认命中位置。检查中文、英文和数字,别只用封面标题做测试。
- 复制:复制一句包含标点和数字的正文到纯文本编辑器,对照原图检查 0/O、小数点、日期、负号和换行顺序。
- 逐页:比对总页数、方向、边缘内容和画面清晰度。多栏、页眉、脚注或表格应单独检查阅读顺序;一行可选中并不说明结构正确。
- 交付:检查新文件的体积、文件名和接收方要求。OCR 不是压缩保证,也不保证符合所有系统的可访问性或归档标准。
校对 TXT 与 PDF 时不要混淆结果
工作台会从页面图像重新生成 OCR PDF,原有链接、签名、附件与文档结构不能视为被保留。重要原生 PDF 应尽量沿用原件;这一流程主要服务于扫描图像。
修改导出的 TXT 或表格校对区,不会自动回写 searchable.pdf 的文字层。若发现文字层中的关键错误,要使用支持文字层校正的工具或重新改善来源后识别,并再次验证最终 PDF。
单张图片只需要复制文字时,可使用图片 OCR 与逐项校对方法。手写、复杂版式及繁体内容可能不稳定;图像很模糊时,索取清晰原件比反复识别更有价值。
资源加载失败或大文件卡住时怎么处理
识别计算在本机浏览器完成,程序和语言资源仍需要加载。网络或缓存异常可能导致启动失败。先检查小文件能否完成;大型 PDF 可按合理页段另存副本后分批处理,最后合并并重新检查页数。
不要承诺任何设备都能处理固定数量的页。保持页面打开,避免反复点击启动多个任务;保存已经下载的结果。敏感材料是否允许在此设备处理,仍需按你所在组织的规则判断。
常见问题
生成后为什么仍搜不到某些字?
文字层可能有识别错误,或者该段在输入中很小、倾斜或被遮挡。比较原图与复制出来的文本,改善来源后重试;不要用单次搜索成功推断全文无误。
直接修正 ocr.txt 能修改 PDF 吗?
不能。TXT 是独立输出,修改它不会自动更新 PDF 的文字层。请分别验收你最终要交付的文件。
已经能复制的 PDF 也应该做 OCR 吗?
通常先保留正常的原生文字版本。重建扫描 PDF 可能改变画面、体积和文档结构;只有明确需要识别图像内容时再处理副本。
参考资料与延伸阅读
按步骤开始处理
进入对应工具,预览处理结果,检查导出的文件。


