扫描版 PDF 看起来有字,却不能搜索或复制,是因为页面可能只有图片。OCRmyPDF 会在扫描页面上加可搜索文字层;目标是让读者能定位文字,同时保留对原始扫描件的回查。它调用 Tesseract 等依赖,识别结果仍可能有错字。
先核对输入和运行环境
准备一份有权处理的两页扫描件 scan.pdf,先记下页数和其中一句容易核对的话,例如第 2 页的“项目验收日期”。保存原件副本,不覆盖唯一文件。按 OCRmyPDF 官方仓库的安装表选择对应系统:Ubuntu/WSL 可用包管理器安装 ocrmypdf;工具还依赖 Tesseract 及所需语言包。执行 ocrmypdf --help 和 tesseract --list-langs,确认命令可用并且语言包列有简体中文所需的 chi_sim。若没有,先按系统安装语言包,不要让默认英语识别中文。

生成新的可搜索 PDF
在含输入文件的目录运行以下命令;-l 指定语言,输出写到另一文件。README 说明 OCRmyPDF 给扫描 PDF 添加 OCR 文字层,并能处理旋转与倾斜页面。页面正常时先不加额外处理选项。
ocrmypdf -l chi_sim scan.pdf searchable.pdf
程序成功结束后,打开 searchable.pdf。第一步核对输出仍有两页;第二步搜索“项目验收日期”并跳转到第 2 页;第三步复制该句与扫描原图逐字比对。页数一致只说明页面没有明显丢失,不能证明文字全对。工具版本和语言包安装方法以你使用时的官方说明为准。
搜索不到或文字错位怎么办
- 提示语言不可用:先检查
tesseract --list-langs,不要把中文输入当英语跑。 - 原页有严重歪斜:在原件副本上尝试
--deskew,然后与不加该选项的版本对照文字位置;README 明确提供此选项。 - 输出仍搜不到关键短语:先看原始扫描字是否足够清晰,逐页人工查错。涉及合同金额、姓名、日期时必须回看图像原件,OCR 不能成为最终事实依据。
- 输入本来有文字层:先判断是否还需要重新 OCR,避免重复处理让已有文字和版式受影响。
这个两页例子是可复核的操作演示,本文没有在读者的 PDF 上执行,也不声称识别准确率。与单张图片 OCR 不同,本题验收重点是 PDF 页数、搜索层和扫描原件的对应关系。官方资料核对于 2026 年 10 月 1 日。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/31566.html