
OCRmyPDF 指南10 分钟把扫描 PDF 变成免费可搜索文档【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDFOCRmyPDF 是一款免费开源的命令行 OCR 工具给扫描版 PDF 的每页图像下方叠加一层隐藏文本。输出文件看起来和原文件一模一样但从此能搜索、能复制。识别全程在本机完成文件不出机器也不按次收费。扫描 PDF 为什么搜不了字扫描版 PDF 本质上是图片。对它按 CtrlF搜不到任何词想选中文字复制也选不中。文件本身没问题只是缺了一层文字层。很多人第一反应是传到在线 OCR 服务。麻烦有两处文件要上别人服务器隐私和画质都不可控而且这类服务大多按量收费或限制识别次数。OCRmyPDF 走的是另一条路识别在本地完成输出保留原始图像的嵌入分辨率不重新压缩。原页面内容一个像素都不动只在下面压一层文字。安装 OCRmyPDF 并跑通第一条命令按平台三选一apt install ocrmypdf # Debian / Ubuntu brew install ocrmypdf # macOS pip install ocrmypdf # Windows 等其他系统三条各管一个平台装完即用。Windows 还需要 Tesseract 和 Ghostscript 两个依赖具体步骤见安装文档。然后跑第一条命令ocrmypdf 扫描.pdf 可搜索.pdf第一个参数是输入文件第二个是输出文件。验证方法很简单用 PDF 阅读器打开输出文件按 CtrlF 搜一个词——能命中、能选中复制就说明文本层加上了。输出默认是 PDF/A 归档格式适合长期保存。三种常见麻烦与对应解法中文识别怎么配OCRmyPDF 默认按英文识别。中文或其他语言的文档要先告诉它语言ocrmypdf --language chi_simeng 文档.pdf 输出.pdfchi_simeng表示简体中文加英文中英混排一次就能识别。为什么要显式指定识别引擎按语言加载不同字符集不指定的话中文文档命中率明显变差。它基于 Tesseract 引擎语言包总数在 100 种以上。扫描件歪斜脏污如何预处理扫描件常见问题是整页倾斜、带阴影斑点。开两个开关先摆正去噪再识别ocrmypdf --deskew --clean-final 歪斜.pdf 输出.pdf--deskew检测并纠正倾斜角--clean-final做图像清理。识别跑在处理后的图像上底子干净了文字命中率自然更高。大文件分批处理或多核并行两条提速路径。文件页数多到内存吃紧时用--pages指定页码范围分批处理ocrmypdf --pages 1-50 大文件.pdf 部分1.pdf先处理第 1 到 50 页再跑下一批避免整份文件一次载入。内存够用只是嫌慢就用--jobs把活分给多个核心ocrmypdf --jobs 4 大文件.pdf 输出.pdf4 核机器写 4多页同时识别速度随核心数上去。两个贴近日常的使用场景票据账单批量处理存了几年的发票、账单又歪又脏、一文件夹。--deskew --clean-final组合先摆正去噪再识别比直接扫更准。几十份文件可以配合 GNU Parallel 并行排队晚上挂机跑完官方文档里有现成的批量命令见批处理指南。老文档长期存档上面所有命令的默认输出都是 PDF/A-2bISO 标准定义的归档格式字体资源全部内嵌、不依赖外部环境放十年二十年还能正常打开。扫描的老报纸、老合同要长期保存用默认设置即可不想要归档格式加--output-type pdf输出普通 PDF。OCRmyPDF 常见报错速查提示缺少语言包对应的 Tesseract 语言包没装。用系统包管理器安装即可Debian/Ubuntu 上中文简体是tesseract-ocr-chi-sim完整列表见语言文档。page already has text页面已有文字文件里已经有文字层OCRmyPDF 拒绝重复劳动。通常说明文件本身就能搜索不用处理确要重新识别就加--force-ocr想让文字页原样跳过就加--skip-text。not a valid PDF不是有效 PDF文件损坏或拷贝不完整。OCRmyPDF 会先尝试自动修复修不好就先让 Ghostscript 重写一遍文件再喂给它。识别结果一片乱码多半是输入质量的问题——扫描太模糊或者没配语言参数。先确认图像分辨率够不够、语言参数写没写工具本身对低质量扫描件没有魔法。继续深入的入口官方文档首页入门介绍、语言支持、发布说明Cookbook常用命令组合与技巧错误参考完整报错清单与逐条解释性能调优大批量处理的提速手段核心源码主程序、CLI 入口与处理管线内置插件OCR 引擎、Ghostscript、优化器都在这想定制流程从这里看【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考