
OCRmyPDF一条命令免费把扫描 PDF 变成可搜索文档【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDFOCRmyPDF 是一款免费的命令行工具它为扫描 PDF 添加 OCR 文本层让原本只是图片的文档变得可搜索、可复制同时保留原始分辨率。下面以你会遇到哪些问题为主线把安装、中文识别、图像修复、批量处理和输出格式一次讲清楚。先跑通这一条命令整个工具的核心动作就是输入一个 PDF输出一个能搜索的 PDF中间的识别交给 Tesseract一个开源 OCR 引擎完成ocrmypdf scanned.pdf searchable.pdf它不是把整页重新压成一张图再拼回去而是只把识别出的文字垫在原图下方版式和字体不动。所以复制粘贴出来的是真实文本位置也和页面一致。如果你手上还没有装各平台都是一行命令的事Debian/Ubuntu 用apt install ocrmypdfmacOS 用brew install ocrmypdfWindows 在 WSL 里同样走apt。装完敲ocrmypdf --help能列出全部参数比翻网页快。它和手动抠图再识别差在哪很多人会想到用 Ghostscript 或 ImageMagick 把 PDF 转成图片再丢给 OCR 引擎最后合并回 PDF。这条路有两个坑一是图片被重新采样细节丢失、体积反而变大二是原 PDF 里的元数据、矢量内容、多色分区都可能被丢掉。OCRmyPDF 的处理是最小改动——它先把页面栅格化给引擎识别再把文本层塞回原文件原图分辨率、已有文字、旋转信息都尽量原样保留。默认输出还是 PDF/A一个 ISO 归档标准专门保证文件多年后仍能正常打开对需要长期存档的场景更稳妥。中文、日文等多语言识别如何配置识别哪种语言取决于 Tesseract 的语言包有没有装、以及你告诉它去找哪些语言。Linux 上先装对应语言包比如简体中文apt install tesseract-ocr-chi_sim然后在命令里用-l提示它。中英混排的文档可以同时指定两种ocrmypdf -l engchi_sim 扫描件.pdf 可搜索.pdf它依赖 Tesseract 4.1.1 及以上版本会自动在PATH里找到的第一个可用版本不用手动指定。页面歪了、有污渍、方向不对怎么办扫描件的常见问题都能用开关直接处理加在命令里即可--deskew校正倾斜--clean在识别前清理噪点污渍--rotate-pages把方向识别错乱的页面自动转回正确朝向这些开关只在识别前生效不会改动最终输出的图像质量如果你希望清理后的版本也写进输出文件可再加--clean-final。大文件和一堆文件怎么处理三个维度能明显提速或省事多核加--jobs 4让四个核心并行处理页面默认就会尽量用满 CPU。只处理部分页--pages 1-50只跑前 50 页适合先抽样或分段处理上百页的文档也顺带缓解内存压力。批量对目录里所有 PDF 循环处理即可若文件多官方 docs/batch.md 推荐用 GNU Parallel 做并发比单文件循环更快。for f in *.pdf; do ocrmypdf $f out_$f; done输出格式与体积怎么调默认输出 PDF/A-2b。如果你只想要普通 PDF比如某些阅读器会弹 PDF/A 提示加--output-type pdf即可。体积方面--optimize控制压缩强度级别从 0 到 3默认是 1安全压缩调到 3 压缩更狠、文件更小但处理时间更长、且部分图像会转成有损 JPEG。具体各档的取舍可以看 docs/optimizer.md。去哪里查更细的内容仓库里的 docs/ 目录是完整文档docs/introduction.md讲了它为什么不建议手动识别、docs/advanced.md收录了--unpaper-args这类精细控制、docs/plugins.md则是插件扩展的入口。遇到个别报错时docs/errors.md能帮你快速定位。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考