OCRmyPDF 多语言 OCR 实操:中文/日文/韩文扫描 PDF 文字识别 3 步跑通

发布时间:2026/9/2 14:20:54
OCRmyPDF 多语言 OCR 实操:中文/日文/韩文扫描 PDF 文字识别 3 步跑通 OCRmyPDF 多语言 OCR 实操中文/日文/韩文扫描 PDF 文字识别 3 步跑通【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF扫描件里全是图CtrlF 搜个中文直接扑空。OCRmyPDF 做的事不复杂给 PDF 底层叠一层隐形文字让全文搜索真正生效。读完这篇你手上会有一份能直接跑的多语言 OCR 命令和踩坑对照。 30 秒环境自检动手前先跑这一条版本和已装语言一起看tesseract --version tesseract --list-langs版本底线是 4.1.15.4.0 有已知回归 bug 不可用。--list-langs的输出就是当前能用的语言代码清单缺哪个后面补装哪个。如果 Tesseract 压根没装先走系统包管理器装基础版。版本校验与语言包探测逻辑在 src/ocrmypdf/_exec/tesseract.py。语言代码速查 最短安装路径后面所有-l参数都从这张表里挑语言代码包名关键词中文简体chi_simtesseract-ocr-chi-sim中文繁体chi_tratesseract-ocr-chi-tra日文jpntesseract-ocr-jpn韩文kortesseract-ocr-kor英文eng通常预装按系统对号入座各一条命令装完Debian / Ubuntusudo apt install tesseract-ocr-chi-sim tesseract-ocr-jpn tesseract-ocr-kor装完文件落在/usr/share/tesseract-ocr/*/tessdata/tesseract --list-langs再跑一次确认。macOSHomebrewbrew install tesseract tesseract-lang--all-languages标志可以一次拉全部语言包磁盘够用就直接上。Windows从 Tesseract 官方 tessdata 仓库下载目标语言的.traineddata文件丢进安装目录下的tessdata文件夹即可。Docker在Dockerfile里追加RUN apt-get install -y tesseract-ocr-chi-sim镜像构建时就带上。一条命令跑通识别先跑通再谈调参。最简用法就一个参数ocrmypdf -l chi_sim scan.pdf output.pdf输出文件跟原 PDF 外观完全一样只是底下多了一层可搜索文字。混合语言文档用连接ocrmypdf -l chi_simjpneng mixed_doc.pdf out.pdfTesseract 逐页自动检测语言分布不需要你手动分页或指定哪页是哪种语言。调参三件套PSM / OEM / 阈值不用背数字按场景对号入座就行。PSM页面分割模式怎么选默认 3 是全自动检测90% 的文档直接用就行。单栏合同、教材切 6Tesseract 会假设整页是统一文本块省掉段落检测开销速度明显更快。插图多、手写批注重的页面切 11稀疏文本模式不会把图形区域当文字去硬认。OEM引擎模式Tesseract 4 默认走 LSTM 神经网络模式 3 就是自动。绝大多数场景不用碰这个参数跳过。阈值处理--tesseract-thresholding控制图像二值化策略。默认auto覆盖日常场景背景有阴影或渐变的光斑用adaptive-otsu老报纸、泛黄低对比度用sauvola局部标准差。实现见 src/ocrmypdf/builtin_plugins/tesseract_ocr.py 中的阈值转换函数。三个组合场景直接抄常规公文合同不加参数默认即可单栏扫描教材追加--tesseract-pagesegmode 6老报纸 / 泛黄件追加--tesseract-thresholding adaptive-otsu --tesseract-pagesegmode 11 踩坑清单提示语言不可用→ 代码拼错或包没装。zh、cn都不存在只有chi_sim。跑tesseract --list-langs确认缺哪个补装哪个。识别极慢或直接超时→ 扫描分辨率过高Tesseract 对单边超 32767px 的图会报错或卡死。加--tesseract-downsample-large-imagesOCRmyPDF 会自动把超大图像缩到安全阈值以下。日文竖排列序错乱→ 竖排文本需要专用语言包加特定 PSM 配合。换成-l jpn_vert --tesseract-pagesegmode 5再跑。输出 PDF 比输入还大→ 优化阶段被跳过图像层原样保留了。加--optimize 2让 Ghostscript 压缩图像层体积通常能砍掉一半以上。收尾配置速查卡常规文档ocrmypdf -l chi_sim input.pdf out.pdf中日英混合ocrmypdf -l chi_simjpneng --tesseract-pagesegmode 3 input.pdf out.pdf低质量扫描件ocrmypdf -l chi_sim --tesseract-thresholding adaptive-otsu --tesseract-downsample-large-images input.pdf out.pdf单栏高密度文本在上面任意组合末尾追加--tesseract-pagesegmode 6【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考