Umi-OCR 实战教程:从截图文字识别到批量 OCR 与自动化集成的完整路径

发布时间:2026/9/13 2:36:10
Umi-OCR 实战教程:从截图文字识别到批量 OCR 与自动化集成的完整路径 Umi-OCR 实战教程从截图文字识别到批量 OCR 与自动化集成的完整路径【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源的离线OCR文字识别工具解压后的程序无需联网即可运行识别过程全部在本地完成可以当作免费离线文字识别工具长期使用。这份教程按先跑通、再深入的顺序展开先带你完成第一次截图文字识别随后逐个讲清截图识别代码、批量文档OCR、OCR自动化集成三块核心能力的使用方式最后给出引擎选型、配置调优与排错建议。读完之后你可以用框选方式提取代码文本对一个文件夹的图片跑批量OCR并在自己的脚本里调用 Umi-OCR。第一次识别三步完成首张截图文字识别⚡ Umi-OCR 不需要安装。下载包是 7z 压缩包或自解压包解压后双击Umi-OCR.exeLinux 下运行umi-ocr.sh即可不装环境、不联网。第一次截图识别的完整操作只有三步打开主窗口的截图OCR标签页软件启动时的默认页。按下默认截图快捷键CtrlShiftA可在全局设置中自定义在屏幕上框选目标区域后松手。识别结果出现在右侧记录栏右键即可复制也可选中多条记录一起复制左侧图片预览上直接用鼠标划选也能复制。下图是一个典型场景一张 Python 代码截图被框选后右侧立刻出现识别结果缩进与行序基本保留可以直接粘回编辑器。三大核心能力详解截图识别、批量文档OCR与自动化集成这三项能力都是主窗口里的标签页下面按功能模块拆解方便按需查看。截图识别框选即得屏幕文字框选一下把屏幕上的文字提出来。进入截图OCR页按快捷键框选区域等待识别完成。右栏设置里按内容类型挑选排版解析方案。记录栏右键复制或选中多条记录一起复制别处复制的图片也能直接粘贴进来识别。关键参数排版解析方案对应tbpu.parser常用取值如下选项参数值适合的内容多栏-按自然段换行multi_para普通文档、多栏排版默认值多栏-总是换行multi_line结构化内容每行强制换行单栏-保留缩进single_code代码截图保留缩进与行中空格不做处理none引擎原始输出选型上截图识别代码时建议选single_code以保留缩进普通文档用默认的multi_para通常就很好用。批量处理一次跑完批量文档OCR把一文件夹图片丢进去拿回一组文本文件。打开批量OCR页拖入图片支持 jpg/png/webp/bmp/tif 等格式。右栏选择保存路径与文件类型txt / jsonl / md / csv(Excel)。图片带水印、页眉页脚时进入忽略区域编辑器按住右键画框框尽量画大完全落在框内的文本块才会被丢弃。点击开始任务可勾选任务完成后自动关机或待机。关键参数输入图片无数量上限识别超长图、大图时把右栏设置里的限制图像边长调高即可对应的 API 参数是tbpu.ignoreArea矩形坐标。选型建议批量任务先确认输出格式与忽略区域能减少不少返工跑大批量时可以直接配合关机选项挂机执行。自动化集成HTTP API 与命令行调用不开图形界面让脚本完成文字识别这就是 OCR 自动化集成。确认软件在运行且 HTTP 服务开启默认开启仅本地环回默认端口 1224。本机快速任务走命令行umi-ocr --path D:/a.png --clip把结果复制到剪贴板用--output写文件。程序化集成走POST /api/ocr传入 Base64 图片返回 JSON 结果。接口手册见 docs/http/README.md。import base64, json, requests with open(sample.png, rb) as f: img_b64 base64.b64encode(f.read()).decode(utf-8) resp requests.post( http://127.0.0.1:1224/api/ocr, json{ base64: img_b64, options: { data.format: text, tbpu.parser: multi_para, }, }, ) print(json.loads(resp.text))命令行识别会沿用截图OCR页的参数设置HTTP 调用并发支持有限建议串行发起。完整命令行手册见 docs/README_CLI.md。引擎选型与配置调优PaddleOCR 和 RapidOCR 怎么选Umi-OCR 内置两套离线引擎识别都不走网络差别主要在定位与参数丰富度维度PaddleOCR-jsonRapidOCR-json定位速度稍快参数选项丰富语言模型、边长限制等兼容性好轻量稳定典型用途文档、多语言内容对兼容与稳定要求高的场景切换方式全局设置中切换 OCR 插件对应UmiOCR-data/plugins下的插件同左按文档类型搭配参数时可以直接参考这张表文档类型推荐引擎ocr.limit_side_len排版解析tbpu.parser语言模型代码截图RapidOCR960single_codeconfig_en.txt中文扫描文档PaddleOCR960~2880multi_paraconfig_chinese.txt日/韩文文档PaddleOCR960~2880multi_paraconfig_japan.txt/config_korean.txt超长/大图PaddleOCR2880~4320multi_para按内容语言选择界面上所有设置最终都保存在./UmiOCR-data/.settingsini 格式手动改完文件后执行umi-ocr --reload即可重新加载生效。常见键如下ocr.language models/config_chinese.txt ocr.cls false ocr.limit_side_len 960 tbpu.parser multi_para data.format text切换识别语言模型用ocr.language适用于 PaddleOCR 引擎插件其他引擎请通过GET /api/ocr/get_options查询可用参数可选值包括config_chinese.txt简中、config_en.txt英文、config_chinese_cht(v2).txt繁中、config_japan.txt日文、config_korean.txt韩文、config_cyrillic.txt俄文。界面语言是另一层设置全局设置→语言/Language。软件首次启动会跟随系统语言之后可随时手动切换成英语、日本語等。排错速查与深度优化识别不准、速度偏慢怎么办遇到问题时建议先查下表再决定改哪里现象常见原因解法识别不准、漏字图片过大被压缩、方向颠倒ocr.limit_side_len调高到 2880/4320开启ocr.cls方向校正速度略降水印/页眉页脚干扰未排除干扰区域批量页右键绘制忽略区域框画大些API 端传tbpu.ignoreArea批量识别慢大图多、边长限制偏高边长限制取 960 兼顾速度简单文档换 RapidOCR 试试界面闪烁、UI 错位显卡加速渲染冲突全局设置→界面和外观里更换渲染器或关闭硬件加速HTTP 调用偶发ECONNREFUSED长时间连续调用、后端压力重新发起请求即可尽量串行调用、避免并发 渲染器、主题、字体这些界面项都在全局设置里调整改动即时生效不需要重启。两条进阶技巧点到为止不改界面也能调参直接编辑./UmiOCR-data/.settings再执行umi-ocr --reload重载。脚本化驱动命令行本质上等价于向本地/argv接口发送参数umi-ocr --screenshot --clip一条命令就能完成框选→识别→入剪贴板。总结与资源导航从日常使用到二次开发✅ 回顾一下Umi-OCR 的要点有四条免费开源、离线本地运行数据不出本机截图 / 批量 / 文档识别 / 二维码几类模块覆盖日常场景引擎与参数可按文档类型切换命令行与 HTTP 接口天然支持脚本集成。一个值得记住的小细节识别记录积累多了以后截图OCR页可以右键记录栏选择复制全部删除选中记录或清空全部记录如下图菜单所示。进一步学习均为项目内本地文件点开即读命令行手册docs/README_CLI.mdHTTP 接口手册docs/http/README.md图片识别 APIdocs/http/api_ocr.md文档PDF识别 APIdocs/http/api_doc.md二维码 APIdocs/http/api_qrcode.md参数总览docs/http/argv.md项目说明与更新日志README.md、CHANGE_LOG.mdPython 源码UmiOCR-data/py_src/二次开发时从这里入手【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考