Umi-OCR 批量 OCR 实操:从图片导入到文本导出

发布时间:2026/8/31 14:01:45
Umi-OCR 批量 OCR 实操:从图片导入到文本导出 Umi-OCR 批量 OCR 实操从图片导入到文本导出【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR周五下午五点你要把 40 张会议照片里的文字全部转成可编辑文本明早就要用。在线 OCR 一次传不了几张图还要把文件传到别人的服务器Umi-OCR 是一款免费开源的离线批量 OCR 软件本地运行、无需联网一次能导入几百张图片把图片里的文字按正确顺序整理成 TXT、Markdown 或 CSV 文件。这篇文章就走一遍图片进、文本出的完整流程。Umi-OCR 是什么Umi-OCR 是一个解压即用的绿色软件下载发布包解压后直接运行Umi-OCR.exeLinux 下用umi-ocr.sh不需要安装步骤Windows 7 x64 和 Linux x64 都能跑。识别引擎RapidOCR 或 PaddleOCR随软件一起打包所有识别都在本机完成图片和识别结果不会离开你的电脑。软件界面由几个标签页组成截图 OCR、批量 OCR、文档识别、二维码、全局设置按需打开即可。和常见的在线服务相比差别主要体现在这几点对比项在线 OCR 服务Umi-OCR网络依赖必须联网上传完全离线隐私文件经过第三方服务器全程本机处理批量能力通常限制张数或次数几百张一次导入它内置多国语言的识别库支持中、英、日等语言界面本身也做了多语言首次启动默认跟随系统语言也可以随时手动切换。批量 OCR 从导入到导出下面以40 张会议照片转文本为任务走一遍完整流程。解压启动并打开批量页把发布包解压到一个目录双击Umi-OCR.exe启动切换到 批量OCR 标签页。如果是第一次使用先在 全局设置 里确认界面语言和主题顺手把桌面快捷方式勾上以后开任务会快一些。导入图片并选择识别语言点击左侧列表上方的 选择图片 按钮在文件框里多选或直接把文件夹拖进去导入 40 张照片。支持的格式包括 jpg、png、webp、bmp、tif 等没有数量上限。右栏 设置 → 文字识别 → 语言/模型库 里选择识别语言纯中文图片选 简体中文 就够中英混排选 简体中文英文。这里有个细节容易忽略语言库选得越全单张耗时略增按图片实际内容选即可不用默认拉满。后处理方案与保存格式识别出的文字块如何拼成段落由 排版解析方案段落合并决定。默认方案是 多栏-按自然段换行自动识别多栏布局按自然段落换行大多数文档场景直接用它。图片若是单栏排版选对应的 单栏 系列方案效果更干净。保存文件类型支持 txt、p.txt、mdMarkdown、jsonl、csvExcel等勾选 Separate file 则每张图单独存一个结果文件不勾则合并输出。常用设置整理如下设置项位置说明语言/模型库设置 → 文字识别决定识别哪些文字排版解析方案设置 → 文本后处理默认多栏-按自然段换行保存文件类型设置 → 批量任务txt/md/csv可分文件或合并限制图像边长设置 → 文字识别大图会被缩放调高此值保留精度忽略区域设置 → 文本后处理框选排除水印、页眉页脚开始任务并查看结果点击 开始任务顶部进度条按顺序处理每张图片列表的 状态 列给出每张的置信度分数右栏 记录 区随任务滚动更新识别结果可以直接划选复制也能编辑修正。跑完 40 张后结果文件按你勾选的格式保存在图片所在目录或指定目录整个任务不需要离开这个页面。多栏文档的排版参数怎么选默认参数能覆盖大部分场景下面三种情况需要单独调。双栏学术论文如果你的图片是双栏排版的论文或杂志页保持默认的 多栏-按自然段换行它会自动把两栏内容按阅读顺序合并成自然段落。如果发现某页两栏文字被串到一起把方案换成 多栏-总是换行 再试代价是段落切得更碎。整份 PDF 不用手动转图片直接走 文档识别 标签页支持 pdf、epub、mobi 等格式还能输出双层可搜索 PDF。代码截图代码截图选 单栏-保留缩进它保留行首缩进和行中空格Python、JS 这类依赖缩进的语言结构不会乱识别语言选英文或中英混排库。用 截图OCR 页单张识别时底部有个 隐藏文本 开关把原图上的文字遮住、只留识别结果方便逐行核对识别是否正确。如果你的代码截图背景色深、字体小先放大到正常字号再截比调任何参数都有效。带水印和页码的扫描件扫描件角落的水印、LOGO、页眉页脚会混进结果里。进入 批量OCR 右栏设置里的 忽略区域 编辑器按住右键拖出矩形框把水印可能出现的位置整块包住任务运行时完整落在框内的文本块会被整体忽略。注意只忽略整块跨框边界的文本块仍会保留所以框要画得比水印区域略大。如果你的扫描件是高分辨率整页长图记得在 文字识别 → 限制图像边长 里把数值调高否则图片被缩放后小字会变糊。上百张一起跑时建议分批处理也可以开启任务完成后自动关机睡前把任务交给它。命令行与 HTTP 接口图形界面之外Umi-OCR 也能被脚本调用。命令行入口就是主程序本身比如批量识别一个文件夹并把结果写入文件umi-ocr --path D:/imgs -- D:/result.txt命令行和 HTTP 接口都依赖软件内的 HTTP 服务默认开启主机保持仅本地即可。HTTP 接口提供图片 OCRBase64 传图、文档识别、二维码识别等端点可以把 Umi-OCR 嵌进自己的自动化流程。需要获取源码的话git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR相关文档命令行手册、HTTP 接口手册、更新日志。适合谁需要把大量图片、扫描件、PDF 批量转成文本又不想把文件传上云的学生、办公和开发场景。边界也说清楚模糊低质的手写体精度有限表格图片识别还在规划中目前输出的是文本而非 Excel 表格。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考