
Umi-OCR 免费离线OCR完整指南截图、批量、PDF识别 5 步跑通【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费开源的离线 OCR 软件无需联网、无需账号解压后运行Umi-OCR.exe即可对截图、批量图片和 PDF 文档做文字识别。全文带你从拿到压缩包到完成第一次识别再到排版解析、忽略区域等关键配置最后附上高频故障的快速定位方法。从一个扫描件说起把 PDF 里的字取出来假设你手上有一份扫描版 PDF 合同几百页全是图片你想把里面的文字提取出来方便搜索和复制。把文件丢给各类在线识别网站要么有页数上限要么要上传到别人的服务器——合同这种文件你大概率不想这样做。Umi-OCR 解决的就是这类问题。它在本地运行识别引擎所有图片都不出你的电脑核心能力有四块截图 OCR全局快捷键唤起截图框选完即出文字支持多栏排版解析批量 OCR一次性导入几百张图片识别结果按txt、csvExcel、jsonl、md等格式保存文档识别把 PDF、epub、mobi 等扫描件 OCR 成双层可搜索 PDF原图在下、文字在上既能搜又能选二维码识别或生成二维码支持 QRCode、EAN13、PDF417 等 19 种协议。它依赖的离线引擎是 RapidOCR默认插件兼容性好Windows 7 x64 也能跑和 PaddleOCR速度稍快识别语言库内置简体中文、英文、日文、韩文等版本演进细节见 CHANGE_LOG.md。快速起步5 步完成第一次识别第 1 步拿到发布包。仓库根目录自带发布包 Umi-OCR_Rapid_v2.1.5.7z用 7-Zip 或好压解压即可。如果你需要查看或二次开发源码可以用git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR克隆主仓库Python 源码在 UmiOCR-data/py_src/ 下。第 2 步解压到纯英文路径。软件解压即用不写注册表放哪都能跑建议路径里不要出现中文或空格避免个别组件解析路径时出意外。第 3 步启动程序。双击解压目录里的Umi-OCR.exe。 ✅ 成功标志主窗口弹出默认打开截图 OCR标签页界面语言跟随系统自动切换比如中文系统显示简体中文菜单。第 4 步做第一次截图识别。在截图 OCR标签页点击右侧截图按钮屏幕变暗后用鼠标框选一段文字。 ✅ 成功标志约 1 秒内右侧识别记录栏出现框选区域内的文字可以直接划选复制。第 5 步可选验证命令行。打开 cmd在解压目录下执行umi-ocr --help✅ 成功标志输出指令帮助文本。命令行和 HTTP 接口的完整参数见 docs/README_CLI.md接口文档见 docs/http/README.md。看到以上标志说明环境已经跑通下面开始调配置。深度定制4 个最影响体验的设置项排版解析让识别结果按阅读顺序输出为什么要配OCR 引擎输出的是文本块集合顺序按坐标排。遇到双栏文章原始结果会把左右两栏的句子交错拼在一起遇到代码截图默认换行会破坏缩进。排版解析就是在引擎输出之后按阅读习惯重排。推荐值普通文章、网页截图 →多栏-按自然段换行默认适合大多数场景代码截图 →单栏-保留缩进保留行首空格粘进编辑器不串行只要原始结果 →不做处理。设置入口在截图 OCR或批量 OCR标签页的右侧设置栏文本后处理处截图页与批量页共用同一套方案。限制图像边长大图、长图被截掉时的开关为什么要配为了控制耗时和内存引擎默认会把输入图缩放到最长边 960 像素再识别。普通截图没问题但识别 A3 扫描件、手机长截图时小字缩到看不清结果就是缺字或整段丢失。推荐值识别大图或长图时进入批量页设置 → 文字识别 → 限制图像边长从 960 调到 2880 或 4320机器是近两年的四核以上 CPU 的话4320 的耗时通常在单张几秒内可接受。内存较小的老机器留在 2880。渲染器界面错位、截图闪烁时先动这里为什么要配主界面默认走显卡硬件加速渲染。部分老显卡驱动尤其 Windows 7 上的旧驱动与硬件加速方案冲突表现为截图选区闪烁、控件错位、文字发虚。推荐值出现上述现象时进全局设置 → 界面和外观 → 渲染器切换到软件渲染方案或关闭硬件加速。渲染方案不影响识别精度只影响界面绘制切换后如常即可保留。全局快捷键把最常用动作绑到键盘上为什么要配截图识别是高频动作每次点开窗口再点按钮很拖节奏。截图 OCR标签页支持录制全局快捷键配置一次后任何界面下按一下组合键就弹出截图框Esc可随时取消。推荐值选一个不与输入法、截图工具冲突的组合如CtrlAltQ。录制后在系统托盘保持程序后台运行即使主窗口隐藏快捷键依然有效——这是 v2.1.5 起后台模式的默认行为。实战演练3 个日常场景走一遍场景一网页双栏文章 → 有序纯文本输入一篇双栏排版的网页长截图。操作快捷键唤起截图框选全文 → 确认文本后处理为多栏-按自然段换行→ 识别。预期输出右侧记录栏中文字按先读完左栏再读右栏的自然顺序输出段落间正常换行不再左右交错划选记录区文字即可复制。场景二100 张带水印的票据图片 → 批量导出 TXT输入一个文件夹里的 100 张jpg票据照片右下角都带同一个水印 LOGO。操作打开批量 OCR标签页 → 拖入整个文件夹 → 在右栏忽略区域编辑器中按住右键画一个矩形把水印可能出现的位置整个框住 → 输出格式选txt 单独文件→ 点击开始。预期输出每张图在同级目录生成同名.txt正文里没有水印文字忽略区域只剔除完整落在框内的文本块框尽量画大100 张图在普通双核机器上通常几分钟内跑完跑完前页面支持暂停、继续。场景三扫描版 PDF 合同 → 双层可搜索 PDF输入一份 80 页的扫描 PDF页眉有公司抬头、页脚有页码。操作打开文档识别标签页需 v2.1.4 及以上版本→ 拖入 PDF → 用忽略区域设定页眉页脚两条横带 → 保存类型选双层可搜索 PDF → 开始任务。预期输出生成一个新 PDF用任意 PDF 阅读器打开后可以全文搜索甲方、选中文字复制且原扫描件底图不变形。若不想整页重跑 OCR也可只提取文档自带的文本层。疑难急救4 个高频问题的快速定位症状截图选区闪烁、界面控件错位可能原因硬件加速渲染与显卡驱动冲突多见于老驱动或 Windows 7 环境。解法全局设置 → 界面和外观 → 渲染器切到软件渲染。定位动作切换后立即框选一次屏幕选区稳定不闪即为解决无需查日志。症状大图识别缺字、整段文字丢失可能原因图像边长被默认 960 的限制缩放小字分辨率不足。解法批量页设置中限制图像边长调到 2880 或 4320。定位动作拿同一张图分别用 960 和 2880 各识别一次对比缺字是否消失即可确认是这个参数。症状识别结果乱码或输出成别的语言可能原因识别语言库选错了比如英文图选了中文模型。解法在对应标签页截图/批量的设置里把语言/模型库切回简体中文混排严重的图可换用 PaddleOCR 插件对比。定位动作用一张纯简体印刷体图快速验证——该语言库能正确识别它说明问题在输入图手写体、艺术字本身而非配置。症状命令行umi-ocr或程序调用接口无响应可能原因HTTP 服务未开启命令行依赖本地 127.0.0.1:1224 回环通信传递指令。解法全局设置中确认HTTP 服务已允许主机保持仅本地即可。定位动作v2.1.5 起有日志机制打开UmiOCR-data/logs目录查看 ERROR 级以上日志同时执行umi-ocr --help能打印帮助说明进程通信正常问题在服务开关一侧。配置备份也很简单所有界面参数最终存于UmiOCR-data/.settingsini 格式复制这个文件就是完整配置备份换新机器解压后放回原目录即可还原。跑通上面 3 个场景后你已经有了一套完全离线的文字提取流水线截图即取、批量走量、PDF 出可搜索文档。后续想扩展识别引擎或接入 HTTP 服务直接翻 docs/http/README.md 的接口示例即可。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考