不用联网的 OCR 工具 Umi-OCR:截图、批量、PDF 识别完整实操(附 7 个避坑技巧)

发布时间:2026/8/21 4:44:01
不用联网的 OCR 工具 Umi-OCR:截图、批量、PDF 识别完整实操(附 7 个避坑技巧) 不用联网的 OCR 工具 Umi-OCR截图、批量、PDF 识别完整实操附 7 个避坑技巧【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR有些文件你是打死也不敢传上网的扫描版合同、身份证照片、还没公开的论文初稿。可偏偏它们全是图片屏幕上选不中、复制不了只能对着显示器一个字一个字手打。更要命的是那些在线识别网站要么限大小、限次数要么得先把你这些敏感资料上传到别人的服务器上。Umi-OCR 就是为这种时刻准备的——一款完全离线运行的 OCR 软件识别引擎整个装在你电脑本地图片不离开硬盘文字随取随用。不注册、不联网、不限额识别多少张、什么时候识别全由你自己说了算。一句话定位Umi-OCR 就像装在你电脑里的一台文字复印机——屏幕上、图片里、扫描件上的字本地识别、即拿即用比任何云端工具都更自由、更放心。这篇实操指南会带你走完四段路先花三分钟把软件跑起来再按一张图 → 一本册子 → 一堆图片的顺序逐个摸清核心能力然后学会用几个旋钮微调体验最后把高频翻车现场一次性排干净。三分钟跑起来下载、解压、双击Umi-OCR 是绿色软件不需要安装这也是它最省心的地方。上手只需要三步下载从项目发布页获取.7z压缩包或.7z.exe自解压包——如果电脑没装压缩软件选自解压包双击即可自动解开。解压把压缩包解压到任意目录比如D:/Tools/Umi-OCR。注意路径里不要带中文和空格能省掉很多莫名其妙的兼容问题。启动Windows 双击Umi-OCR.exeLinux 运行umi-ocr.sh。第一次启动时软件会自动读取系统语言把界面切成对应语言想手动换随时去全局设置里改。程序主体由多个标签页组成——截图OCR、批量OCR、文档识别、二维码、全局设置像浏览器标签栏一样想用哪个点哪个还能锁住常用标签防止误关。这里有一个新手最容易踩的坑启动前把软件目录加进杀毒软件白名单。因为 Umi-OCR 内置了本地 OCR 引擎和运行库部分杀软会误报加白名单能省掉后续大量为什么闪退的烦恼。核心能力拆解从一张、到一本、再到一堆一张截图识别——看见什么复制什么日常最高频的场景就是屏幕上有一段字想立刻抓走。打开截图OCR标签页按快捷键唤起截图框划出目标区域识别结果会立刻出现在右侧记录栏里。几个非常实用的小习惯不用截图也能识别在别处复制一张图片比如聊天窗口里的图回到 Umi-OCR 直接粘贴它照样帮你识别。结果可以二次编辑右侧记录栏里的文字能直接改错还能划选多条记录一起复制。识别完顺手就能整理成想要的格式不用再跳去别的编辑器。竖排文字也不怕排版解析会自动处理横排和竖排从右到左的文本只要 OCR 引擎本身支持竖排语言即可。截图识别只是开胃菜真正的大活还在后面两节。一本文档识别——整本扫描版 PDF 一次搞定如果说截图是开胃菜文档识别就是 Umi-OCR 的压轴菜。它支持pdf、xps、epub、mobi、fb2、cbz六种格式其中扫描版 PDF 是最典型的场景。底层逻辑可以概括成三步解析 → 识别 → 重组。PDF 先被解析引擎底层依赖 PyMuPDF拆开区分出本来就有的文本层和需要 OCR 的扫描图片层扫描页交给本地 OCR 引擎逐页识别最后按阅读顺序重新拼装输出成你指定的格式。有两个亮点值得展开双层可搜索 PDF这是很多人的刚需。对扫描版 PDF 做 OCR 后输出成底层是原图、上层是透明文字的双层 PDF。外观上和原扫描件一模一样但里面的文字可以搜索、复制、划线。给公司做历史合同归档、给学校做论文数字化都能直接顶上去。灵活的提取模式Umi-OCR 会优先提取 PDF 自带的文本层速度快、零识别误差只有遇到纯扫描页才自动切到 OCR。你也可以主动选择整页强制 OCR或反过来只提取原文本。从 v2.1.2 起还支持输出单层纯文本 PDF——想要体积小、好编辑的文件时选它。文档识别同样支持忽略区域可按页码范围设置用来排除扫描件的页眉页脚也能设置任务完成后的自动关机。如果家里有一堆扫描版旧书要转成可搜索存档这个标签页能帮你省下大量人工。一堆批量识别——几百张图片一口气处理遇到几十上百张截图、扫描件、相册照片一张张截屏识别就太亏了。切到批量OCR标签页把图片直接拖进窗口支持jpg、png、webp、bmp、tif、tiff等常见格式一次拖几百张也没有数量上限。点下开始任务右侧会逐张显示文件耗时、置信度和识别结果。任务跑完可以按需输出成txt、jsonl、md、csvExcel 可直接打开四种格式。对于深夜挂机场景它还支持任务完成后自动关机或待机——睡前扔进去几百张图醒来直接收结果。v2.1.2 起还支持暂停任务只要软件不退出待机/休眠后可以接着跑。批量结果的降噪开关忽略区域批量识别有个高频痛点图片角落的水印、LOGO、页眉页脚每次都会混进结果里还要人工删。Umi-OCR 的忽略区域功能就是为这个设计的。在批量识别页的右侧设置里进入忽略区域编辑器按住右键在图片上绘制多个矩形框把水印可能出现的位置全部框住识别时这些区域内的文字就会被自动排除。做论文批量转换时用这个功能把统一的页眉页脚一次框掉输出会干净很多。这里有一个必须记住的机制只有完全处于矩形框内部的整个文本块才会被忽略而不是单个字符。所以画框时宁可大一点把水印所有可能出现的位置都包住否则漏框一次结果里就混进一行杂音。顺手的小甜点二维码识别与生成识别和生成二维码也内置在软件里无需额外工具。扫聊天记录里的二维码、把链接生成图片发给别人都只是切个标签页的事。命令行下还能用一条指令批量生成指定尺寸的二维码见下文进阶玩法。四个旋钮把 Umi-OCR 调到最顺手软件好不好用很多时候取决于会不会调参数。把下面四个旋钮拧到位体验会上一个台阶。旋钮一选对 OCR 引擎软件默认内置Rapid-OCR兼容性好和PaddleOCR速度快一些两套引擎在全局设置里可以随时切换。遇到识别不准或报错先换引擎试试常常比调别的参数更有效。旋钮二界面语言与识别语言分开调界面语言支持中文、繁体中文、英文、日文、俄语、葡萄牙语等多种由社区译者协作维护版本更新还会持续新增。切换路径是全局设置 → 语言/Language。顺带提醒界面语言和识别语言库是两回事。前者管按钮菜单长什么样后者管 OCR 引擎认哪种文字。识别语言库可以在各标签页的文字识别设置里单独选择或下载。比如界面用中文、日常识别日文书籍二者完全可以搭配使用。旋钮三排版方案——给 OCR 结果排座位OCR 引擎吐出来的文字往往是散装的谁先谁后要看排版解析怎么安排。Umi-OCR 内置了多套预设方案选对方案输出才符合阅读习惯方案适用场景多栏-按自然段换行两栏/三栏排版的论文、书籍自动按段落断行最常用多栏-总是换行每句独立成行适合后续按行处理多栏-无换行强制整段合并成一行单栏-按自然段换行单栏文档段落自然换行单栏-保留缩进代码截图专用保留行首缩进和行中空格不做处理OCR 引擎原始输出不做任何整理其中单栏-保留缩进值得单独表扬把代码截图扔进去输出能基本保持缩进结构配合截图识别简直是程序员的福音。如果你不确定选哪个直接选多栏-按自然段换行就对了它能覆盖大多数场景遇到特殊排版再回来逐个切换对比。旋钮四性能三件套——大图、内存与渲染器三个常见性能问题的应对方法识别长图/大图不完整去文字识别设置里调高限制图像边长。默认边长限制是为了平衡速度与内存遇到像素特别大的长截图适当调高数值即可。注意不要盲目放大原图——过度放大会增加噪声反而降低准确率。内存占用偏高如果用的是 PaddleOCR 插件v2.1.4 起默认内存占用被限制在系统总内存的一半以内想进一步压内存可以在插件配置里调低线程数。截屏闪烁或界面错位这是显卡渲染兼容问题去全局设置 → 界面和外观 → 渲染器切换渲染方案或直接关闭硬件加速通常能解决。7 个高频问题避坑清单对号入座把最常见的报错和误区集中成一份清单遇到问题直接对照着查忽略区域画了却没效果→ 检查矩形框是否够大——只有整个文本块完全在框内才会被忽略再确认是否保存了忽略区域配置。长图识别结果缺胳膊少腿→ 调高限制图像边长而不是盲目放大原图过度放大会增加噪声反而降低准确率。截图时界面闪烁、错位→ 切渲染器或关闭硬件加速见上文性能三件套。命令行指令没反应→ Umi-OCR 依赖本地 HTTP 服务进行进程间通信请确认全局设置里 HTTP 服务已开启默认开启且仅监听本地环回、不经过物理网卡数据不会外泄另外命令行入口要用主程序Umi-OCR.exe备用启动器可能不支持。批量任务想中途休息→ v2.1.2 起支持暂停任务只要软件不退出待机/休眠后可以继续跑。代码截图排版全乱了→ 排版方案切到单栏-保留缩进。文件夹里有几万个文件加载很卡→ v2.1.5 优化了异步加载机制遇到超大文件夹稍等加载完成再操作预览界面会显示加载进度。进阶玩法把 Umi-OCR 嵌进你的工作流对普通用户来说图形界面已经够用但如果你想把它嵌入自己的工作流Umi-OCR 还提供两条程序化通道。命令行模式入口就是主程序本身所有指令支持简写比如--screenshot可写--sc还能用小写文件名调用。几个常用姿势# 截屏识别结果直接进剪贴板 umi-ocr --screenshot --clip # 识别指定图片结果输出到文件 umi-ocr --path D:/扫描件.png --output result.txt # 识别整个文件夹含子目录结果追加到文件 umi-ocr --path D:/scans -- all_result.txt # 生成二维码指定宽高 umi-ocr --qrcode_create 你好Umi-OCR D:/qrcode.png 256 # 指定显示器与区域自动截图无需鼠标划选 umi-ocr --screenshot screen1 rect50,100,300,200配合快捷键工具如 HotkeysCMD还能实现按一个键自动截指定屏幕区域并识别的操作。指令的具体参数和简写规则见项目内命令行手册docs/README_CLI.md。HTTP 接口Umi-OCR 启动后本地 HTTP 服务提供 OCR、文档识别、二维码等接口接口文档在 docs/http/api_doc.md。开发者可以用几十行代码把它封装成局域网内的小工具或接入自己的自动化流程实现上传图片 → 返回 JSON 识别结果。引擎与插件生态软件默认内置 Rapid-OCR 与 PaddleOCR 两套引擎全局设置里随时切换想折腾的话项目还有独立的插件库支持扩展更多 OCR 引擎。公式识别等功能也已在开发路线图上值得保持关注。版本更新别错过项目的 CHANGE_LOG.md 记录了每个版本的演进——v2.1.0 加入文档识别、v2.1.2 支持单层纯文本 PDF 与任务暂停、v2.1.3 登陆 Linux 并支持 Docker 部署、v2.1.4 限制 PaddleOCR 内存占用、v2.1.5 修复了 PDF 页面旋转导致的文本错位并优化超大文件夹加载。如果你手头有旋转过方向的扫描件一定要用最新版。一句话收尾三句话记住 Umi-OCR把整篇浓缩成三句话Umi-OCR 免费、开源、完全离线装好就能用截图、批量、文档识别三大功能覆盖了从随手摘抄到批量归档的绝大多数场景遇到问题别慌忽略区域、排版方案、渲染器这几个旋钮能解决大部分麻烦。下次再收到扫描版 PDF或者面对一堆带水印的图片时打开 Umi-OCR——不用上传、不怕泄露那些复制不了的字终于都能轻松拿走了。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考