
告别手动打字这款免费离线OCR软件能把截图、PDF和几百张图片一次转成文字【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR你有没有遇到过这种时刻网页弹窗里的字复制不了只能一个个敲几百张扫描件堆在桌面光想想就想关电脑PDF里的内容明明是文字却怎么也选不中。Umi-OCR 就是为解决这类麻烦而生的免费离线OCR软件——把图片、截图、PDF里的文字识别出来变成可以直接复制、编辑、搜索的文本。它解压就能用、完全离线运行不联网、不上传你的每一份文档都只留在你自己的电脑里。先接受一个反直觉的事实把OCR装进本地反而更快多数人对文字识别的印象是找个在线网站上传图片等它转圈。但实测下来本地离线识别的体验完全不同不用等上传、不用排队几百张图一口气处理完更关键的是截图、合同、身份证这类敏感内容根本不会离开你的电脑。对比项在线OCR服务Umi-OCR是否需要联网必须联网完全离线隐私安全图片要上传到服务器数据不出本机识别速度受网络和排队影响本地引擎秒级响应费用大多限量或收费免费、开源批量能力常有张数限制无上限可一次处理几百张提醒离线听起来像功能弱实际恰恰相反。Umi-OCR 内置了多套离线识别引擎如 Rapid-OCR、PaddleOCR还自带多国语言库简体中文、繁体中文、英文、日文、俄文等都能识别。离线不等于简陋而是把识别能力完整地搬到了你手边。第一步5分钟把它变成你的截图翻译官拿到软件的方式很简单下载.7z压缩包解压到纯英文路径比如D:\Umi-OCR双击Umi-OCR.exe就能启动不需要安装也不写入系统。这是它第一个让人舒服的地方——带走即用绿色无残留。第一次识别只需3步按下截图热键默认是WinAltC可在截图OCR页自行修改用鼠标框选出要识别的文字区域松开鼠标识别结果立刻出现在右侧记录栏选中复制即可框完就出结果识别文字会实时显示在右侧面板支持编辑和划选复制。截图OCR这个页面把识别和整理合并到了一起左侧图片预览可以直接划选复制右侧识别记录支持批量选中、合并复制。最省心的是它连粘贴识别都支持——你在别处复制了一张图片回到Umi-OCR直接粘贴一样能识别。遇到页面弹窗、软件界面、网课截图这类无法复制的文字这一招基本全搞定。第二步截图不够用把一个月的扫描件一次性交给它截图适合急用但真正考验OCR的是批量场景手机拍的纸质笔记、课程资料、旧合同照片……一张张处理能让人崩溃。Umi-OCR 的批量识别页面就是为这种场景准备的。一次拖入13张图片排队识别左侧实时显示每张的耗时与识别置信度。操作流程很直白打开批量OCR标签页把图片直接拖进任务列表支持 jpg、png、webp、bmp、tif 等常见格式点开始任务进度条实时滚动识别完成后一键导出为 txt、jsonl、md 或 csv可直接用Excel打开几个让我觉得值回票价的细节没有数量上限实测几百张图片可以一次排进队列识别完自动保存支持任务完成后自动关机/待机晚上挂机跑完第二天起来直接收结果导出 csv 格式意味着可以直接交给 Excel 做后续整理适合报表类资料第三步水印太讨厌用忽略区域把它们请出结果批量识别大量图片时最烦的干扰源是水印和页眉页脚——它们不属于正文却总被当成文字识别出来污染整篇结果。Umi-OCR 为此提供了一个专门的忽略区域功能在批量识别页的右栏打开编辑器按住右键在图片上画出几个矩形框把水印可能出现的位置圈起来。任务执行时这些区域内的文字会被直接跳过。提醒画框时尽量画大一点把水印所有可能出现的位置都包住。注意忽略的是完全位于框内的整个文本块而不是单个字符所以宁可多包一些也不要画得太抠。这个功能对两类人尤其友好一是整理带某某笔记APP水印的截图党二是处理带页眉页脚的公司扫描件。排除干扰后导出文本干净得像直接复制的一样。第四步连PDF的顽固都能治扫描件也能变成可搜索文档如果说图片OCR是基础操作那PDF识别就是Umi-OCR的进阶重头戏。它的文档识别标签页支持 pdf、epub、mobi 等多种格式最有价值的能力是——把扫描版PDF转成双层可搜索PDF。这个双层值得展开说扫描版PDF本质是图片文字无法选中、无法搜索。Umi-OCR识别后生成的新PDF底层是原图、上层是识别出的文字层。结果就是外观没变但里面的文字可以选中、复制、被搜索引擎索引。这对资料整理、论文阅读、档案数字化都是实打实的效率提升。它还支持把PDF拆成单张图片处理、自动识别页眉页脚配合忽略区域排除、以及提取PDF自带的文本——如果PDF本身有文字层直接提取就行连识别都省了。第五步代码截图识别完还能保留缩进程序员和写教程的人最怕的就是代码截图识别成乱糟糟的一坨。Umi-OCR 针对这类场景提供了专门的排版解析方案。左侧是代码截图右侧是识别后的文本缩进和换行基本还原。在截图OCR或批量OCR页的文本后处理里把排版方案切换为单栏-保留缩进识别代码时就会保留行首缩进和行中空格。实测识别出来的代码片段缩进结构、注释、特殊字符都能比较完整地保留直接粘进编辑器就能用。对于把网上的代码截图转成可运行文本这类需求这几乎是刚需功能。那些藏在设置里的隐藏开关识别能力之外Umi-OCR 的可定制性也值得花两分钟了解全在全局设置标签页里。语言、主题、字体、开机自启都在一个页面里搞定。界面语言首次启动会根据系统自动切换也支持手动选择简体中文、繁体中文、英语、日语、俄语等多种语言界面主题多套亮色/暗色主题随意切换还支持调整字体和界面大小比例渲染器如果截屏时画面闪烁、界面错位来这里切换渲染方案或关闭硬件加速很多显示问题就此解决窗口行为支持启动时最小化到任务栏配合开机自启软件常驻后台随叫随到多语言界面切换后整个软件界面即时生效。进阶玩法不打开界面用命令行直接驱动如果你愿意再进一步Umi-OCR 还开放了命令行和HTTP接口。不需要鼠标点来点去一条命令就能完成识别# 截取屏幕区域并识别 umi-ocr --screenshot # 批量识别指定文件夹里的所有图片 umi-ocr --path D:/扫描件 # 识别图片中的二维码 umi-ocr --qrcode_read D:/xxx.png # 生成一个二维码图片 umi-ocr --qrcode_create http://example.com D:/out.jpeg常用参数汇总参数作用一句话示例--screenshot截图识别umi-ocr --screenshot screen0 rect50,100,300,200自动截指定区域--path识别文件/文件夹umi-ocr --path D:/img1.png D:/img2支持多路径--output结果写入文件umi-ocr --path D:/扫描件 --output result.txt--qrcode_read / --qrcode_create扫码/生成码见上方示例--server启动HTTP服务配合其他程序做远程调用命令行更适合两类人一是需要批量、定时处理任务的自动化玩家可以把它写进脚本二是想把自己的工具链和OCR能力对接的开发者。详细说明见官方文档 docs/README_CLI.md 和 docs/http/README.md。如果翻车了先查这3个地方新手期最容易遇到的问题就三类基本都能自己解决现象大概率原因处理办法双击启动闪退系统运行库缺失安装VC运行库后再试截屏闪烁、UI错位显卡加速不兼容全局设置里切换渲染器或关闭硬件加速大图识别超时或失败图片边长超出引擎上限批量页设置中调高限制图像边长数值提醒首次使用前确认软件放在纯英文路径下。这是Umi-OCR最常见的启动问题来源没有之一。现在就可以试试打开软件按下WinAltC框住屏幕上任意一段文字——从按下快捷键到文字出现在剪贴板里通常不超过几秒。这就是离线识别最直接的爽感识别完随手复制永远不用等上传。记住这句上手口令截屏用快捷键批量用拖拽PDF用双层水印用忽略区域。这套组合下来无论是办公文档、学习笔记还是代码素材都能从只能看变成能用。Umi-OCR 是免费且开源的项目由开发者利用业余时间持续维护界面翻译也由社区协作完成。如果你在长期使用中遇到问题或有新想法可以在项目仓库提交反馈如果它真的帮到了你也欢迎加入社区一起让这个工具变得更好用。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考