
Umi-OCR 实测300 张照片加 536 页扫描 PDF全程离线数字化【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR这篇文章处理三件事把 312 张书页照片识别成可检索文本给一本 536 页的扫描书生成可搜索的双层 PDF把一批代码截图整理成能直接粘贴的文本。工具是开源、免费、离线运行的 OCR 软件 Umi-OCR识别引擎跑在本地全程不联网从解压到拿到成品大约两小时。先看结果拿到 3 个交付物跑完之后手上多了三样能直接用的东西book_pages.txt312 张照片合并成一份文本术语直接全文检索不用再手工誊录。旧书_可搜索.pdf扫描原书多了一层透明文字翻页看原图搜索能定位到段落。一批代码片段代码截图识别后粘贴进编辑器缩进和行内空格原样保留。三样交付物自始至终没有离开本机不经过任何在线服务。交付物怎么拿截图识别框一下拿到可编辑文本场景屏幕上有代码和文档想取其中的文字不想一个字一个字敲。操作解压发布包双击Umi-OCR.exe没有安装步骤。打开截图 OCR页按预设快捷键唤出取景框。框住目标区域松开鼠标。右侧出识别结果也可以粘贴别处复制的图片、或把本地图拖进窗口识别。结果单屏截图几秒内出结果。右侧记录栏支持一次划选多条记录合并复制整理多段文字时省事。小提示识别代码截图时把排版解析方案设为单栏-保留缩进行首缩进和行内空格照原样保留。批量 OCR300 张照片一次拖进去导出场景相册里躺着 312 张书页照片每张右上角都有拍摄时间水印逐张处理不现实。操作打开批量 OCR页把照片全部拖进任务列表。进入右栏的忽略区域编辑器按住右键把水印可能出现的位置框起来。排版解析方案选多栏-按自然段换行。点开始等进度条走完。导出结果可选 txt、csvExcel、md、jsonl 四种格式。结果312 张大约 40 分钟跑完导出的 txt 里没有混入水印文字。小提示忽略区域按整个文本块生效不是按单个字符。框要画得比水印位置大一圈把可能的出现范围完全包进去。扫描书加一层可搜索文字场景一本 536 页的旧书是纯扫描 PDF没有文字层翻页等于看照片。操作打开文档识别页把 PDF 拖进去。在忽略区域编辑器里给每页的页眉、页脚位置画框。输出类型选双层可搜索 PDF。多个大文件可以排队处理完成后勾选自动关机。结果成品底层是原图、上层是透明文字既能原样翻页又能全文搜索。一个术语丢进搜索框几秒内跳齐所有相关段落比一页页翻快太多。避坑清单超长截图后半段文字丢失→ 原因默认限制图像边长会裁切超大图片 → 解决批量页设置→文字识别→限制图像边长里把数值调高再跑。页眉页脚、水印混进正文→ 原因识别时没有排除这些区域 → 解决任务开跑前画好忽略框只有整个文本块落在框内才会被跳过宁大勿小。截图时界面闪烁、UI 错位→ 原因显卡加速渲染与部分驱动冲突 → 解决全局设置→界面和外观里切换渲染器或关闭硬件加速。命令行指令没反应→ 原因命令行依赖软件内 HTTP 服务做跨进程通信被手动关了 → 解决全局设置中允许 HTTP 服务主机选仅本地即可默认就是开启的。进阶与自动化命令行与 HTTP 接口进阶用户可以直接把主程序当命令行入口三条指令覆盖日常自动化umi-ocr --screenshot --clip umi-ocr --path D:/scan_folder umi-ocr --qrcode_create 文本内容 D:/输出.png第一条截屏识别并复制到剪贴板第二条对文件夹含子文件夹里所有图片批量识别第三条生成二维码图片。指令支持字母简写umi-ocr --help看全部参数。另有 HTTP 接口可把 OCR 能力嵌进自己的小工具接口文档在仓库 docs/ 目录下。适合谁、谁该绕道适合手里有大量本地图片、扫描 PDF 要处理且数据不能出机器的人中英文、日文混排文档也能用内置多语言识别库。绕道追求手写体、低清老照片极限准确率的离线引擎不如云端大模型建议这类材料先走在线服务。如果你手头也压着扫描件或截图第一步就是解压发布包双击Umi-OCR.exe在截图 OCR页按快捷键框一块区域——10 分钟内你能拿到第一段识别出来的文字。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考