Tesseract入门--把图片里印刷文字提取成文本

发布时间:2026/8/29 18:29:25
Tesseract入门--把图片里印刷文字提取成文本 Tesseract 是 Google 开源 OCR 光学字符识别引擎Apache2.0 协议把图片里印刷文字提取成文本支持 130 语言没有自带 GUI命令行 / API 调用当前稳定版 5.xLSTM 深度学习模型。⚠️ 只擅长印刷体手写识别很差中文需要单独中文训练包 chi_sim。下载1、tesseract-ocr-w64-setup-5.5.3.20260724资源-CSDN下载2、Home · UB-Mannheim/tesseract Wiki · GitHub安装要点1、运行 exe 安装包2、展开 Additional language data → 勾选 Chinese (Simplified) 简体中文语言包识别中文必须3、默认路径C:\Program Files\Tesseract-OCR配置到环境变量PATH。验证是否安装成功tesseract --version查看已装语言tesseract --list-langsPython 侧安装pip install pytesseract pillow英文识别被识别图片识别代码from PIL import Image import pytesseract # Windows如果没配置PATH取消下面注释写对路径 # pytesseract.pytesseract.tesseract_cmd rC:\Program Files\Tesseract‑OCR\tesseract.exe img Image.open(english.png) text pytesseract.image_to_string(img, langeng) print(text)数字识别被识别图片识别代码from PIL import Image import pytesseract # Windows如果没配置PATH取消下面注释写对路径 # pytesseract.pytesseract.tesseract_cmd rC:\Program Files\Tesseract‑OCR\tesseract.exe img Image.open(digital.png) text pytesseract.image_to_string(img) print(text)中英混合识别被识别图片识别代码from PIL import Image import pytesseract # Windows如果没配置PATH取消下面注释写对路径 # pytesseract.pytesseract.tesseract_cmd rC:\Program Files\Tesseract‑OCR\tesseract.exe img Image.open(test.png) text pytesseract.image_to_string(img, langchi_simeng) #中英混合识别 print(text)