快速上手Unlimited-OCR:从零搭建环境到首次解析文档的10分钟完全教程

发布时间:2026/9/18 7:49:26
快速上手Unlimited-OCR:从零搭建环境到首次解析文档的10分钟完全教程 快速上手Unlimited-OCR从零搭建环境到首次解析文档的10分钟完全教程【免费下载链接】Unlimited-OCRUnlimited OCR Works: Welcome the Era of One-shot Long-horizon Parsing.项目地址: https://gitcode.com/gh_mirrors/un/Unlimited-OCRUnlimited-OCR 是一款面向长文档的开源 OCR 文档解析工具主打一次性长时程解析One-shot Long-horizon Parsing无论是单页扫描件还是整本 PDF它都能一口气读完并输出带版式的 Markdown 文本。本教程带你从零开始克隆仓库 → 配置推理环境 → 完成首次文档解析全程约 10 分钟。一、Unlimited-OCR 是什么长文档 OCR 解析的核心能力Unlimited-OCR 基于 DeepEncoder 视觉编码器 LLMR-SWA 滑窗注意力架构把阅读长文档拆成三步理解Understand→ 聚焦Focus→ 提取Extract因此能稳定处理长篇幅文档而不迷失方向。它提供三种官方推理后端可按需求任选其一后端适用场景特点Transformers快速体验、单张图代码最直观NVIDIA GPU 即可vLLM高并发服务部署社区已提供官方 RecipeSGLang批量解析图片目录/PDF配合 infer.py 一键并发推理吞吐最高二、第一步克隆 Unlimited-OCR 仓库1分钟git clone https://gitcode.com/gh_mirrors/un/Unlimited-OCR cd Unlimited-OCR仓库结构非常精简核心内容如下infer.pySGLang 并发推理脚本自动启动服务并批量解析wheel/sglang-0.0.0.dev11416g92e8bb79e-py3-none-any.whl适配本模型的 SGLang 本地安装包Unlimited-OCR.pdf论文原文想深挖原理可阅读README.md官方文档含全部三种后端的详细用法三、第二步快速搭建 SGLang 推理环境5分钟推荐用 uv 管理虚拟环境最快最省事要求 Python 3.12 NVIDIA GPU CUDA 12.9uv venv --python 3.12 source .venv/bin/activate # 安装本地 SGLang、kernels 与 PDF 转图依赖 uv pip install wheel/sglang-0.0.0.dev11416g92e8bb79e-py3-none-any.whl uv pip install kernels0.11.7 uv pip install pymupdf1.27.2.2 如果你只想跑一张图做体验也可以选 Transformers 路线pip install torch2.10.0 transformers4.57.1 Pillow12.1.1等完整依赖清单见 README.md。模型权重为baidu/Unlimited-OCR首次运行会自动从模型仓库下载请确保磁盘空间充足。四、第三步10分钟完成首次文档解析方式A用 infer.py 一键批量解析推荐infer.py 会自动启动 SGLang 服务、等待就绪、并发发送请求并在结束后打印吞吐统计tokens/s、平均解码耗时等。解析整个图片目录python infer.py \ --image_dir ./examples/images \ --output_dir ./outputs \ --concurrency 8 \ --image_mode gundam直接解析 PDF每页自动转为 300DPI 图片并并发解析python infer.py \ --pdf ./your_doc.pdf \ --output_dir ./outputs \ --concurrency 8每张输入图片对应输出一个同名.md文件PDF 则按页生成xxx_page_0001.md这样的分页结果打开即可看到解析出的正文与版式标记。相关参数定义见 infer.py#L303-L316。方式BTransformers 跑通第一张图如果想最快看到效果十几行代码就够了import torch from transformers import AutoModel, AutoTokenizer model_name baidu/Unlimited-OCR tokenizer AutoTokenizer.from_pretrained(model_name, trust_remote_codeTrue) model AutoModel.from_pretrained( model_name, trust_remote_codeTrue, use_safetensorsTrue, torch_dtypetorch.bfloat16, ).eval().cuda() model.infer( tokenizer, promptimagedocument parsing., image_fileyour_image.jpg, output_pathyour/output/dir, base_size1024, image_size640, crop_modeTrue, max_length32768, save_resultsTrue, )更多参数说明多图、PDF 转图参考 README.md#L60-L127。五、看看解析效果Unlimited-OCR 长时程演示下面是官方演示界面左侧输入整篇论文 PDF右侧 Tab 实时流式输出解析结果——可以看到 Unlimited-OCR 对长文档的一次性连续解析能力。六、常用选项速查按需定制解析任务选项默认值作用--image_dir-待解析图片目录--pdf-PDF 文件路径自动逐页转图--output_dir./outputs结果 Markdown 输出目录--concurrency8并发请求数显存充裕可调大--gpu0指定 CUDA 卡号--model_dirbaidu/Unlimited-OCR本地模型路径或远程模型 ID--image_modegundamgundam裁剪模式或base原图模式--server_log./log/sglang_server.log服务日志排查问题先看它两个小经验gundamvsbase单张图两种都支持多页/PDF 场景只支持baseimage_size1024。服务启动慢首次加载 3B 模型需要几十秒infer.py会轮询健康检查看到Server ready (xxs)才算就绪无需手动干预。七、常见问题 FAQQ1没有 NVIDIA GPU 能跑吗目前官方三种后端均面向 NVIDIA GPUCUDA 12.9暂不支持纯 CPU 推理。Q2显存大概需要多少模型为 3B MoESGLang 默认--mem-fraction-static 0.8建议 24GB 显存的消费级显卡起步显存吃紧可下调该参数。Q3解析结果全是乱码/重复怎么办检查输入图片分辨率PDF 建议保持 300DPI并确认使用的image_mode与输入类型匹配多页请用base。Q4想换 vLLM 部署可以吗可以官方已支持 vLLM 推理详见 README.md 中的说明与 Docker 镜像。八、继续探索完整用法与三种后端细节README.md想深入理解 R-SWA 长上下文机制Unlimited-OCR.pdf想参与开发先阅读 CONTRIBUTING.md欢迎提交 Issue 与 PR遇到问题查看 infer.py#L85-L136 的服务启动逻辑结合--server_log日志定位问题恭喜到这里你已经完成了 Unlimited-OCR 的环境搭建与首次文档解析。试着把一份真实 PDF 扔给infer.py10 分钟后收获一份结构化的 Markdown 文档吧 【免费下载链接】Unlimited-OCRUnlimited OCR Works: Welcome the Era of One-shot Long-horizon Parsing.项目地址: https://gitcode.com/gh_mirrors/un/Unlimited-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考