
MinerU PDF解析部署指南3种模式怎么选、怎么装、如何调优【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerUMinerU 是一个文档解析工具可将 PDF、图片、DOCX、PPTX、XLSX 转换为 LLM 可用的 Markdown 与 JSON。它的部署分为三种形态本地核心环境、GPU 加速、轻量远程客户端装错模式会浪费显存或拖慢速度。先选型再动手。 先选模式3 种部署形态对比维度核心环境coreGPU 加速core vllm轻量客户端vlm-http-client显存要求无硬性要求可纯 CPUVolta 及以后架构显卡显存 ≥ 8G无仅 CPU 网络运行位置本地本地本地客户端 远端推理服务适用场景日常文档转换、无 GPU 机器批量处理、追求推理速度边缘设备、低配机器、远程调用 OpenAI 兼容服务安装命令uv pip install mineru[core]uv pip install mineru[core,vllm]uv pip install mineru补充两点mineru[all]等价于 core 加上平台对应的推理加速模块Linux 装 vllm、Windows 装 lmdeploy、macOS 装 mlx与 s3 模块适合一次性装齐vllm与lmdeploy二选一即可不建议同时安装以避免依赖冲突。 三步跑通核心环境最小可运行路径只有两条命令uv pip install mineru[core]mineru -p input_path -o output_pathinput_path可以是单个 PDF / 图片 / DOCX / PPTX / XLSX 文件或目录output_path为输出目录。未传--api-url时CLI 会自动拉起本地临时mineru-apiLinux 和 macOS 会自动尝试 cuda/mps 加速。首次运行会自动下载模型默认模型源为huggingface国内网络可切换modelscope见下文环境变量部分。更多参数见 命令行工具说明。⚡ 开启 GPU 加速vllm 后端在满足显卡条件的机器上一条命令即可启用 vllm 加速 VLM 模型推理uv pip install mineru[core,vllm]安装注意事项显存不足 8G 或显卡架构早于 Volta 时不要装 vllm直接用核心环境。vllm 已放开到 0.21 系列版本默认安装会选范围内较高版本请确认物理机驱动支持其 CUDA 运行时默认路径需 CUDA 13.0 兼容驱动需 CUDA 12.9 环境时可改用 Docker 中的vllm/vllm-openai:v0.21.0-cu129基础镜像。vllm 会预分配显存同一台机器不建议同时跑多个 vllm 服务。 轻量 / 远程部署何时该用客户端模式当本地设备只有 CPU、或推理服务已经部署在另一台 GPU 服务器上时用轻量客户端本地只做文档预处理VLM 推理走 HTTP 到远端 OpenAI 兼容服务。服务端需已安装 vllm 或 lmdeploy 环境mineru-openai-server --port 30000客户端只需 CPU 与网络无需本地安装 torchuv pip install mineru mineru -p input_path -o output_path -b vlm-http-client -u http://127.0.0.1:30000如果需要hybrid模式走远程本地需安装mineru[pipeline]含 torch 等依赖后端切换为-b hybrid-http-client。选型建议本地有可用 GPU → 直接本地跑本地无 GPU 但有远端推理服务 → 用客户端两者都没有 → 核心环境纯 CPU 也能跑只是速度慢。️ 用环境变量微调行为环境变量优先级高于命令行参数且对所有 MinerU 命令行工具生效。高频变量如下变量名作用调优建议MINERU_MODEL_SOURCE模型源huggingface/modelscope/local默认自动探测国内网络固定设为modelscope可避免反复探测详细说明见 模型源说明MINERU_FORMULA_ENABLE公式解析开关默认true文档以图表为主、想省时间时设falseMINERU_TABLE_ENABLE表格解析开关默认true纯文本 PDF 可设false提速MINERU_PDF_RENDER_THREADSPDF 渲染并发 worker 数默认4大文档批量处理时按 CPU 核数上调MINERU_PROCESSING_WINDOW_SIZE单次处理窗口大小默认64大文档内存吃紧时调小反之调大完整列表见 命令行工具文档的环境变量说明一节。❓ 常见问题vllm 安装失败不必在裸机死磕直接用 Docker 部署镜像基于vllm/vllm-openai已内置 vllm 环境与依赖用docker run --gpus all --shm-size 32g -it mineru:latest /bin/bash启动即可。Linux 上解析结果缺字 / 乱码通常是系统缺 CJK 字体导致 PDF 渲染丢字Ubuntu/Debian 执行sudo apt install fonts-noto-core fonts-noto-cjk fc-cache -fv即可或用 Docker 镜像已内置字体。Windows 下推理很慢多为 CUDA 版torch未装。前往 PyTorch 官网选择匹配 CUDA 版本的 Windows 安装命令RTX 50xxBlackwell则改用 lmdeploy 的 cu128 Windows wheel。小结选型一句话有 GPU 就core,vllm本地加速没 GPU 就 core 跑 CPU 或客户端连远端装之前先按上面的对比表对号入座。更多细节与模块扩展内容可查阅 扩展模块安装指南 及官方文档完整代码请访问项目仓库 MinerU。下期预告《MinerU API 与 WebUI 部署实战》从mineru-api到 Gradio 可视化界面把解析能力变成团队可用的服务。【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考