MinerU文档解析完全指南:3条命令把PDF和Office文档转成Markdown

发布时间:2026/8/29 15:06:38
MinerU文档解析完全指南:3条命令把PDF和Office文档转成Markdown MinerU文档解析完全指南3条命令把PDF和Office文档转成Markdown【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerUMinerU是一款开源文档解析工具可以把 PDF、图片、DOCX、PPTX、XLSX 一键转成带结构的 Markdown 和 JSON公式自动转 LaTeX、表格自动转 HTML、阅读顺序自动排好。你只需要一条命令就能拿到可以直接喂给大模型、RAG 知识库的高质量文本不用再手动复制粘贴一整份合同或论文。 一个解析工具覆盖 5 类文档输入很多人用大模型问答时发现丢进去的 PDF 解析得支离破碎公式变成乱码表格直接没了。问题往往出在文档转文本这一步。MinerU 做的事情就是补齐这一步输入PDF、图片、DOCX、PPTX、XLSX 文件和目录全部原生支持无需先转 PDF输出按人类阅读顺序排列的 Markdown、按阅读顺序排序的 JSON、结构化中间文件保留标题层级、段落、列表、图片、表格标题、脚注等原文档结构清理自动去掉页眉、页脚、页码等干扰内容保证语义连贯识别自动检测扫描版和乱码 PDF 并启用 OCR支持 109 种语言它的解析链路分为预处理、模型层、管线层、输出层和质检层整体流程如下图所示 3 条命令开始使用 MinerU第 1 步安装 MinerU升级 pip 后安装 uv再安装完整功能包包含所有核心功能兼容 Windows / Linux / macOS需要 Python 3.10–3.13pip install uv uv pip install -U mineru[all]如果你想看源码或做二次开发也可以克隆仓库后本地安装git clone https://gitcode.com/GitHub_Trending/mi/MinerU第 2 步运行一条解析命令安装完成后直接指定输入文件或目录和输出目录即可仓库里自带示例 PDF 可以直接试mineru -p demo/pdfs/demo1.pdf -o ./output如果你的机器没有 GPU加上-b pipeline指定 pipeline 后端可以在纯 CPU 环境运行。第 3 步查看解析结果命令跑完后输出目录里会生成一整套文件Markdown 正文、抽取出的图片、_layout.pdf布局分析可视化、_middle.json结构化中间数据等。你可以直接打开 Markdown 检查公式、表格和阅读顺序也可以拿_layout.pdf逐页核对检测框是否正确。各输出文件的命名规则和用途详见 输出文件说明。️ 解析后端怎么选CPU、GPU 与精度MinerU 提供三种解析后端在 OmniDocBenchv1.6基准上的综合得分如下后端精度OmniDocBench v1.6硬件要求特点pipeline86.47可纯 CPU 运行GPU 加速需 4GB 显存兼容性好速度快无幻觉vlm-engine95.30需 8GB 显存高精度支持 vLLM / LMDeploy 生态hybrid-engine默认95.39high/ 95.26medium需 8GB 显存高精度 原生文本提取低幻觉怎么选记住三句话✅没有 GPU 的笔记本→-b pipeline纯 CPU 也能跑✅有 8GB 显存显卡→ 用默认hybrid-engine精度和速度平衡最好✅追求极限精度→vlm-engine或 hybrid 搭配--effort high默认使用的effortmedium强度相比high综合精度只降低 0.13 分但在不同系统上解析速度可提升 35%220%日常批量处理用它就够需要图片/图表分析功能时才切到high。 解析能力细看表格、公式、扫描件都能处理公式转 LaTeX、表格转 HTML文档里的数学公式会被自动识别并转成 LaTeX 格式表格则转成结构完整的 HTML而且支持表格内图片/公式解析、跨页表格合并、印章文字识别和竖排文本。对于论文、研报这类公式密集的文档这是最省心的部分。扫描 PDF 与多语言 OCR扫描版 PDF、乱码 PDF 会被自动检测并走 OCR 链路。最新版本的 pipeline 后端已将 OCR 模型升级到PP-OCRv6OCR 相关指标提升约 11%OCR 处理速度提升约 100%批量处理扫描件时体感明显。如果你确认文档是单一语言还可以用-l参数指定如-l ch进一步提升 OCR 准确率VLM 后端则原生支持多语言不需要额外配置。用 2 个可视化文件质检输出不想逐行翻 Markdown MinerU 会生成两个质检文件打开就能核对_layout.pdf每页标注检测框和阅读顺序编号一眼看出分块和顺序对不对_span.pdf按 span 类型着色标注pipeline 后端方便排查文本丢失 接入大模型工作流CLI、API 与插件命令行只是入口之一。MinerU 提供了三种接入方式对应不同使用习惯CLImineru命令本地跑文档适合个人和脚本化批处理FastAPI 服务mineru-api启动后提供同步/异步解析接口适合开发集成多卡场景可用mineru-router做统一入口和自动负载均衡Gradio WebUImineru-gradio启动网页界面拖文件就能解析零代码上手如果你在用 Dify 这类工作流平台MinerU 已经以插件形式发布在插件市场里搜索安装即可装好之后在工作流里添加一个转换 MinerU MD 文本节点上传文件就能得到结构化 Markdown直接接给下游 LLM 节点使用除 Dify 外LangChain、LlamaIndex、RAGFlow、FastGPT 等 RAG 框架都能原生集成AI 编程工具则可以通过 MCP Server 调用。各框架的具体配置步骤见 官方文档使用篇。 效率提升对比MinerU 和常规方式差在哪处理方式阅读顺序/结构公式与表格扫描 PDF大模型直接可用手动复制粘贴靠人工整理易漏需手动补录不可行整理后才能用传统 PDF 文本提取纯文本版面丢失不处理不支持效果差MinerUpipeline✅ 自动排序去页眉页脚✅ 公式→LaTeX、表格→HTML✅ 自动检测启用 OCR✅MinerUhybrid/vlm✅ 同上 图片图表分析✅ 同上 跨页表格合并✅ 109 种语言 OCR✅另外两个有明确依据的效率点DOCX 文档走原生解析比先转 PDF 再解析的传统流程端到端速度提升数十倍超长文档通过滑动窗口机制优化上万页文档解析不再需要手动拆分。️ 常见坑与应对办法没有 GPU 怎么跑加-b pipeline参数纯 CPU 环境即可解析精度在 OmniDocBench 上也能拿到 86 分以上的综合成绩日常办公文档足够用。访问不了 HuggingFace默认模型源是 HuggingFace国内网络下可以一行切换到 ModelScope 镜像export MINERU_MODEL_SOURCEmodelscope首次运行会自动下载模型文件之后直接复用本地缓存不会重复下载。文档太长、想只解析部分页用-s和-e参数指定起止页码从 0 开始即可截取范围解析整本超长文档则交给滑动窗口机制自动处理流式写出已完成的结果不用等全部跑完。想更快批量处理默认effortmedium已是速度和精度的最佳平衡输入路径直接给目录一次解析整批文档文档里图片/图表不是重点时可关闭--image-analysis进一步提速 现在就开始你的文档解析花 3 条命令的时间装好 MinerU把一份你手头的 PDF 丢进去看看 Markdown 输出和_layout.pdf质检图就能判断它适不适合你的场景。遇到问题可以先查 FAQ也欢迎带着样例文档去提 issue。快速开始docs/zh/usage/quick_usage.md命令行参数详解docs/zh/usage/cli_tools.md输出文件说明docs/zh/reference/output_files.md核心解析源码mineru/backend/【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考