3条命令,把PDF转成干净的Markdown:MinerU上手实录

发布时间:2026/8/24 22:53:41
3条命令,把PDF转成干净的Markdown:MinerU上手实录 3条命令把PDF转成干净的MarkdownMinerU上手实录【免费下载链接】MinerUA high-quality tool for convert PDF to Markdown and JSON.一站式开源高质量数据提取工具将PDF转换成Markdown和JSON格式。项目地址: https://gitcode.com/OpenDataLab/MinerU你大概也卡过这个场景想把一堆 PDF 丢进知识库或者喂给大模型可复制出来的文本全是碎的——表格断了格、公式变成图片糊、阅读顺序搅成一团。人工清洗半天读起来还是不顺。MinerU 是一个开源文档解析工具把 PDF、图片、DOCX 这类文件转成机器可读的 Markdown 和 JSON。这次就按安装到出结果的顺序把第一份文件完整跑一遍。 装依赖一条 pip 命令把 MinerU 装好MinerU 要求 Python 3.10~3.13版本对得上就直接装pip install -U mineru[all]装完后在终端敲mineru --version能打印出版本号就说明装好了。mineru[all]是全量包包含各解析后端和 Gradio 界面对大多数人来说装它就够了。这里有个坑首次解析时会自动下载所需的模型文件托管在 Hugging Face 上。如果你的网络访问不了解析前先设一个环境变量让模型改从 ModelScope 镜像下载export MINERU_MODEL_SOURCEmodelscope设置之后第一次运行会从国内镜像拉模型之后每次都直接读本地缓存不用再下载。 喂第一份 PDF一行命令转出 Markdownmineru -p demo1.pdf -o output/跑完你会看到 output/ 下多了一个以 PDF 文件名命名的目录里面再按后端子目录如hybrid_auto、pipeline/ocr分好。打开核心产物full.md标题层级、段落顺序、表格的 HTML 都就位了同结构 JSON 和文档里切出来的图片目录也在旁边。为什么结果能这么干净看这张图一份 PDF 会先过预处理文档分类、乱码检测、扫描件识别再过模型层版面检测、公式检测、文本 OCR然后管线层负责表格合并、图片合并、版面重排最后才输出成阅读顺序的 Markdown 和 JSON。整条链路还顺手去掉了页眉、页脚和页码——这些是人工清洗时最烦的部分。CLI 的参数定义在mineru/cli/client.py里想看全部参数直接mineru --help更细的说明在docs/zh/usage/目录的文档里。️ 纯 CPU 也能解析pipeline 后端这样切默认的hybrid-engine后端精度最好但需要 Volta 及以后架构的 GPU 或 Apple Silicon显存至少 8GB。如果是一台纯 CPU 的机器换个后端就行mineru -p demo1.pdf -o output/ -b pipeline用法完全一样只是解析交给 pipeline 后端纯 CPU 环境跑得起来。速度比 GPU 慢一些但它内置的 OCR 引擎在 3.4 版本升级到了 PP-OCRv6处理速度比上一代提升约 100%日常文档够用。两个顺带知道的开关--efforthybrid 后端medium是默认值比high快 35%~220%high精度更高还支持图片、图表分析。-s/-e指定解析页码范围从 0 开始300 页的教材先试跑前 10 页很实用。先别急着调参数用默认medium跑一遍看结果不满意再动。 扫描件、公式、表格这些硬骨头怎么啃扫描件不用手动切模式MinerU 会自动检测扫描版 PDF 和乱码 PDF并自动启用 OCR。想强制走 OCR、或者已知文档语言想让识别更准mineru -p scan.pdf -o output/ -m ocr -l ch-m有三个取值auto默认、txt、ocr-l是语言提示只有 pipeline 后端会用它hybrid 和 vlm 后端不看这个参数。OCR 整体支持 109 种语言。公式和表格默认就开着不用额外配置公式转成 LaTeX表格转成 HTML。效果好不好看版面检测的可视化就很直观双栏排版里标题、正文、公式各自成块按阅读顺序排出来。如果某份文档不需要公式或表格-f和-t可以分别关掉它们。 从命令行到服务化API 和 WebUI 入口文件量上来之后命令行依然够用-p直接传目录里面所有受支持的文件PDF、图片以及 DOCX、PPTX、XLSX——Office 文档是原生解析不用先转 PDF都会挨个解析。想把它当服务用MinerU 自带两个入口。mineru-api本地起一个 FastAPI 服务提供异步任务接口可以提交任务、查状态、取结果mineru-gradio则给你一个带上传按钮的网页。命令行想指向已部署好的服务时加一个--api-url参数即可。多机多卡的部署还有mineru-router做统一入口和负载均衡。demo/demo.py是一份现成示例脚本演示了如何用 HTTP 接口提交文件、轮询状态、下载结果抄进你自己的流程里改几行就能用。现在就去试找一份手头的 PDF跑mineru -p 你的文件.pdf -o output/几分钟后结果就在 output/ 里。装依赖、下模型或解析质量上遇到卡点先查项目文档里的 FAQ 页面还解决不了就带样例文件去社区提 issue。【免费下载链接】MinerUA high-quality tool for convert PDF to Markdown and JSON.一站式开源高质量数据提取工具将PDF转换成Markdown和JSON格式。项目地址: https://gitcode.com/OpenDataLab/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考