PDF、Word、HTML、Markdown、图片等文档解析工具MinerU和Docling

发布时间:2026/7/21 6:06:39
PDF、Word、HTML、Markdown、图片等文档解析工具MinerU和Docling 文章目录一多种文档解析意义二文档解析工具-MinerU2.1MinerU定位2.2 MinerU能干什么2.3 安装步骤2.3.2 CIL安装2.3 基本用法2.4 三种解析方式2.5 后端选择2.6 输出结果三文档解析工具-Docling3.1 Docling 定位3.2 Docling 能干什么3.3 安装步骤3.3.1 CLI 安装3.4 基本用法3.4.1 CLI 用法3.4.2 Python 用法3.5 PDF 解析配置3.6 输出结果3.7 文档分块3.7.1 HierarchicalChunker3.7.2 HybridChunker3.8 RAG 中的使用流程一多种文档解析意义我们需要把PDF、Word、HTML、Markdown、图片等不同文档解析成干净便于向量检索的文档。二文档解析工具-MinerU2.1MinerU定位MinerU 是一个文档解析引擎主要作用是把人类阅读的文档转换成机器容易处理的 Markdown、JSON 和图片。2.2 MinerU能干什么当前本地 CLI 文档明确列出的输入包括 PDF、图片、DOCX、PPTX、XLSX。2.3 安装步骤2.3.2 CIL安装# 创建虚拟环境uv venv .venv# 激活环境.venv\Scripts\Activate.ps1# 安装基础功能uv pipinstallmineru[core]# 检查安装mineru--versionmineru--help完整功能或源码开发可以使用gitclone https://github.com/opendatalab/MinerU.git Set-Location MinerU uv pipinstall-e.[all]2.3 基本用法纯 CPU 环境建议先使用 pipelinemineru-p.\samples\document.pdf-o.\output-bpipeline-mauto-lch参数含义参数作用-p输入文件或目录-o输出目录-b选择解析后端-m选择文字提取方式-lOCR 文档语言-s、-e指定开始页和结束页-t是否解析表格-f是否解析公式2.4 三种解析方式模式适用情况auto自动判断日常默认使用txtPDF 有完整且正常的文字层ocr扫描 PDF、图片 PDF、乱码 PDF示例# 自动判断mineru-pinput.pdf-ooutput-bpipeline-mauto# 强制直接提取文字mineru-pinput.pdf-ooutput-bpipeline-mtxt# 强制 OCRmineru-pinput.pdf-ooutput-bpipeline-mocr-lch2.5 后端选择后端特点建议pipeline传统解析流水线支持纯 CPU入门首选vlm-engine使用视觉语言模型复杂图文需要较多资源hybrid-engine结合多种解析能力GPU 环境和复杂文档vlm-http-client调用外部 VLM 服务服务化部署hybrid-http-client调用外部混合服务服务化部署当前版本的默认后端可能随版本变化因此以本机 mineru --help 为准。没有 GPU 时明确指定-bpipeline2.6 输出结果不同版本的具体文件名可能不同但主要有Markdown适合查看内容也可以用于简单分块。content list JSON按照阅读顺序保存标题、正文、表格、图片等元素最适合后续构建 RAG。middle JSON包含更详细的中间解析和版面信息适合排查问题。images从文档中提取的图片。可视化结果用于检查版面框和元素识别是否正确。RAG 中建议以 content list JSON 为主因为它比单纯 Markdown 更容易保留页码、类型和位置信息。三文档解析工具-Docling3.1 Docling 定位Docling 是一个多格式文档解析、转换和分块框架。它会把不同格式的文件统一转换成结构化的DoclingDocument。DoclingDocument可以继续导出为 Markdown、JSON、HTML或者直接进行 RAG 分块。Docling 支持完全本地运行文档不需要上传到云端。3.2 Docling 能干什么Docling 支持的主要输入格式包括 PDF、DOCX、PPTX、XLSX、HTML、Markdown、图片、EPUB、LaTeX、纯文本、邮件和部分音频格式。Docling 可以识别和保留以下内容内容解析结果标题保留标题及层级正文提取段落和阅读顺序列表保留列表结构表格识别行、列和单元格图片提取图片和图片标题扫描文字通过 OCR 识别公式和代码保留对应内容类型元数据保存来源、页码和位置信息3.3 安装步骤3.3.1 CLI 安装# 创建虚拟环境uv venv.venv# 激活虚拟环境.venv\Scripts\Activate.ps1# 安装 Doclinguv pip install docling# 检查安装docling--version docling--help使用 HuggingFace tokenizer 进行 RAG 分块时可以安装uv pip installdocling-core[chunking]3.4 基本用法3.4.1 CLI 用法转换成 Markdowndocling.\samples\document.pdf--to md--output.\output转换成 JSONdocling.\samples\document.pdf--to json--output.\output--to用于指定输出格式--output用于指定输出目录。3.4.2 Python 用法fromdocling.document_converterimportDocumentConverter converterDocumentConverter()resultconverter.convert(./samples/document.pdf)docresult.document markdowndoc.export_to_markdown()datadoc.export_to_dict()htmldoc.export_to_html()result.document是统一的DoclingDocument。后续导出、遍历元素和分块都基于这个对象进行。3.5 PDF 解析配置包含扫描页面和表格的 PDF可以启用 OCR 和表格结构识别fromdocling.datamodel.base_modelsimportInputFormatfromdocling.datamodel.pipeline_optionsimportPdfPipelineOptionsfromdocling.document_converterimportDocumentConverter,PdfFormatOption optionsPdfPipelineOptions(do_ocrTrue,do_table_structureTrue,)converterDocumentConverter(format_options{InputFormat.PDF:PdfFormatOption(pipeline_optionsoptions)})resultconverter.convert(./samples/document.pdf)docresult.document常用配置参数作用do_ocr对扫描页面和图片文字执行 OCRdo_table_structure识别表格行列和单元格结构generate_page_images生成完整页面图片generate_picture_images提取文档中的图片区域images_scale控制生成图片的清晰度do_picture_description使用视觉模型生成图片描述提取文档中的图片options.generate_picture_imagesTrueoptions.images_scale2.03.6 输出结果Docling 主要支持以下输出输出作用Markdown人工查看、结果校验和简单处理JSON保存完整的DoclingDocument结构HTML在网页中展示解析结果DocTagsDocling 使用的结构化标记格式DoclingDocument用于程序处理和 RAG 分块markdowndoc.export_to_markdown()json_datadoc.export_to_dict()htmldoc.export_to_html()doctagsdoc.export_to_doctags()RAG 项目建议直接使用DoclingDocument进行分块不需要先导出 Markdown 再重新解析。3.7 文档分块3.7.1 HierarchicalChunkerHierarchicalChunker根据标题、段落、列表、表格等文档结构进行分块。fromdocling.chunkingimportHierarchicalChunker chunkerHierarchicalChunker()chunkslist(chunker.chunk(doc))forchunkinchunks:print(chunk.text)3.7.2 HybridChunkerHybridChunker先按照文档结构分块再根据 tokenizer 控制 chunk 长度。超长内容会被拆分相邻且较短的同级内容可以合并。fromdocling.chunkingimportHybridChunkerfromdocling_core.transforms.chunker.tokenizer.huggingfaceimport(HuggingFaceTokenizer,)tokenizerHuggingFaceTokenizer.from_pretrained(model_nameBAAI/bge-m3,max_tokens512,)chunkerHybridChunker(tokenizertokenizer,merge_peersTrue,)chunkslist(chunker.chunk(doc))forchunkinchunks:embedding_textchunker.contextualize(chunk)print(chunk.meta.headings)print(embedding_text)分块器适用情况HierarchicalChunker强调标题和文档元素结构HybridChunker同时控制结构和 token 长度适合 RAG3.8 RAG 中的使用流程PDF、Word、HTML、Markdown、图片 ↓ DocumentConverter ↓ DoclingDocument ↓ HybridChunker ↓ BGE-M3 向量化 ↓ Milvus建议向量化chunker.contextualize(chunk)的结果。入库时保存正文、标题路径、页码、来源、内容类型和文档 ID。Markdown 主要用于人工检查JSON 用于保存完整解析结果DoclingDocument和 Chunker 用于正式的 RAG 入库流程。官方资料Docling 官方文档、Docling GitHub。