MarkItDown 3 分钟上手:把 PDF、Word、Excel 一键转成 Markdown

发布时间:2026/8/28 12:08:11
MarkItDown 3 分钟上手:把 PDF、Word、Excel 一键转成 Markdown MarkItDown 3 分钟上手把 PDF、Word、Excel 一键转成 Markdown【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown一堆 PDF、Word、Excel 要喂给大模型做分析手动复制粘贴既慢又丢格式MarkItDown 就是一个 Python 转换工具能把各种文件和办公文档转换成 Markdown还保留标题、列表、表格、链接这些结构让你几分钟内把文档进、Markdown 出跑起来。它能干什么先看能力地图一句话定位MarkItDown 是一个命令行工具 Python 库输入是本地文件或 URL输出是干净的 Markdown 文本。输入类型具体格式转换效果办公文档PDF、Word(.docx)、PPT(.pptx)、Excel(.xlsx/.xls)正文、表格、结构原样转 Markdown网页与在线源HTML、RSS、维基百科、YouTube 链接正文转 Markdown视频出字幕文本图片与音频JPG/PNG 等图片、MP3/WAV图片提取 EXIF 信息音频做语音转录文本类CSV、JSON、XML、纯文本直接规整为 Markdown压缩包ZIP逐个解压内部文件并分别转换所有格式都能通过插件系统继续扩展第三方插件装在包里就能用。3 步跑起来第 1 步建虚拟环境避免依赖冲突。需要 Python 3.10 及以上版本。python -m venv .venv source .venv/bin/activate第 2 步一条命令装全功能版。[all]会带上 PDF、Office、音频转录等全部可选依赖。pip install markitdown[all]不想装全部也可以从源码装先git clone https://gitcode.com/GitHub_Trending/ma/markitdown再执行pip install -e packages/markitdown[all]。第 3 步验证安装。markitdown --version能打印出版本号说明装好了。核心玩法3 个高频场景场景 1PDF 论文一键转换输入一份 PDF比如项目里的测试文件packages/markitdown/tests/test_files/test.pdf。命令转换并直接存成 md 文件。markitdown test.pdf -o test.md效果正文按段落输出页码、标题层级保留。打开test.md就能看到结构化的 Markdown 文本可以直接丢进 LLM 上下文。不想生成文件也可以走管道配合-x告诉它文件类型cat test.pdf | markitdown -x pdf场景 2图片转换 让 LLM 写描述输入一张图片。默认情况下 MarkItDown 会输出 EXIF 元数据尺寸、拍摄时间等如果你传入了一个 OpenAI 客户端它还会顺手用大模型给图片生成一段文字描述。命令Python 里三行搞定。from markitdown import MarkItDown from openai import OpenAI md MarkItDown(llm_clientOpenAI(), llm_modelgpt-4o) print(md.convert(test_llm.jpg).text_content)效果输出的是图片说明 元数据的 Markdown适合做图片入库、素材整理。这个能力由 packages/markitdown/src/markitdown/converters/_llm_caption.py 实现支持用llm_prompt参数自定义提示词。场景 3Excel 表格转 Markdown 表格输入一个 .xlsx 文件如packages/markitdown/tests/test_files/test.xlsx。命令markitdown test.xlsx -o test.md效果每个 Sheet 变成一个带标题的 Markdown 表格单元格内容原样保留可以直接粘进文档或喂给模型做数据问答。进阶调优按需加料按需安装可选依赖。只关心部分格式时装对应的 extras 更轻量依赖组支持什么pdfPDF 转换docx/pptx/xlsx/xlsOffice 系列audio-transcriptionMP3、WAV 语音转录az-doc-intelAzure 文档智能扫描件的 OCR 级提取例如pip install markitdown[pdf, docx]。插件系统。插件默认禁用用下面两条命令查看和启用markitdown --list-plugins # 看装了哪些插件 markitdown -p test.pdf # 启用插件转换Azure 文档智能。扫描版、图片型 PDF 离线转得效果一般时可以接云端服务-d开启、-e指定端点markitdown scan.pdf -o scan.md -d -e 你的文档智能端点实战与避坑落地建议批量处理业务文档时把转换命令写进脚本循环即可比如每月把报销 PDF 全部转成 Markdown 再汇总配合-o参数逐个输出。给 LLM 管道供料时推荐 Python API 而非命令行方便对result.text_content做二次加工。常见报错对照报错 / 现象原因解决UnsupportedFormatException该格式对应的可选依赖没装按上表补装 extras如pip install markitdown[pdf]管道输入转不动从 stdin 读取时识别不出文件类型加-x pdf、-m application/pdf之类提示音频转换失败缺少转录后端装audio-transcription并确认本地 Whisper 环境可用用-d报Endpoint is required文档智能必须提供端点补上-e endpoint输出里有超长 base64 图片数据默认会截断 data URI保留需显式声明不需要时用默认行为需要时加--keep-data-uris转换失败一般有两种异常不支持的格式UnsupportedFormatException和转换过程出错FileConversionException定义都在 packages/markitdown/src/markitdown/_exceptions.py排查时看报错类型就能快速定位方向。延伸与下一步MCP 服务同仓库的markitdown-mcp包能把 MarkItDown 暴露为 MCP 工具convert_to_markdown(uri)直接挂到 Claude 等 MCP 客户端上见 packages/markitdown-mcp/README.md。OCR 扩展markitdown-ocr包为 PDF、Word、PPT、Excel 增加图片 OCR 能力见 packages/markitdown-ocr/README.md。写插件markitdown-sample-plugin是一个最小插件样例照着它就能给 MarkItDown 加新格式支持见 packages/markitdown-sample-plugin/README.md。核心源码各格式的转换器都集中在 packages/markitdown/src/markitdown/converters/每个文件对应一种格式想改转换行为从这里入手。官方文档项目说明在 packages/markitdown/README.md。装好、跑通一条转换命令、再挑一个场景深入比如接上 LLM 生成图片描述MarkItDown 就完全融入你的文档流水线了。【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考