如何上手 pdf-inspector:10 分钟从 PDF 类型检测到 Markdown 提取

发布时间:2026/9/8 20:36:28
如何上手 pdf-inspector:10 分钟从 PDF 类型检测到 Markdown 提取 如何上手 pdf-inspector10 分钟从 PDF 类型检测到 Markdown 提取【免费下载链接】pdf-inspectorFast Rust library for PDF inspection, classification, and text extraction. Intelligently detects scanned vs text-based PDFs to enable smart routing decisions.项目地址: https://gitcode.com/GitHub_Trending/pdf/pdf-inspectorpdf-inspector 是一款 Rust 编写的 PDF 检查库解决文档进管道时你不知道它是文本型还是扫描图的问题盲目全部丢给 OCR 既费时又费钱它几十毫秒内本地判断该直接提取还是走 OCR。开始之前适合做批量 PDF 处理的数据管道、文档解析服务或者只是想把几份报告转成干净 Markdown 的开发者。Python ≥ 3.8。官方 wheel 覆盖 CPython 的 Linuxx86_64 / aarch64、macOSIntel / Apple Silicon和 Windowsx64走 Node.js 或浏览器路径则准备对应的 Node 环境均不需要 Rust 工具链 能力一览功能解决的场景耗时/代价类型检测detect_pdf判断文本型/扫描型/混合型做路由决策约 10-50ms全文转 Markdownprocess_pdf标题、列表、表格、多栏布局一步出可交付文本本地处理文本型 PDF 200ms 以内位置提取extract_text_with_positions拿 X/Y 坐标、字体、加粗斜体做再排版或精确定位需要完整解析按文档大小计选择性 OCRprocess_pdf_with_ocr只对确实缺文字的页跑 OCR其余页保持原生提取需额外安装 PDFium 与 ONNX Runtime 快速安装一条 pip 命令最主流的路径是 Python 包管理器一条命令覆盖上述全部平台pip install pdf-inspectorNode.js 用npm install firecrawl/pdf-inspector浏览器 WASM 用npm install firecrawl/pdf-inspector-wasm各平台细节见 napi/README.md 与 wasm/README.md。 3 行代码跑通首例在当前目录放一个名为 document.pdf 的文件写一个脚本调用它的全流程函数一次拿到类型与 Markdownimport pdf_inspector result pdf_inspector.process_pdf(document.pdf) print(result.pdf_type, result.confidence) print(result.markdown)运行后第一行输出类型text_based / scanned / image_based / mixed 之一和 0-1 之间的置信度第二行输出文档的 Markdown 内容纯扫描文档没有可提取文本时该字段为 None。实战场景只让该走 OCR 的页走 OCR假设你在做一个接收来源不明报告的摄入服务思路是先快速判断类型文本型直接本地提取剩下的页才交给你的 OCR 服务。用detect_pdf先探测。它不做完整提取几十毫秒返回类型并给出pages_needing_ocr页列表。类型为text_based且置信度高直接交给process_pdf拿 Markdown省掉整个 OCR 环节。否则按页列表转交 OCR 服务不必整份文档全量重跑。import pdf_inspector info pdf_inspector.detect_pdf(report.pdf) if info.pdf_type text_based and info.confidence 0.8: result pdf_inspector.process_pdf(report.pdf) print(result.markdown) else: print(需要 OCR 的页:, info.pages_needing_ocr)这样能本地提取的文档就不必再付 OCR 的时间和费用。 深入之前先问自己 3 个问题页码为什么一会儿从 1 起、一会儿从 0 起不同 API 两套并存process_pdf的pages是 1 起始extract_pages_markdown是 0 起始。写代码前先查类型注解完整参数说明在 docs/python.md。它会自己跑 OCR 吗不会。默认不加载任何 OCR 外部运行时只有页被路由到 OCR 时才需要本地 PDFium 和 ONNX Runtime环境配置见 docs/ocr-runtime.md。速度数字到底什么来路官方对比基于 opendataloader-bench 的 200 份 PDF、关闭 OCR在 Apple M4 Pro 上测试 pdf-inspector 0.2.6综合得分 0.875整卷 200 份共 0.470 秒。方法学细节见 docs/benchmarking.md。到这里检测、提取、Markdown 输出三条线你都跑通了。完整函数清单与每个字段的含义去官方文档 docs/python.md 里按图索骥即可。【免费下载链接】pdf-inspectorFast Rust library for PDF inspection, classification, and text extraction. Intelligently detects scanned vs text-based PDFs to enable smart routing decisions.项目地址: https://gitcode.com/GitHub_Trending/pdf/pdf-inspector创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考