为什么kordoc登顶PDF解析榜?opendataloader-bench 200文档实测0.960完胜12大解析器

发布时间:2026/10/4 21:41:30
为什么kordoc登顶PDF解析榜?opendataloader-bench 200文档实测0.960完胜12大解析器 为什么kordoc登顶PDF解析榜opendataloader-bench 200文档实测0.960完胜12大解析器【免费下载链接】kordoc모두 파싱해버리겠다 — HWP·HWPX·PDF·Office 문서를 Markdown으로. 양식 자동 채우기와 신구대조를 갖춘 CLI·MCP 서버 | Convert Korean documents (HWP, HWPX, PDF, Office) to Markdown — CLI and MCP server with form filling and diff项目地址: https://gitcode.com/gh_mirrors/ko/kordockordoc 是一款面向韩语文档的开源转换工具可把 HWP、HWPX、PDF、Office 文档高质量转换为 Markdown。在 2026-09-29 的opendataloader-bench公开基准实测中kordoc 以200 篇 PDF、0 失败、0 缺失的表现跑出0.960的综合分力压 opendataloader-hybrid、docling、marker、mineru、markitdown 等 12 个主流 PDF 解析器登顶解析榜 。本文带你读懂这场 200 文档实测以及 kordoc 为什么能赢。一、先搞懂规则opendataloader-bench 是什么opendataloader-bench 是一个公开的 PDF 转 Markdown 评测基准包含200 篇真实 PDF学术论文、报告、幻灯片、海报、扫描件每篇都配有人工制作的正答参考文件 425 个哈希固定未改动。它从三个维度打分满分 1.0 与正答完全一致指标缩写衡量什么阅读顺序NID文字是否按人类阅读顺序输出表格结构TEDS表格行列、合并单元格是否与原文一致标题层级MHS标题的层级结构是否正确综合分由三项加权平均得出。对 RAG 检索、AI 训练语料来说这三项正是决定文档质量的关键——顺序错、表格散下游模型基本就废了。二、成绩揭晓12 大解析器同场实测以下为 2026-09-29 的公开引擎对比记录其他引擎成绩取自基准仓库公开结果kordoc 用相同的 PDF、相同的正答、未修改的原始评分器重新实测见 docs/benchmarks.md排名引擎综合阅读顺序表格标题每页耗时1kordoc默认0.9600.9610.9790.9450.52s2opendataloader-hybrid0.9070.9340.9280.8210.46s3nutrient商用0.8850.9250.7080.8190.01s4docling0.8820.8980.8870.8240.76s5marker0.8610.8900.8080.79653.9s6unstructured-hires0.8410.9040.5880.7493.01s7edgeparse0.8370.8940.7170.7060.04s8mineru0.8310.8570.8730.7435.96s9opendataloader0.8310.9020.4890.7390.02s10pymupdf4llm0.7320.8850.4010.4120.09s11unstructured0.6860.8820.0000.3880.08s12markitdown0.5890.8440.2730.0000.11s13liteparse0.5760.8660.0000.0001.06s两个值得注意的细节kordoc 综合分领先第 2 名 5.3 个百分点其中标题层级0.945 vs 0.821差距最大开启ocr: true, plain: true, htmlTables: true组合后kordoc 综合分进一步升到0.973表格分0.983是全场最强配置。三、为什么能赢拆解 kordoc 的三个杀手锏1️⃣ 表格结构检测线格 裁剪盒 跨页拼接表格是 PDF 解析最大的失分点末三位引擎表格分都是 0。kordoc 在 src/pdf/ 中实现了多套互补的表格检测策略线格检测src/pdf/line-detector.ts、src/pdf/table-grid.ts从 PDF 图形指令提取真实绘制的水平/垂直线由交点重建网格能还原合并单元格裁剪盒表格src/pdf/clip-cells.ts韩文 Office 导出的 PDF 常用clip路径画单元格kordoc 把每格裁剪矩形直接当作单元格几何专治看不见的表格跨页表格拼接src/pdf/table-parts.ts自动识别被页边界切断的表格按列边界、重复表头、单元格碎片等证据把两页的表拼回一张。这三招叠加让 kordoc 表格分达到0.979全场最高。2️⃣ 阅读顺序恢复XY-Cut 切分 双栏识别论文、幻灯片普遍是双栏甚至三栏排版。kordoc 的 PDF 解析入口 src/pdf/parser.ts 采用XY-Cut算法切分阅读区域并由 src/pdf/page-regions.ts 识别双栏正文、页眉页脚、图表标题等版面区域把视觉位置混乱的文本还原成正确阅读流阅读顺序分0.961。3️⃣ 智能自动 OCR扫描件不再丢分200 篇文档中有72 篇包含无文本层的扫描页或大尺寸图片文字。kordoc 的默认配置会自动对无文本层的页和占页面面积 5% 以上的大图执行本地 OCR配置综合分每页耗时ocr: false最快0.9370.04s默认缓存命中时自动 OCR0.9600.52socr: true含小图 OCR0.9600.57s仅靠开 OCR这一项就拉回0.023 分这正是它拉开与纯文本层解析器差距的关键。OCR 引擎相关实现见 src/ocr/engine.ts。四、性能表现200 篇文档约 102 秒根据 4.18.6 版本的验证记录docs/release-4.18.6.json 的externalOdl字段原始数据可查200 篇文档单进程顺序解析总耗时约102 秒每页约 0.52 秒峰值内存约1.8 GB失败 0 件、缺失 0 件——对比 marker 每页 53.9 秒、mineru 每页 5.96 秒kordoc 在精度第一的同时速度也处在第一梯队。如何复现这个基准实测脚本就在仓库里node bench/odl-bench.mjs opendataloader-bench 克隆目录它会调用基准仓库自带的src/evaluator.py对 200 篇输出统一打分。评分口径、排除标准、各选项数值的完整说明见 docs/benchmarks.md 的PDF → Markdown — opendataloader-bench章节。五、新手快速上手1 分钟把 PDF 变成 Markdownkordoc 基于 Node.js20一条命令即可运行# 单文件转换 npx kordoc 文档.pdf -o 文档.md # 批量并行转换--jobs 4 四进程 npx kordoc *.pdf --jobs 4 -d ./输出目录 # 扫描件自动 OCR npx kordoc 扫描版.pdf --ocr -o 扫描版.md # 输出结构化 JSON取指定页 npx kordoc 文档.pdf --format json --pages 1-3如果要把 kordoc 接给 AI 编程助手Claude Desktop、Cursor、Claude Code 等执行npx -y kordoc setup即可注册 MCP 服务获得解析、对比、生成、渲染等17 个工具。完整命令行与 API 文档见 docs/usage.md。顺带一提kordoc 的本行是韩语文档在 2,286 篇真实政府 HWPX 文件上可见表格9,865/9,865100%结构一致docs/release-4.18.8.json——处理韩国公文 PDF 的场景它几乎是唯一选择 。六、总结0.960 意味着什么亮点数据综合分0.96012 个公开解析器中第 1表格结构0.979末位为 0.000稳定性200 文档 0 失败 0 缺失速度每页 0.52 秒约为 marker 的 1/100kordoc 的登顶并非偶然版面感知的表格重建 XY-Cut 阅读顺序 按需自动 OCR恰好命中了 opendataloader-bench 三大评分维度的痛点。对于需要批量把 PDF 变成干净 Markdown 的开发者它是目前公开基准下最值得优先考虑的解析器之一。【免费下载链接】kordoc모두 파싱해버리겠다 — HWP·HWPX·PDF·Office 문서를 Markdown으로. 양식 자동 채우기와 신구대조를 갖춘 CLI·MCP 서버 | Convert Korean documents (HWP, HWPX, PDF, Office) to Markdown — CLI and MCP server with form filling and diff项目地址: https://gitcode.com/gh_mirrors/ko/kordoc创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考