为什么kordoc登顶PDF解析榜?opendataloader-bench 200文档实测0.960完胜12大解析器
【免费下载链接】kordoc모두 파싱해버리겠다 — HWP·HWPX·PDF·Office 문서를 Markdown으로. 양식 자동 채우기와 신구대조를 갖춘 CLI·MCP 서버 | Convert Korean documents (HWP, HWPX, PDF, Office) to Markdown — CLI and MCP server with form filling and diff项目地址: https://gitcode.com/gh_mirrors/ko/kordoc
kordoc 是一款面向韩语文档的开源转换工具,可把 HWP、HWPX、PDF、Office 文档高质量转换为 Markdown。在 2026-09-29 的opendataloader-bench公开基准实测中,kordoc 以200 篇 PDF、0 失败、0 缺失的表现,跑出0.960的综合分,力压 opendataloader-hybrid、docling、marker、mineru、markitdown 等 12 个主流 PDF 解析器,登顶解析榜 🏆。本文带你读懂这场 200 文档实测,以及 kordoc 为什么能赢。
一、先搞懂规则:opendataloader-bench 是什么?
opendataloader-bench 是一个公开的 PDF 转 Markdown 评测基准,包含200 篇真实 PDF(学术论文、报告、幻灯片、海报、扫描件),每篇都配有人工制作的正答(参考文件 425 个,哈希固定未改动)。
它从三个维度打分,满分 1.0 = 与正答完全一致:
| 指标 | 缩写 | 衡量什么 |
|---|---|---|
| 阅读顺序 | NID | 文字是否按人类阅读顺序输出 |
| 表格结构 | TEDS | 表格行列、合并单元格是否与原文一致 |
| 标题层级 | MHS | 标题的层级结构是否正确 |
综合分由三项加权平均得出。对 RAG 检索、AI 训练语料来说,这三项正是决定文档质量的关键——顺序错、表格散,下游模型基本就废了。
二、成绩揭晓:12 大解析器同场实测
以下为 2026-09-29 的公开引擎对比记录(其他引擎成绩取自基准仓库公开结果,kordoc 用相同的 PDF、相同的正答、未修改的原始评分器重新实测,见 docs/benchmarks.md):
| 排名 | 引擎 | 综合 | 阅读顺序 | 表格 | 标题 | 每页耗时 |
|---|---|---|---|---|---|---|
| 1 | kordoc(默认) | 0.960 | 0.961 | 0.979 | 0.945 | 0.52s |
| 2 | opendataloader-hybrid | 0.907 | 0.934 | 0.928 | 0.821 | 0.46s |
| 3 | nutrient(商用) | 0.885 | 0.925 | 0.708 | 0.819 | 0.01s |
| 4 | docling | 0.882 | 0.898 | 0.887 | 0.824 | 0.76s |
| 5 | marker | 0.861 | 0.890 | 0.808 | 0.796 | 53.9s |
| 6 | unstructured-hires | 0.841 | 0.904 | 0.588 | 0.749 | 3.01s |
| 7 | edgeparse | 0.837 | 0.894 | 0.717 | 0.706 | 0.04s |
| 8 | mineru | 0.831 | 0.857 | 0.873 | 0.743 | 5.96s |
| 9 | opendataloader | 0.831 | 0.902 | 0.489 | 0.739 | 0.02s |
| 10 | pymupdf4llm | 0.732 | 0.885 | 0.401 | 0.412 | 0.09s |
| 11 | unstructured | 0.686 | 0.882 | 0.000 | 0.388 | 0.08s |
| 12 | markitdown | 0.589 | 0.844 | 0.273 | 0.000 | 0.11s |
| 13 | liteparse | 0.576 | 0.866 | 0.000 | 0.000 | 1.06s |
两个值得注意的细节:
- kordoc 综合分领先第 2 名 5.3 个百分点,其中标题层级(0.945 vs 0.821)差距最大;
- 开启
ocr: true, plain: true, htmlTables: true组合后,kordoc 综合分进一步升到0.973,表格分0.983,是全场最强配置。
三、为什么能赢?拆解 kordoc 的三个杀手锏
1️⃣ 表格结构检测:线格 + 裁剪盒 + 跨页拼接
表格是 PDF 解析最大的失分点(末三位引擎表格分都是 0)。kordoc 在 src/pdf/ 中实现了多套互补的表格检测策略:
- 线格检测(src/pdf/line-detector.ts、src/pdf/table-grid.ts):从 PDF 图形指令提取真实绘制的水平/垂直线,由交点重建网格,能还原合并单元格;
- 裁剪盒表格(src/pdf/clip-cells.ts):韩文 Office 导出的 PDF 常用
clip路径画单元格,kordoc 把每格裁剪矩形直接当作单元格几何,专治"看不见的表格"; - 跨页表格拼接(src/pdf/table-parts.ts):自动识别被页边界切断的表格,按列边界、重复表头、单元格碎片等证据把两页的表拼回一张。
这三招叠加,让 kordoc 表格分达到0.979,全场最高。
2️⃣ 阅读顺序恢复:XY-Cut 切分 + 双栏识别
论文、幻灯片普遍是双栏甚至三栏排版。kordoc 的 PDF 解析入口 src/pdf/parser.ts 采用XY-Cut算法切分阅读区域,并由 src/pdf/page-regions.ts 识别双栏正文、页眉页脚、图表标题等版面区域,把"视觉位置混乱"的文本还原成正确阅读流,阅读顺序分0.961。
3️⃣ 智能自动 OCR:扫描件不再丢分
200 篇文档中有72 篇包含无文本层的扫描页或大尺寸图片文字。kordoc 的默认配置会自动对"无文本层的页"和"占页面面积 5% 以上的大图"执行本地 OCR:
| 配置 | 综合分 | 每页耗时 |
|---|---|---|
ocr: false(最快) | 0.937 | 0.04s |
| 默认(缓存命中时自动 OCR) | 0.960 | 0.52s |
ocr: true(含小图 OCR) | 0.960 | 0.57s |
仅靠"开 OCR"这一项就拉回0.023 分,这正是它拉开与纯文本层解析器差距的关键。OCR 引擎相关实现见 src/ocr/engine.ts。
四、性能表现:200 篇文档约 102 秒
根据 4.18.6 版本的验证记录(docs/release-4.18.6.json 的externalOdl字段,原始数据可查):
- 200 篇文档单进程顺序解析,总耗时约102 秒(每页约 0.52 秒);
- 峰值内存约1.8 GB;
- 失败 0 件、缺失 0 件——对比 marker 每页 53.9 秒、mineru 每页 5.96 秒,kordoc 在精度第一的同时速度也处在第一梯队。
如何复现这个基准?
实测脚本就在仓库里:
node bench/odl-bench.mjs <opendataloader-bench 克隆目录>它会调用基准仓库自带的src/evaluator.py对 200 篇输出统一打分。评分口径、排除标准、各选项数值的完整说明,见 docs/benchmarks.md 的"PDF → Markdown — opendataloader-bench"章节。
五、新手快速上手:1 分钟把 PDF 变成 Markdown
kordoc 基于 Node.js(20+),一条命令即可运行:
# 单文件转换 npx kordoc 文档.pdf -o 文档.md # 批量并行转换(--jobs 4 四进程) npx kordoc *.pdf --jobs 4 -d ./输出目录 # 扫描件自动 OCR npx kordoc 扫描版.pdf --ocr -o 扫描版.md # 输出结构化 JSON,取指定页 npx kordoc 文档.pdf --format json --pages 1-3如果要把 kordoc 接给 AI 编程助手(Claude Desktop、Cursor、Claude Code 等),执行npx -y kordoc setup即可注册 MCP 服务,获得解析、对比、生成、渲染等17 个工具。完整命令行与 API 文档见 docs/usage.md。
顺带一提,kordoc 的本行是韩语文档:在 2,286 篇真实政府 HWPX 文件上,可见表格9,865/9,865(100%)结构一致(docs/release-4.18.8.json)——处理韩国公文 + PDF 的场景,它几乎是唯一选择 🇰🇷。
六、总结:0.960 意味着什么?
| 亮点 | 数据 |
|---|---|
| 综合分 | 0.960,12 个公开解析器中第 1 |
| 表格结构 | 0.979(末位为 0.000) |
| 稳定性 | 200 文档 0 失败 0 缺失 |
| 速度 | 每页 0.52 秒,约为 marker 的 1/100 |
kordoc 的登顶并非偶然:版面感知的表格重建 + XY-Cut 阅读顺序 + 按需自动 OCR,恰好命中了 opendataloader-bench 三大评分维度的痛点。对于需要批量把 PDF 变成干净 Markdown 的开发者,它是目前公开基准下最值得优先考虑的解析器之一。
【免费下载链接】kordoc모두 파싱해버리겠다 — HWP·HWPX·PDF·Office 문서를 Markdown으로. 양식 자동 채우기와 신구대조를 갖춘 CLI·MCP 서버 | Convert Korean documents (HWP, HWPX, PDF, Office) to Markdown — CLI and MCP server with form filling and diff项目地址: https://gitcode.com/gh_mirrors/ko/kordoc
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考