如何读懂MingLi-Bench评测报告?从整体准确率到12大命理类别的完整指南
【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-Bench
MingLi-Bench 是一个面向大语言模型(LLM)的中国传统命理评测基准,专门考察模型在八字(四柱)与紫微斗数推理上的表现。跑完一次评测后,你会得到一份包含整体准确率、类别细分、响应时间的报告。这篇文章将手把手教你读懂这份 MingLi-Bench 评测报告:先看全局指标,再逐项拆解 12 大命理类别,最后学会下钻到单题定位问题。
一、先搞懂评测在测什么
MingLi-Bench 的题目全部采用四选一选择题形式,以"与标准答案完全一致"作为评分标准。题库来自全球算命师大赛 2022–2025 年度赛题,共160 道题,覆盖 4 个年份,原始题面存放在 data/raw/ 中。
评测的核心设计是将"排盘"与"推理"两个环节解耦:
- data/data.json —— 整理后的 160 道选择题,每题都标注了类别(婚姻、事业、财运等);
- data/fortune_api_results.json —— 借助排盘引擎预先排好的 32 组八字 / 紫微斗数命盘,按
case_id(命主索引)与题目关联。开启--astro参数后,命盘信息会直接注入提示词,让分数反映推理能力而非排盘能力。
💡 官方建议始终开启
--cot(思维链)与--astro(注入命盘),这也是解读报告时最需要确认的"前提条件"。
二、评测报告三件套:先找对文件
每次运行都会在输出目录(默认logs/)下生成三类文件,这是读懂 MingLi-Bench 评测报告的起点:
| 文件 | 内容 | 适合谁看 |
|---|---|---|
<model>_results.json | 每道题的预测结果、打分与整体统计 | 需要二次分析的数据党 |
<model>_summary.txt | 核心指标摘要,人类可读 | 快速了解结论(推荐第一站) |
<model>_responses/ | 每道题的模型原始响应,独立成文件 | 想逐题复盘推理过程的人 |
报告由 mingli_bench/benchmark.py 中的统计逻辑生成,摘要文本对应_generate_summary()方法。
三、摘要速读:4 个核心指标一次看懂
打开summary.txt,结构非常固定,从上到下依次是:
1. 运行配置(Settings)
Settings: CoT=True, Astro=True, Year=all, ShuffleOptions=False👉 读报告的第一步是看这行:CoT / Astro 开关、评测年份、是否打乱选项顺序。不同配置下跑出的分数不可直接横向比较,这是新手最容易踩的坑。
2. 整体结果(Overall Results)
Total Questions: 160 Correct Answers: 58 Errors: 0 Overall Accuracy: 36.25%- Overall Accuracy(整体准确率)就是"答对题数 ÷ 总题数",是报告的头号指标;
- Errors是 API 调用或解析失败的题目数,若不为 0,先修环境问题再谈分数。
3. 类别细分(Category Breakdown)
这是下一节的重点,先睹为快:
Category Breakdown: ----------------- 婚姻 : 47.73% (21/44) 事业 : 40.00% (10/25)4. 性能指标:Average Response Time(平均每题耗时)与Total Evaluation Time(总耗时),用来评估模型的实际调用成本。
四、逐项拆解:12 大命理类别怎么看
题库将 160 道题划分为12 大类别,各类别的实际题量如下(可通过python -m mingli_bench.cli --stats随时核对):
| 类别 | 题量 | 关注点 |
|---|---|---|
| 婚姻 | 44 | 占比最大,权重最高 |
| 事业 | 25 | 职场与生意判断 |
| 家庭 | 22 | 六亲关系推断 |
| 健康 | 17 | 疾病与手术事件 |
| 性格 | 14 | 性情特质分析 |
| 财运 | 13 | 得财、投资、负债 |
| 学业 | 11 | 学历与考试 |
| 子女 | 6 | 生育与子女情况 |
| 外貌 | 3 | 外形推断 |
| 运势 | 2 | 阶段性强弱 |
| 灾劫 | 2 | 意外与灾祸事件 |
| 官非 | 1 | 诉讼纠纷 |
📌解读技巧有三条:
- 看权重:婚姻类 44 题占了总分的 27.5%,一个类别的表现足以拉动整体准确率,解读时优先看大题量类别;
- 看小样本陷阱:官非、运势、灾劫类各只有 1–2 题,对错题 1 道准确率就从 0% 跳到 50%+,小类别分数波动大,不要过度解读;
- 做差值对比:整体准确率 36% 的模型,若婚姻类达到 60% 而财运仅 15%,说明模型对"感情宫位"推理尚可、对"财帛宫"薄弱——这正是逐项分析的价值所在。
类别统计的计算逻辑位于 mingli_bench/benchmark.py 的_calculate_statistics():按category字段分组,分别累计total、correct,再算出accuracy = correct / total。
五、进阶操作:下钻单题与横向对比
下钻单题:responses/目录中每道题一个文件,包含题目、选项、完整 Prompt、模型回复、预测答案与正确性标注。发现某类别失分集中时,挑 2–3 道错题通读模型推理链,就能判断是"排盘理解错误"还是"断事逻辑错误"。
按类别单独评测:用--categories参数只跑某一类,例如:
python -m mingli_bench.cli --model openai/gpt-4o --categories 婚姻 财运 --cot --astro按年份单独评测:--year 2024只测某年度赛题,可观察模型在不同年份题目上的稳定性。
横向对比:多个模型各自产出summary.txt后,把"Overall Accuracy + 12 类别表"拼成一张对照表,即可得到一张清晰的命理推理能力排行图。
需要本地运行的话,克隆仓库
git clone https://gitcode.com/gh_mirrors/mi/MingLi-Bench,按 README_zh.md 配置.env中的 API 密钥即可。数据加载与年份/类别过滤的实现可参考 mingli_bench/data/loader.py。
六、常见问题 FAQ
Q1:整体准确率 36% 算高还是低?随机瞎猜是 25%(四选一),所以任何显著高于 25% 的分数都说明模型具备一定的命理知识。把 25% 当作基准线来读报告会更直观。
Q2:为什么两次跑分不一样?检查Settings行——温度、CoT、命盘注入、选项是否打乱,任一不同都会影响分数;另外模型版本更新也会导致分数漂移。
Q3:Errors 非 0 会影响准确率吗?会的。失败的题目按答错计入分母,建议先调低--max-workers并发数重试,拿到干净的分数再做分析。
总结
读懂 MingLi-Bench 评测报告只需四步:核对运行配置 → 看整体准确率 → 逐项分析 12 大命理类别 → 下钻单题定位失分原因。掌握了这套读法,你不仅能看懂单一模型的命理推理能力,还能在多个大模型之间做出有依据的横向比较。
【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-Bench
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考