☰
如何读懂MingLi-Bench评测报告?从整体准确率到12大命理类别的完整指南
2026/10/4 3:26:29 网站建设 项目流程

如何读懂MingLi-Bench评测报告?从整体准确率到12大命理类别的完整指南

【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-Bench

MingLi-Bench 是一个面向大语言模型(LLM)的中国传统命理评测基准,专门考察模型在八字(四柱)与紫微斗数推理上的表现。跑完一次评测后,你会得到一份包含整体准确率、类别细分、响应时间的报告。这篇文章将手把手教你读懂这份 MingLi-Bench 评测报告:先看全局指标,再逐项拆解 12 大命理类别,最后学会下钻到单题定位问题。

一、先搞懂评测在测什么

MingLi-Bench 的题目全部采用四选一选择题形式,以"与标准答案完全一致"作为评分标准。题库来自全球算命师大赛 2022–2025 年度赛题,共160 道题,覆盖 4 个年份,原始题面存放在 data/raw/ 中。

评测的核心设计是将"排盘"与"推理"两个环节解耦:

  • data/data.json —— 整理后的 160 道选择题,每题都标注了类别(婚姻、事业、财运等);
  • data/fortune_api_results.json —— 借助排盘引擎预先排好的 32 组八字 / 紫微斗数命盘,按case_id(命主索引)与题目关联。开启--astro参数后,命盘信息会直接注入提示词,让分数反映推理能力而非排盘能力。

💡 官方建议始终开启--cot(思维链)与--astro(注入命盘),这也是解读报告时最需要确认的"前提条件"。

二、评测报告三件套:先找对文件

每次运行都会在输出目录(默认logs/)下生成三类文件,这是读懂 MingLi-Bench 评测报告的起点:

文件内容适合谁看
<model>_results.json每道题的预测结果、打分与整体统计需要二次分析的数据党
<model>_summary.txt核心指标摘要,人类可读快速了解结论(推荐第一站)
<model>_responses/每道题的模型原始响应,独立成文件想逐题复盘推理过程的人

报告由 mingli_bench/benchmark.py 中的统计逻辑生成,摘要文本对应_generate_summary()方法。

三、摘要速读:4 个核心指标一次看懂

打开summary.txt,结构非常固定,从上到下依次是:

1. 运行配置(Settings)

Settings: CoT=True, Astro=True, Year=all, ShuffleOptions=False

👉 读报告的第一步是看这行:CoT / Astro 开关、评测年份、是否打乱选项顺序。不同配置下跑出的分数不可直接横向比较,这是新手最容易踩的坑。

2. 整体结果(Overall Results)

Total Questions: 160 Correct Answers: 58 Errors: 0 Overall Accuracy: 36.25%
  • Overall Accuracy(整体准确率)就是"答对题数 ÷ 总题数",是报告的头号指标;
  • Errors是 API 调用或解析失败的题目数,若不为 0,先修环境问题再谈分数。

3. 类别细分(Category Breakdown)

这是下一节的重点,先睹为快:

Category Breakdown: ----------------- 婚姻 : 47.73% (21/44) 事业 : 40.00% (10/25)

4. 性能指标:Average Response Time(平均每题耗时)与Total Evaluation Time(总耗时),用来评估模型的实际调用成本。

四、逐项拆解:12 大命理类别怎么看

题库将 160 道题划分为12 大类别,各类别的实际题量如下(可通过python -m mingli_bench.cli --stats随时核对):

类别题量关注点
婚姻44占比最大,权重最高
事业25职场与生意判断
家庭22六亲关系推断
健康17疾病与手术事件
性格14性情特质分析
财运13得财、投资、负债
学业11学历与考试
子女6生育与子女情况
外貌3外形推断
运势2阶段性强弱
灾劫2意外与灾祸事件
官非1诉讼纠纷

📌解读技巧有三条:

  1. 看权重:婚姻类 44 题占了总分的 27.5%,一个类别的表现足以拉动整体准确率,解读时优先看大题量类别;
  2. 看小样本陷阱:官非、运势、灾劫类各只有 1–2 题,对错题 1 道准确率就从 0% 跳到 50%+,小类别分数波动大,不要过度解读;
  3. 做差值对比:整体准确率 36% 的模型,若婚姻类达到 60% 而财运仅 15%,说明模型对"感情宫位"推理尚可、对"财帛宫"薄弱——这正是逐项分析的价值所在。

类别统计的计算逻辑位于 mingli_bench/benchmark.py 的_calculate_statistics():按category字段分组,分别累计total、correct,再算出accuracy = correct / total。

五、进阶操作:下钻单题与横向对比

下钻单题:responses/目录中每道题一个文件,包含题目、选项、完整 Prompt、模型回复、预测答案与正确性标注。发现某类别失分集中时,挑 2–3 道错题通读模型推理链,就能判断是"排盘理解错误"还是"断事逻辑错误"。

按类别单独评测:用--categories参数只跑某一类,例如:

python -m mingli_bench.cli --model openai/gpt-4o --categories 婚姻 财运 --cot --astro

按年份单独评测:--year 2024只测某年度赛题,可观察模型在不同年份题目上的稳定性。

横向对比:多个模型各自产出summary.txt后,把"Overall Accuracy + 12 类别表"拼成一张对照表,即可得到一张清晰的命理推理能力排行图。

需要本地运行的话,克隆仓库git clone https://gitcode.com/gh_mirrors/mi/MingLi-Bench,按 README_zh.md 配置.env中的 API 密钥即可。数据加载与年份/类别过滤的实现可参考 mingli_bench/data/loader.py。

六、常见问题 FAQ

Q1:整体准确率 36% 算高还是低?随机瞎猜是 25%(四选一),所以任何显著高于 25% 的分数都说明模型具备一定的命理知识。把 25% 当作基准线来读报告会更直观。

Q2:为什么两次跑分不一样?检查Settings行——温度、CoT、命盘注入、选项是否打乱,任一不同都会影响分数;另外模型版本更新也会导致分数漂移。

Q3:Errors 非 0 会影响准确率吗?会的。失败的题目按答错计入分母,建议先调低--max-workers并发数重试,拿到干净的分数再做分析。

总结

读懂 MingLi-Bench 评测报告只需四步:核对运行配置 → 看整体准确率 → 逐项分析 12 大命理类别 → 下钻单题定位失分原因。掌握了这套读法,你不仅能看懂单一模型的命理推理能力,还能在多个大模型之间做出有依据的横向比较。

【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-Bench

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询