大模型的能力评测——Benchmark 是什么、怎么测、能信吗?
2026/7/23 2:41:50 网站建设 项目流程

副标题:每个新模型发布都自带一张"跑分表",MMLU 94%、SWE-bench 88.6%、C-Eval 93%……但这些数字到底代表什么?同样的模型为什么在不同榜单上位置不一样?看懂 Benchmark,是选模型的起点。


一、一个经典困境

你刷到一条新闻:

“GLM-5.2 发布,MMLU 达到 94%,超越 GPT-5.6 Sol 了?”

往下翻评论区:

  • “才 94%?Claude Fable 5 都 91.5%(MMLU-Pro),凭什么说全面超越?”
  • “MMLU 早就饱和了,谁还看这个啊”
  • “得看 SWE-bench,GLM 的 SWE-bench Pro 是 62.1%”
  • “等等,它家自己发的 94% 是 5-shot CoT 还是 zero-shot?评测设置不一样分数完全不同”

一头雾水。

这不是你的问题——大模型评测本身就是一个已经变得极其复杂的领域。几十个 Benchmark、不同的评测设置、不同的版本(MMLU 还是 MMLU-Pro?)、数据污染问题……如果你是第一次认真看这些数字,看不懂是正常的。

这篇文章的目的就是:把大模型评测这件事彻底讲透。你看完以后,不仅能看懂任何一份模型评测表,还能判断哪些数字值得信、哪些只是营销。


二、Benchmark 到底是什么?

Benchmark = 一套标准化测试题 + 一套评分规则。

它解决的问题很简单:没有统一的考试,你怎么知道 A 模型比 B 模型强?

类比高考:

  • 高考分数不能完全代表一个人的能力——但它是大学招生的统一标尺
  • 没有高考,每个大学自己面试录取,效率极低且无法横向比较

大模型的 Benchmark 也是同样的角色——它不完美,但没有它,模型的强弱就是各说各话。

一个好的 Benchmark 需要三点

  1. 区分度:弱模型低分、强模型高分,能拉开差距
  2. 可复现:同一模型跑同一套题,结果应该差不多(temperature=0 时)
  3. 抗污染:测试题不应该出现在训练数据里——否则模型不是"会",是"记得"

三、评测维度:大模型的能力可以拆成哪些方向?

一张总览表,对应后面的详细展开:

能力维度代表 Benchmark测什么饱和了吗?
知识广度MMLU → MMLU-Pro57 学科,模型是否"博学"MMLU 已饱和,MMLU-Pro 仍有区分度
数学推理GSM8K → MATH → AIME数学,从算术到竞赛GSM8K 已饱和,AIME 仍有挑战
代码生成HumanEval → SWE-bench从写函数到修 BugSWE-bench 还在拉开差距
复杂推理BBH / GPQA Diamond博士级科学推理前沿 60-90%,区分度好
中文能力C-Eval / SuperCLUE中国教育体系下的知识榜首 90-94%,有污染问题
长上下文Needle-in-a-Haystack / RULER百万 token 中的精准检索大部分模型做得不错,但不完美
对话体验Chatbot Arena人类盲评,看谁"更会聊天"永远有区分度——用户口味不同
Agent 能力SWE-bench / Terminal-Bench多步工具调用新兴领域,差距明显

四、主流 Benchmark 详解(含题目示例)

4.1 MMLU / MMLU-Pro:知识量的"高考"

MMLU(Massive Multitask Language Understanding)是目前引用最多的大模型知识评测,57 个学科、约 14,000 道选择题,覆盖人文、社科、理工、医学、法律等。

题目长什么样?

学科:大学物理(College Physics)

一个电子在均匀电场 E 中从静止开始加速。经过距离 d 后,它的动能是多少?

A. e E d
B. e E / d
C. e d / E
D. ½ e E d²

学科:美国法律(Jurisprudence)

下列哪个是英美法系中"stare decisis"原则的核心含义?

A. 法官可以自由裁量
B. 上级法院的判决对下级法院有约束力
C. 陪审团决定事实问题
D. 判例法可以随时推翻

从 MMLU 到 MMLU-Pro

MMLU 的 4 选 1 格式对今天的前沿模型来说太容易了——最先进的模型普遍 >90%,1-2 个百分点的差异在统计上不显著。

MMLU-Pro 做了三件事升级:

  1. 4 选 1 → 10 选 1,猜对概率从 25% 降到 10%
  2. 增加了更多推理型题目,减少"记忆就能答对"的题
  3. 去除了质量低的题目,总题量缩减到 12,000+

同样的物理题在 MMLU-Pro 里可能变成:

一个电子在均匀电场 E 中从静止开始加速,经过距离 d 后进入一个垂直于运动方向的匀强磁场 B。求电子在磁场中的回旋半径。

A. mE/(eB²d)
B. √(2mEed)/(eB)
C. √(2mE)/(eB) · √d
D. √(2mE)/(Be)⁰·⁵
E. 2mE/(eBd)
F. eB√(2mEd)
G. √(2mEed)/B
H. m√(E/(eB))·d
I. 以上都不对
J. 条件不足无法计算

难度明显上升——10 个选项里只有 1 个对的,模型必须真正理解物理过程,不能靠排除法。

2026 年前沿数据
模型MMLUMMLU-Pro
Claude Fable 591.5%
Claude Opus 4.892.1%89.5%
GPT-5.6 Sol
Gemini 3.1 Ultra90.4%89.8%
Qwen3.7 Max89.6%
DeepSeek V487.2%
GLM-5.287.3%86%

4.2 GSM8K / MATH / AIME:数学能力的"三级跳"

大模型的数学评测有清晰的难度阶梯:

GSM8K(小学) → MATH(竞赛预科) → AIME / FrontierMath(天才级)
第一级:GSM8K(Grade School Math 8K)

8,500 道小学数学应用题,要求写出推理过程后再给答案。

典型题目:

蛋糕店上午卖出 23 个蛋糕,每个售价 12 元。下午卖出的蛋糕数量是上午的 2 倍,每个售价降价 2 元。问全天总收入是多少?

模型需要输出:上午收入 = 23 × 12 = 276 元;下午数量 = 23 × 2 = 46 个;下午单价 = 12 - 2 = 10 元;下午收入 = 46 × 10 = 460 元;总收入 = 276 + 460 =736 元

这道题对前沿模型已经是送分题了。2026 年,所有主流模型 GSM8K 都 >95%,o3-pro 甚至达到 99.1%

第二级:MATH(Mathematics Aptitude Test of Heuristics)

12,500 道竞赛级数学题,难度对标美国 AMC(American Mathematics Competitions)。

典型题目:

在等差数列中,第 5 项是 17,第 9 项是 29。求前 12 项的和。

模型需要:设首项 a₁,公差 d。a₅ = a₁ + 4d = 17,a₉ = a₁ + 8d = 29。解得 d = 3,a₁ = 5。前 n 项和公式 S₁₂ = (12/2)(2×5 + 11×3) = 6 × (10 + 33) = 6 × 43 =258

到这里,有些开源模型就开始跟不上了。MATH 的准确率通常在 70-90% 之间。

第三级:AIME(American Invitational Mathematics Examination)

这是真正的天才级。每年 15 道题,考试时间 3 小时,每题答案都是 0-999 的整数。AIME 是选拔美国数学奥赛国家队的前置考试。

典型题目(AIME 2025, Problem 12):

设 f(x) = x³ + 3x² + 3x + 2025。对于实数 t,定义 g(t) 为 f(x) = t 的最小实数根。求所有使 g(t) 为有理数的 t 的值之和。

(提示:f(x) = (x+1)³ + 2024,所以 f(x) 关于 (-1, 2024) 中心对称……)

这道题大部分人类考生也做不出来。前沿模型中,GLM-5.2 在 AIME 2026 上达到 99.2%,o3-pro 也接近这个水平。但这是 Chain-of-Thought + 多数投票 + 大量算力堆出来的——不是一次推理能答对的。

一条有趣的规律

这三个 Benchmarks 的分数随着时间推移呈现出规律性的"阶梯上移":

2023年: GSM8K ~60% → MATH ~30% → AIME 无人问津 2024年: GSM8K ~85% → MATH ~60% → AIME ~10-20% 2025年: GSM8K ~95% → MATH ~85% → AIME ~50-70% 2026年: GSM8K ~99% → MATH ~92% → AIME ~90%+

不是大模型突然变聪明了——是 Chain-of-Thought、自洽性采样、搜索型推理等技术的进步。算力换准确率,在数学推理上最明显。


4.3 HumanEval → SWE-bench:代码能力的"技术债"

代码评测经历了类似的"难度升级"过程。

HumanEval:写一个函数

OpenAI 发布的 164 道 Python 编程题。给模型一个函数签名和 docstring,让它补全函数体。

典型题目:

defhas_close_elements(numbers:List[float],threshold:float)->bool:"""检查列表中是否存在任意两个元素的差的绝对值小于 threshold"""

模型写完后,用预置的 test cases 验证。很简单,前沿模型普遍 >90%。

SWE-bench:修一个真实的 Bug

SWE-bench 把难度提升了几个数量级。它不是"写个函数",而是:

  • 从真实 Python 开源项目(Django、SymPy、matplotlib 等)中提取 Issue
  • 给出完整的仓库代码
  • 要求模型定位 Bug、修改代码、让所有测试通过

典型场景(SWE-bench 真实 Issue):

Issue: Django #XXXXX 标题: `QuerySet.exclude()` 与 `Q()` 对象结合使用时, 在特定条件下生成了错误的 SQL 子查询 项目: django/django 涉及文件: django/db/models/query.py, django/db/models/sql/query.py

模型需要:

  1. 理解 Django ORM 的查询构造逻辑
  2. 定位到生成 SQL 子查询的那段代码
  3. 理解 exclude() + Q() 的组合语义
  4. 修改代码
  5. 验证修改不破坏其他测试

这不是"写代码"——这是真正的软件工程。模型需要理解一个几十万行的大项目,找到问题所在,给出修复方案。

SWE-bench Verified 和 SWE-bench Pro
  • SWE-bench Verified:OpenAI 从原始 SWE-bench 中人工验证了一个子集(约 500 题),去掉了有歧义的、太难的和太容易的
  • SWE-bench Pro:更新的版本,用新的 Issue,抗数据污染
2026 年 SWE-bench 排名

SWE-bench 目前有两个版本:Verified(约 500 题,人工验证子集)和Pro(更新的、抗污染的版本)。不同模型报告的版本不同,分开列。

模型SWE-bench VerifiedSWE-bench Pro
Claude Fable 595.0%80.3%
Claude Opus 4.888.6%69.2%
GPT-5.6 Sol64.6%
DeepSeek V4-Pro80.6%
GLM-5.262.1%
Qwen 3.6 Plus78.8%
Llama 4 Maverick~65%

注:SWE-bench 分数依赖 Agent 框架(scaffold)选择,同一模型在不同评测框架下结果可能不同。Kimi K3 未公布 SWE-bench 分数,但它的SWE Marathon(类似的多文件修复评测)达到42.0%,领先 Fable 5(35%)和 GPT-5.6 Sol(39%),不过评测方式不同,不可直接对比。

为什么 SWE-bench 对中文开发者特别有冲击力?因为修 Bug 是每个程序员每天在做的事。一个模型如果能在 SWE-bench 上拿到 80%,意味着它理论上能帮团队里中级工程师处理日常 Bug 修复。


4.4 GPQA Diamond:博士级推理

GPQA(Google-Proof QA)由博士级研究者出的题,目标是"谷歌搜不到答案"。

典型题目(领域:物理化学):

在 Born-Oppenheimer 近似下,一个双原子分子的振-转能级可以用以下公式描述:
E(v,J) = ωₑ(v+½) + BₑJ(J+1) - αₑ(v+½)J(J+1)
其中 v 是振动量子数,J 是转动量子数。

对于 HCl 分子,ωₑ = 2989.7 cm⁻¹,Bₑ = 10.59 cm⁻¹,αₑ = 0.301 cm⁻¹。
从基态到 v=1, J=0 的跃迁能量最接近:

A. 2885.7 cm⁻¹
B. 2989.7 cm⁻¹
C. 3010.6 cm⁻¹
D. 2998.2 cm⁻¹

这道题即使让物理系的研究生来做也不一定秒答。GPQA Diamond 的准确率,前沿模型在 60-91% 之间浮动,区分度依然很好。

模型GPQA Diamond
GPT-5.6 Sol94.1%
Gemini 3.1 Pro94.1%
Claude Fable 593.2%
Kimi K393.5%
GLM-5.291.2%
o3-pro87.4%
Claude Opus 4.8~78%

GPQA Diamond 上 GPT-5.6 Sol 和 Gemini 3.1 Pro 并列第一(94.1%),Kimi K3(93.5%)和 Fable 5(93.2%)紧追在后。这张表的竞争格局比 MMLU 开放得多——新模型在这个维度上还有很大的突破空间。Claude Opus 4.8 在这个指标上意外偏低(~78%),可能与其推理策略有关,而非能力不足。


4.5 C-Eval / SuperCLUE:中文能力

C-Eval 是中文大模型评测的事实标准,由上海交大、清华、爱丁堡大学联合发布。它覆盖 52 个中文科目,13,948 道 4 选 1 选择题,题目直接来自中国教育体系。

题目长什么样?

学科:大学物理(中文)

一个质量为 m 的质点沿 x 轴运动,势能函数为 V(x) = ½kx²。当质点从 x = A 处由静止释放时,运动到 x = A/2 处的速度大小为:

A. A√(k/m)
B. A√(k/(2m))
C. A√(k)/(2√m)
D. √(3k/(4m)) · A

学科:中国法律基础

根据《中华人民共和国合同法》,下列关于要约和要约邀请的说法,哪一项是正确的?

A. 商业广告均属于要约
B. 价目表寄送属于要约
C. 要约可以随时撤销
D. 要约到达受要约人时生效

学科:中国古代文学

"落霞与孤鹜齐飞,秋水共长天一色"出自哪位作者的哪篇作品?

A. 王勃《滕王阁序》
B. 杜甫《登高》
C. 李白《将进酒》
D. 苏轼《赤壁赋》

这些题不仅考语言能力,更考中文语境下的知识积累。这也是为什么 Qwen、GLM 等国内模型在 C-Eval 上能超越 GPT/Claude——它们在中文本土知识上训练得更多。

2026 年 C-Eval 排名
模型C-Eval
K2.5-1T-A32B(Kimi 前代)94.0%
Qwen3-Max-Thinking93.7%
Gemini 3.1 Pro93.4%
Qwen3.5-397B-A17B93.0%
Claude Opus 4.892.2%
GPT-5.6 Sol
Claude Fable 5

注:Fable 5 和 GPT-5.6 Sol 均未公布 C-Eval 分数,因此不列在表格中。

⚠️ 数据污染问题

C-Eval 最大的问题是数据污染严重。研究表明 C-Eval 的污染率高达约 45%——也就是说,接近一半的测试题在训练数据中出现过。一些模型可能不是"掌握了中国法律",而是"记住了这道选择题的答案"。

这也是为什么看 C-Eval 分数要打折扣:一个 94% 的 C-Eval 和一个 87% 的 MMLU-Pro,前者未必代表更强的中文能力。


4.6 长上下文:Needle-in-a-Haystack / RULER

长上下文评测的核心逻辑很简单:把一条关键信息藏在极长的文本中,问模型关于这条信息的问题。

Needle-in-a-Haystack(大海捞针)

测试步骤:

  1. 生成一个超长文本(比如 100K tokens),内容可以是 Paul Graham 的散文
  2. 在某个随机位置插入一句话(“needle”):“中国最深的淡水湖是天池”
  3. 问模型:“中国最深的淡水湖是什么?”

如果模型能答对,说明它在长上下文中成功检索到了这条信息。

不同模型在不同上下文长度下的表现可以画成一张热力图

上下文长度 → 模 128K: ████████████████████ 98% 型 64K: ████████████████████ 99% 位 32K: ████████████████████ 100% 置 16K: ████████████████████ 100% ↓ 8K: ████████████████████ 100% 4K: ████████████████████ 100% ← 针在文本中的插入位置 →

好的模型是"全红"的(不管针插在哪都能找到),差的模型在长文本+针在中间位置时准确率骤降。

RULER:升级版的"捞针"

RULER 不满足于简单的"找一句话",它测试几种不同的检索场景:

  1. 单针:和 Needle-in-a-Haystack 一样
  2. 多针:插 4 条信息,全找出来
  3. 多针+变量绑定:“Alice 的生日是 3 月 15 日,Bob 的生日是 7 月 22 日。Alice 的生日是几月?”
  4. 数值推理:“3 月 + 5 月 = 8 月,7 月 + 4 月 = 11 月。9 月 + 6 月 = ?”

后者需要模型在长上下文中既检索又推理,比单纯的"捞针"难得多。

2026 年长上下文现状
  • 128K 以内:所有前沿模型表现优秀,>95% 召回率
  • 128K - 1M:大部分模型开始出现"中心退化"(文本中间位置的信息更难找到)
  • >1M:只有少数模型(GLM-5.2 的 1M context、Gemini 1.5 Pro)声称支持,但实际检索精度还有折扣

关键发现:长上下文支持 ≠ 长上下文好用。上下文越长,检索效率越低,算力成本越高。多数情况下,RAG(检索增强生成)比硬塞 100 万 token 进去更划算。


4.7 Chatbot Arena:人类盲评

前面的所有 Benchmark 都是自动评测——机器出题、机器打分。但大模型最终是给人用的,人觉得好不好这个维度,自动评测很难捕捉。

这就是 Chatbot Arena 存在的意义。

它是怎么工作的?
Step 1: 用户进入聊天界面 Step 2: 用户输入一个 Prompt Step 3: 两个匿名模型(模型 A 和模型 B)同时回答 Step 4: 用户看到两个回答并投票:"哪个更好?" Step 5: 用户不知道自己在测哪个模型
为什么要盲评?

自动评测有盲区:

  • “写一首关于秋天的诗”——哪首更好?这个没法自动打分
  • “给我推荐周末好去处”——推荐的合理性和创意,自动评测难以衡量
  • “解释量子计算”——解释得是否通俗易懂?计算机无法评判

Chatbot Arena 用的是 ELO 评分系统,和《英雄联盟》/《棋牌》排位一样的机制:

  • 新模型初始 1000 分
  • 两个模型对决,赢家从输家那里拿分
  • 如果你赢了排名比你高很多的对手,加分多;输给排名低的,扣分也多
  • 长期稳定胜率 → 分数收敛到真实水平
为什么 Arena 分数和 Benchmark 分数经常不一致?
维度自动 BenchmarkChatbot Arena
评测内容标准化的考题用户自由提问
评分方式自动比对标准答案人类主观判断
覆盖范围窄(特定能力)广(综合体验)
偏差可能过拟合用户偏好偏差
时效快(跑完即出分)慢(需要大量投票)

一个模型可能在 MMLU 上 92%,在 Arena 上评分一般——因为它知识广但"不会聊天"。反之亦然,一个"聊天体验很好"的模型可能在 MMLU 上只有 85%。

2026 年 Arena 格局

截至 2026 年中,Arena 前列模型和自动评测排名大体一致但略有差异:

  • Claude 系列在对话体验上常年领先
  • GPT 系列紧随其后
  • DeepSeek 和 Qwen 在特定任务上接近前沿模型
  • Arena 也是中文模型的强项——中文用户投票多,中文对话体验好

五、一张大表:2026 年中旗舰模型能力对比

汇总 4.1-4.7 的数据:

模型参数量MMLUMMLU-ProSWE-benchGPQA DiamondC-Eval参考价格 ($/M tok)
Claude Fable 591.5%95.0%Ver93.2%$10/$50
GPT-5.6 Sol64.6% Pro94.1%$15/$60
Gemini 3.1 Ultra90.4%89.8%93.4%
Kimi K32.8T MoE~95%¹42.0%²93.5%开源
DeepSeek V4-Pro~685B MoE87.2%80.6%Ver$0.87
GLM-5.2744B MoE87.3%86%62.1% Pro91.2%~92%$1.40
Qwen3.5-397B-A17B397B MoE87.8%59.9%³93.0%
Llama 4 Maverick400B MoE84.7%~65% Ver开源

¹ Kimi K3 的 MMLU 95% 来自部分来源报告,非官方正式公布,需谨慎参考。
² Kimi K3 的 SWE Marathon 42% 与标准 SWE-bench 评测方式不同,不可直接横向对比。
³ Qwen3.5-397B-A17B 的分数来自 SWE-rebench,非标准 SWE-bench Verified。
Ver = SWE-bench Verified | Pro = SWE-bench Pro(更难的版本)

几个关键观察:

  1. SWE-bench 是目前最能拉开差距的单一 Benchmark——Fable 5(95%)到 Llama 4(65%),差距 30 个点
  2. GPQA Diamond 上 GPT-5.6 Sol、Gemini 3.1 Pro、Kimi K3 三家几乎打平——都在 93-94% 区间
  3. DeepSeek V4-Pro 是性价比之王——$0.87/M tok 实现 80.6% SWE-bench,比闭源模型便宜 30-60 倍
  4. Kimi K3 作为开源模型,在 GPQA 上达到 93.5%——仅次于 GPT-5.6 Sol,超过 Fable 5
  5. Claude Fable 5 在代码能力上断层领先——SWE-bench Pro 80.3%,比 GPT-5.6 Sol 的 64.6% 高 16 个点
  6. 中文能力方面——Gemini 3.1 Ultra(93.4%)、GLM-5.2(~92%)、Qwen3.5(93%)在 C-Eval 上领先

六、去哪里查最新评测数据?

看完上面的分析,你可能会想:这些数据从哪来的?如果我几个月后再看这篇文章,数据已经过时了怎么办?

别担心——Benchmark 数据是实时更新的,有几个好用的站点你可以直接收藏。

6.1 综合排行榜网站

站点地址特点
LLM Statsllm-stats.com300+ 模型,按综合评分/价格/速度/上下文长度多维度排序,每个模型有完整的 Benchmark 雷达图
Artificial Analysisartificialanalysis.ai智能指数(Intelligence Index)汇总 10 项评测,散点图(智能 vs 价格/速度)最直观
DataLearnerAIdatalearner.com/leaderboards国内平台,支持选 4 个模型横向对比,国产模型维度最全,含 C-Eval/AGI Eval 等中文评测
Chatbot Arenalmarena.aiELO 排位,人类盲评,唯一反映"真实对话体验"的排名

6.2 分类专项排行榜

专项站点说明
SWE-benchswebench.com代码修复能力的官方排行榜,Verified 和 Pro 两个版本
MMLU-Prollm-stats.com/benchmarks/mmlu-proMMLU-Pro 专项,129 个模型的排名
Open LLM Leaderboardhuggingface.co/spaces/open-llm-leaderboardHugging Face 的开源模型排行榜,只列开源权重
Aider Leaderboardaider.chat/docs/leaderboards代码编辑专项,测的是"在已有代码上修改"的能力
LiveCodeBenchlivecodebench.github.io编程竞赛题,实时更新抗污染

6.3 GitHub 上的可视化项目

如果你想直接看图表而不是翻表格,这两个开源项目把数据直接画出来了:

  • ai-race:追踪 OpenAI、Anthropic、Google、xAI、国内五家实验室的模型在 10+ 个 Benchmark 上的表现,有跨时间折线图,可以看到每个模型的能力演进轨迹
  • ai-benchmark-arena:纯前端交互面板,120+ 模型、11 个 Benchmark、6 种图表类型(柱状图、水平条形图、雷达图、散点图、气泡图、热力图)。支持搜索、筛选、导出 CSV,直接部署到 GitHub Pages

6.4 怎么看这些网站?

实践建议:

  1. 快速看排名→ LLM Stats 的综合评分排序
  2. 对比 2-4 个模型→ DataLearnerAI 的对比模式或 Artificial Analysis 的散点图
  3. 按场景选模型→ 写代码看 SWE-bench,数学看 AIME,中文看 C-Eval
  4. 看趋势→ AI Race 的折线图,看某个模型在过去几个月的能力变化
  5. 做决策前→ 不要只看一个网站,交叉验证 2-3 个来源

七、评测的"脏套路":看懂分数再信它

7.1 数据污染——最大的隐患

MMLU 的测试集是否出现在训练数据中?答案是:经常是。

大模型的训练数据来自互联网,而很多 Benchmark 的测试集也在互联网上公开。模型训练的时候"看过"这些题,测试的时候就变成了"回忆"而非"推理"。

  • C-Eval 污染率估计约 45%
  • MMLU 也被污染,虽然程度不同
  • SWE-bench Pro 通过不断更新 Issue 来抗污染——但治标不治本

最激进的做法:一些评测方(如 Anthropic)已经不再公开新的测试集,而是使用"动态生成"的方式,每次测试生成不同的题目。

7.2 评测设置不同,结果差 10 个点

同一个模型,不同的评测设置,可以得出截然不同的分数:

模型 X 的 MMLU 分数: zero-shot, direct answer: 84.2% 5-shot, direct answer: 87.1% 5-shot, CoT: 89.5% 5-shot, CoT + 多数投票×10: 91.3%

所以当你看到"MMLU: 94%"时,必须问:是 5-shot 还是 zero-shot?有没有用 CoT?有没有多数投票?评测设置可能比模型能力本身对分数的影响更大。

7.3 MMLU 饱和 → 业界往哪走?

Benchmark 的发展是一个永无止境的"军备竞赛":

MMLU (已饱和) → MMLU-Pro (正在饱和) → GPQA Diamond / HLE GSM8K (已饱和) → MATH (接近饱和) → AIME / FrontierMath HumanEval (已饱和) → SWE-bench (进行中) → SWE-bench Pro Needle-in-a-Haystack → RULER / L-Eval

每当一个 Benchmark 的分数接近 95%,它就失去了区分度,业界就会开发一个新的、更难的 Benchmark。

7.4 分数≠能力:统计显著性

MMLU 的随机方差是多少?大约 ±1.2%。

这意味着:

  • 模型 A 92.1% vs 模型 B 91.8% →无法判定谁更强(差距在噪声范围内)
  • 模型 A 92.1% vs 模型 C 89.5% →能判定 A > C

只看分数不看置信区间 = 只看标题只看正文。


八、怎么看懂 / 怎么用 Benchmark?

场景化选型指南

你的场景最该关注哪个 Benchmark
代码补全 / 代码审查SWE-bench Verified / Pro
智能客服 / 知识问答MMLU-Pro / C-Eval
数学解题AIME / MATH
长文档分析RULER / Needle-in-a-Haystack
通用对话Chatbot Arena
中文场景优先C-Eval + Arena 中文分榜
安全 / 合规TruthfulQA + 红队报告
性价比导向DeepSeek V4-Pro 的 SWE-bench/价格比

选模型的三步法

Step 1: 确定你的核心场景(写代码?问答?) Step 2: 找到对应场景的核心 Benchmark Step 3: 在 Benchmark 分数接近的模型中,优先选更便宜 / 更快 / 更容易部署的

最后一条建议:在自己业务上跑一遍,比看任何排行榜都准。

排行榜告诉你的是"这个模型在标准化考试中的表现"。但你的业务场景很可能不在这些 Benchmark 的覆盖范围内——只有你自己跑过的测试,才能真正回答"这个模型适合你的任务吗"。


九、总结

Benchmark 是标尺,不是判决。它告诉你模型在特定维度的相对位置,不告诉你模型"好不好"。

最后一轮复习

  1. 看懂分数前先看设置——5-shot 还是 zero-shot?CoT 还是 direct?设置比分数重要
  2. 要对比就比同一 Benchmark 的同一版——MMLU 和 MMLU-Pro 是两个不同的考试
  3. 对高分保持警惕——如果一个 Benchmark 的前沿模型平均 >90%,它已经接近失效
  4. 中文评测有数据污染问题——C-Eval 高分要打折看
  5. 代码能力是 2026 年最重要的区分维度——SWE-bench 是目前最能拉开差距的单一 Benchmark
  6. 性价比也是一种能力——DeepSeek V4-Pro 以闭源 1/30 的价格做到 80+% SWE-bench
  7. 最终相信自己的测试——排行榜是参考,你自己的场景才是真理

这个专栏专注于 LLM 推理与部署的底层技术——从算子开发、显存管理、调度策略到生成优化,用可运行的代码和可复现的实验,把论文里的"黑科技"变成可以理解、可以动手验证的知识。如果你对"GPU 到底在干什么"和"推理框架做了什么优化"这类问题感兴趣,欢迎来主页翻翻其他文章。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询