副标题:每个新模型发布都自带一张"跑分表",MMLU 94%、SWE-bench 88.6%、C-Eval 93%……但这些数字到底代表什么?同样的模型为什么在不同榜单上位置不一样?看懂 Benchmark,是选模型的起点。
一、一个经典困境
你刷到一条新闻:
“GLM-5.2 发布,MMLU 达到 94%,超越 GPT-5.6 Sol 了?”
往下翻评论区:
- “才 94%?Claude Fable 5 都 91.5%(MMLU-Pro),凭什么说全面超越?”
- “MMLU 早就饱和了,谁还看这个啊”
- “得看 SWE-bench,GLM 的 SWE-bench Pro 是 62.1%”
- “等等,它家自己发的 94% 是 5-shot CoT 还是 zero-shot?评测设置不一样分数完全不同”
一头雾水。
这不是你的问题——大模型评测本身就是一个已经变得极其复杂的领域。几十个 Benchmark、不同的评测设置、不同的版本(MMLU 还是 MMLU-Pro?)、数据污染问题……如果你是第一次认真看这些数字,看不懂是正常的。
这篇文章的目的就是:把大模型评测这件事彻底讲透。你看完以后,不仅能看懂任何一份模型评测表,还能判断哪些数字值得信、哪些只是营销。
二、Benchmark 到底是什么?
Benchmark = 一套标准化测试题 + 一套评分规则。
它解决的问题很简单:没有统一的考试,你怎么知道 A 模型比 B 模型强?
类比高考:
- 高考分数不能完全代表一个人的能力——但它是大学招生的统一标尺
- 没有高考,每个大学自己面试录取,效率极低且无法横向比较
大模型的 Benchmark 也是同样的角色——它不完美,但没有它,模型的强弱就是各说各话。
一个好的 Benchmark 需要三点
- 区分度:弱模型低分、强模型高分,能拉开差距
- 可复现:同一模型跑同一套题,结果应该差不多(temperature=0 时)
- 抗污染:测试题不应该出现在训练数据里——否则模型不是"会",是"记得"
三、评测维度:大模型的能力可以拆成哪些方向?
一张总览表,对应后面的详细展开:
| 能力维度 | 代表 Benchmark | 测什么 | 饱和了吗? |
|---|---|---|---|
| 知识广度 | MMLU → MMLU-Pro | 57 学科,模型是否"博学" | MMLU 已饱和,MMLU-Pro 仍有区分度 |
| 数学推理 | GSM8K → MATH → AIME | 数学,从算术到竞赛 | GSM8K 已饱和,AIME 仍有挑战 |
| 代码生成 | HumanEval → SWE-bench | 从写函数到修 Bug | SWE-bench 还在拉开差距 |
| 复杂推理 | BBH / GPQA Diamond | 博士级科学推理 | 前沿 60-90%,区分度好 |
| 中文能力 | C-Eval / SuperCLUE | 中国教育体系下的知识 | 榜首 90-94%,有污染问题 |
| 长上下文 | Needle-in-a-Haystack / RULER | 百万 token 中的精准检索 | 大部分模型做得不错,但不完美 |
| 对话体验 | Chatbot Arena | 人类盲评,看谁"更会聊天" | 永远有区分度——用户口味不同 |
| Agent 能力 | SWE-bench / Terminal-Bench | 多步工具调用 | 新兴领域,差距明显 |
四、主流 Benchmark 详解(含题目示例)
4.1 MMLU / MMLU-Pro:知识量的"高考"
MMLU(Massive Multitask Language Understanding)是目前引用最多的大模型知识评测,57 个学科、约 14,000 道选择题,覆盖人文、社科、理工、医学、法律等。
题目长什么样?
学科:大学物理(College Physics)
一个电子在均匀电场 E 中从静止开始加速。经过距离 d 后,它的动能是多少?
A. e E d
B. e E / d
C. e d / E
D. ½ e E d²
学科:美国法律(Jurisprudence)
下列哪个是英美法系中"stare decisis"原则的核心含义?
A. 法官可以自由裁量
B. 上级法院的判决对下级法院有约束力
C. 陪审团决定事实问题
D. 判例法可以随时推翻
从 MMLU 到 MMLU-Pro
MMLU 的 4 选 1 格式对今天的前沿模型来说太容易了——最先进的模型普遍 >90%,1-2 个百分点的差异在统计上不显著。
MMLU-Pro 做了三件事升级:
- 4 选 1 → 10 选 1,猜对概率从 25% 降到 10%
- 增加了更多推理型题目,减少"记忆就能答对"的题
- 去除了质量低的题目,总题量缩减到 12,000+
同样的物理题在 MMLU-Pro 里可能变成:
一个电子在均匀电场 E 中从静止开始加速,经过距离 d 后进入一个垂直于运动方向的匀强磁场 B。求电子在磁场中的回旋半径。
A. mE/(eB²d)
B. √(2mEed)/(eB)
C. √(2mE)/(eB) · √d
D. √(2mE)/(Be)⁰·⁵
E. 2mE/(eBd)
F. eB√(2mEd)
G. √(2mEed)/B
H. m√(E/(eB))·d
I. 以上都不对
J. 条件不足无法计算
难度明显上升——10 个选项里只有 1 个对的,模型必须真正理解物理过程,不能靠排除法。
2026 年前沿数据
| 模型 | MMLU | MMLU-Pro |
|---|---|---|
| Claude Fable 5 | — | 91.5% |
| Claude Opus 4.8 | 92.1% | 89.5% |
| GPT-5.6 Sol | — | — |
| Gemini 3.1 Ultra | 90.4% | 89.8% |
| Qwen3.7 Max | — | 89.6% |
| DeepSeek V4 | 87.2% | — |
| GLM-5.2 | 87.3% | 86% |
4.2 GSM8K / MATH / AIME:数学能力的"三级跳"
大模型的数学评测有清晰的难度阶梯:
GSM8K(小学) → MATH(竞赛预科) → AIME / FrontierMath(天才级)第一级:GSM8K(Grade School Math 8K)
8,500 道小学数学应用题,要求写出推理过程后再给答案。
典型题目:
蛋糕店上午卖出 23 个蛋糕,每个售价 12 元。下午卖出的蛋糕数量是上午的 2 倍,每个售价降价 2 元。问全天总收入是多少?
模型需要输出:上午收入 = 23 × 12 = 276 元;下午数量 = 23 × 2 = 46 个;下午单价 = 12 - 2 = 10 元;下午收入 = 46 × 10 = 460 元;总收入 = 276 + 460 =736 元
这道题对前沿模型已经是送分题了。2026 年,所有主流模型 GSM8K 都 >95%,o3-pro 甚至达到 99.1%。
第二级:MATH(Mathematics Aptitude Test of Heuristics)
12,500 道竞赛级数学题,难度对标美国 AMC(American Mathematics Competitions)。
典型题目:
在等差数列中,第 5 项是 17,第 9 项是 29。求前 12 项的和。
模型需要:设首项 a₁,公差 d。a₅ = a₁ + 4d = 17,a₉ = a₁ + 8d = 29。解得 d = 3,a₁ = 5。前 n 项和公式 S₁₂ = (12/2)(2×5 + 11×3) = 6 × (10 + 33) = 6 × 43 =258
到这里,有些开源模型就开始跟不上了。MATH 的准确率通常在 70-90% 之间。
第三级:AIME(American Invitational Mathematics Examination)
这是真正的天才级。每年 15 道题,考试时间 3 小时,每题答案都是 0-999 的整数。AIME 是选拔美国数学奥赛国家队的前置考试。
典型题目(AIME 2025, Problem 12):
设 f(x) = x³ + 3x² + 3x + 2025。对于实数 t,定义 g(t) 为 f(x) = t 的最小实数根。求所有使 g(t) 为有理数的 t 的值之和。
(提示:f(x) = (x+1)³ + 2024,所以 f(x) 关于 (-1, 2024) 中心对称……)
这道题大部分人类考生也做不出来。前沿模型中,GLM-5.2 在 AIME 2026 上达到 99.2%,o3-pro 也接近这个水平。但这是 Chain-of-Thought + 多数投票 + 大量算力堆出来的——不是一次推理能答对的。
一条有趣的规律
这三个 Benchmarks 的分数随着时间推移呈现出规律性的"阶梯上移":
2023年: GSM8K ~60% → MATH ~30% → AIME 无人问津 2024年: GSM8K ~85% → MATH ~60% → AIME ~10-20% 2025年: GSM8K ~95% → MATH ~85% → AIME ~50-70% 2026年: GSM8K ~99% → MATH ~92% → AIME ~90%+不是大模型突然变聪明了——是 Chain-of-Thought、自洽性采样、搜索型推理等技术的进步。算力换准确率,在数学推理上最明显。
4.3 HumanEval → SWE-bench:代码能力的"技术债"
代码评测经历了类似的"难度升级"过程。
HumanEval:写一个函数
OpenAI 发布的 164 道 Python 编程题。给模型一个函数签名和 docstring,让它补全函数体。
典型题目:
defhas_close_elements(numbers:List[float],threshold:float)->bool:"""检查列表中是否存在任意两个元素的差的绝对值小于 threshold"""
模型写完后,用预置的 test cases 验证。很简单,前沿模型普遍 >90%。
SWE-bench:修一个真实的 Bug
SWE-bench 把难度提升了几个数量级。它不是"写个函数",而是:
- 从真实 Python 开源项目(Django、SymPy、matplotlib 等)中提取 Issue
- 给出完整的仓库代码
- 要求模型定位 Bug、修改代码、让所有测试通过
典型场景(SWE-bench 真实 Issue):
Issue: Django #XXXXX 标题: `QuerySet.exclude()` 与 `Q()` 对象结合使用时, 在特定条件下生成了错误的 SQL 子查询 项目: django/django 涉及文件: django/db/models/query.py, django/db/models/sql/query.py模型需要:
- 理解 Django ORM 的查询构造逻辑
- 定位到生成 SQL 子查询的那段代码
- 理解 exclude() + Q() 的组合语义
- 修改代码
- 验证修改不破坏其他测试
这不是"写代码"——这是真正的软件工程。模型需要理解一个几十万行的大项目,找到问题所在,给出修复方案。
SWE-bench Verified 和 SWE-bench Pro
- SWE-bench Verified:OpenAI 从原始 SWE-bench 中人工验证了一个子集(约 500 题),去掉了有歧义的、太难的和太容易的
- SWE-bench Pro:更新的版本,用新的 Issue,抗数据污染
2026 年 SWE-bench 排名
SWE-bench 目前有两个版本:Verified(约 500 题,人工验证子集)和Pro(更新的、抗污染的版本)。不同模型报告的版本不同,分开列。
| 模型 | SWE-bench Verified | SWE-bench Pro |
|---|---|---|
| Claude Fable 5 | 95.0% | 80.3% |
| Claude Opus 4.8 | 88.6% | 69.2% |
| GPT-5.6 Sol | — | 64.6% |
| DeepSeek V4-Pro | 80.6% | — |
| GLM-5.2 | — | 62.1% |
| Qwen 3.6 Plus | 78.8% | — |
| Llama 4 Maverick | ~65% | — |
注:SWE-bench 分数依赖 Agent 框架(scaffold)选择,同一模型在不同评测框架下结果可能不同。Kimi K3 未公布 SWE-bench 分数,但它的SWE Marathon(类似的多文件修复评测)达到42.0%,领先 Fable 5(35%)和 GPT-5.6 Sol(39%),不过评测方式不同,不可直接对比。
为什么 SWE-bench 对中文开发者特别有冲击力?因为修 Bug 是每个程序员每天在做的事。一个模型如果能在 SWE-bench 上拿到 80%,意味着它理论上能帮团队里中级工程师处理日常 Bug 修复。
4.4 GPQA Diamond:博士级推理
GPQA(Google-Proof QA)由博士级研究者出的题,目标是"谷歌搜不到答案"。
典型题目(领域:物理化学):
在 Born-Oppenheimer 近似下,一个双原子分子的振-转能级可以用以下公式描述:
E(v,J) = ωₑ(v+½) + BₑJ(J+1) - αₑ(v+½)J(J+1)
其中 v 是振动量子数,J 是转动量子数。对于 HCl 分子,ωₑ = 2989.7 cm⁻¹,Bₑ = 10.59 cm⁻¹,αₑ = 0.301 cm⁻¹。
从基态到 v=1, J=0 的跃迁能量最接近:A. 2885.7 cm⁻¹
B. 2989.7 cm⁻¹
C. 3010.6 cm⁻¹
D. 2998.2 cm⁻¹
这道题即使让物理系的研究生来做也不一定秒答。GPQA Diamond 的准确率,前沿模型在 60-91% 之间浮动,区分度依然很好。
| 模型 | GPQA Diamond |
|---|---|
| GPT-5.6 Sol | 94.1% |
| Gemini 3.1 Pro | 94.1% |
| Claude Fable 5 | 93.2% |
| Kimi K3 | 93.5% |
| GLM-5.2 | 91.2% |
| o3-pro | 87.4% |
| Claude Opus 4.8 | ~78% |
GPQA Diamond 上 GPT-5.6 Sol 和 Gemini 3.1 Pro 并列第一(94.1%),Kimi K3(93.5%)和 Fable 5(93.2%)紧追在后。这张表的竞争格局比 MMLU 开放得多——新模型在这个维度上还有很大的突破空间。Claude Opus 4.8 在这个指标上意外偏低(~78%),可能与其推理策略有关,而非能力不足。
4.5 C-Eval / SuperCLUE:中文能力
C-Eval 是中文大模型评测的事实标准,由上海交大、清华、爱丁堡大学联合发布。它覆盖 52 个中文科目,13,948 道 4 选 1 选择题,题目直接来自中国教育体系。
题目长什么样?
学科:大学物理(中文)
一个质量为 m 的质点沿 x 轴运动,势能函数为 V(x) = ½kx²。当质点从 x = A 处由静止释放时,运动到 x = A/2 处的速度大小为:
A. A√(k/m)
B. A√(k/(2m))
C. A√(k)/(2√m)
D. √(3k/(4m)) · A
学科:中国法律基础
根据《中华人民共和国合同法》,下列关于要约和要约邀请的说法,哪一项是正确的?
A. 商业广告均属于要约
B. 价目表寄送属于要约
C. 要约可以随时撤销
D. 要约到达受要约人时生效
学科:中国古代文学
"落霞与孤鹜齐飞,秋水共长天一色"出自哪位作者的哪篇作品?
A. 王勃《滕王阁序》
B. 杜甫《登高》
C. 李白《将进酒》
D. 苏轼《赤壁赋》
这些题不仅考语言能力,更考中文语境下的知识积累。这也是为什么 Qwen、GLM 等国内模型在 C-Eval 上能超越 GPT/Claude——它们在中文本土知识上训练得更多。
2026 年 C-Eval 排名
| 模型 | C-Eval |
|---|---|
| K2.5-1T-A32B(Kimi 前代) | 94.0% |
| Qwen3-Max-Thinking | 93.7% |
| Gemini 3.1 Pro | 93.4% |
| Qwen3.5-397B-A17B | 93.0% |
| Claude Opus 4.8 | 92.2% |
| GPT-5.6 Sol | — |
| Claude Fable 5 | — |
注:Fable 5 和 GPT-5.6 Sol 均未公布 C-Eval 分数,因此不列在表格中。
⚠️ 数据污染问题
C-Eval 最大的问题是数据污染严重。研究表明 C-Eval 的污染率高达约 45%——也就是说,接近一半的测试题在训练数据中出现过。一些模型可能不是"掌握了中国法律",而是"记住了这道选择题的答案"。
这也是为什么看 C-Eval 分数要打折扣:一个 94% 的 C-Eval 和一个 87% 的 MMLU-Pro,前者未必代表更强的中文能力。
4.6 长上下文:Needle-in-a-Haystack / RULER
长上下文评测的核心逻辑很简单:把一条关键信息藏在极长的文本中,问模型关于这条信息的问题。
Needle-in-a-Haystack(大海捞针)
测试步骤:
- 生成一个超长文本(比如 100K tokens),内容可以是 Paul Graham 的散文
- 在某个随机位置插入一句话(“needle”):“中国最深的淡水湖是天池”
- 问模型:“中国最深的淡水湖是什么?”
如果模型能答对,说明它在长上下文中成功检索到了这条信息。
不同模型在不同上下文长度下的表现可以画成一张热力图:
上下文长度 → 模 128K: ████████████████████ 98% 型 64K: ████████████████████ 99% 位 32K: ████████████████████ 100% 置 16K: ████████████████████ 100% ↓ 8K: ████████████████████ 100% 4K: ████████████████████ 100% ← 针在文本中的插入位置 →好的模型是"全红"的(不管针插在哪都能找到),差的模型在长文本+针在中间位置时准确率骤降。
RULER:升级版的"捞针"
RULER 不满足于简单的"找一句话",它测试几种不同的检索场景:
- 单针:和 Needle-in-a-Haystack 一样
- 多针:插 4 条信息,全找出来
- 多针+变量绑定:“Alice 的生日是 3 月 15 日,Bob 的生日是 7 月 22 日。Alice 的生日是几月?”
- 数值推理:“3 月 + 5 月 = 8 月,7 月 + 4 月 = 11 月。9 月 + 6 月 = ?”
后者需要模型在长上下文中既检索又推理,比单纯的"捞针"难得多。
2026 年长上下文现状
- 128K 以内:所有前沿模型表现优秀,>95% 召回率
- 128K - 1M:大部分模型开始出现"中心退化"(文本中间位置的信息更难找到)
- >1M:只有少数模型(GLM-5.2 的 1M context、Gemini 1.5 Pro)声称支持,但实际检索精度还有折扣
关键发现:长上下文支持 ≠ 长上下文好用。上下文越长,检索效率越低,算力成本越高。多数情况下,RAG(检索增强生成)比硬塞 100 万 token 进去更划算。
4.7 Chatbot Arena:人类盲评
前面的所有 Benchmark 都是自动评测——机器出题、机器打分。但大模型最终是给人用的,人觉得好不好这个维度,自动评测很难捕捉。
这就是 Chatbot Arena 存在的意义。
它是怎么工作的?
Step 1: 用户进入聊天界面 Step 2: 用户输入一个 Prompt Step 3: 两个匿名模型(模型 A 和模型 B)同时回答 Step 4: 用户看到两个回答并投票:"哪个更好?" Step 5: 用户不知道自己在测哪个模型为什么要盲评?
自动评测有盲区:
- “写一首关于秋天的诗”——哪首更好?这个没法自动打分
- “给我推荐周末好去处”——推荐的合理性和创意,自动评测难以衡量
- “解释量子计算”——解释得是否通俗易懂?计算机无法评判
Chatbot Arena 用的是 ELO 评分系统,和《英雄联盟》/《棋牌》排位一样的机制:
- 新模型初始 1000 分
- 两个模型对决,赢家从输家那里拿分
- 如果你赢了排名比你高很多的对手,加分多;输给排名低的,扣分也多
- 长期稳定胜率 → 分数收敛到真实水平
为什么 Arena 分数和 Benchmark 分数经常不一致?
| 维度 | 自动 Benchmark | Chatbot Arena |
|---|---|---|
| 评测内容 | 标准化的考题 | 用户自由提问 |
| 评分方式 | 自动比对标准答案 | 人类主观判断 |
| 覆盖范围 | 窄(特定能力) | 广(综合体验) |
| 偏差 | 可能过拟合 | 用户偏好偏差 |
| 时效 | 快(跑完即出分) | 慢(需要大量投票) |
一个模型可能在 MMLU 上 92%,在 Arena 上评分一般——因为它知识广但"不会聊天"。反之亦然,一个"聊天体验很好"的模型可能在 MMLU 上只有 85%。
2026 年 Arena 格局
截至 2026 年中,Arena 前列模型和自动评测排名大体一致但略有差异:
- Claude 系列在对话体验上常年领先
- GPT 系列紧随其后
- DeepSeek 和 Qwen 在特定任务上接近前沿模型
- Arena 也是中文模型的强项——中文用户投票多,中文对话体验好
五、一张大表:2026 年中旗舰模型能力对比
汇总 4.1-4.7 的数据:
| 模型 | 参数量 | MMLU | MMLU-Pro | SWE-bench | GPQA Diamond | C-Eval | 参考价格 ($/M tok) |
|---|---|---|---|---|---|---|---|
| Claude Fable 5 | — | — | 91.5% | 95.0%Ver | 93.2% | — | $10/$50 |
| GPT-5.6 Sol | — | — | — | 64.6% Pro | 94.1% | — | $15/$60 |
| Gemini 3.1 Ultra | — | 90.4% | 89.8% | — | — | 93.4% | — |
| Kimi K3 | 2.8T MoE | ~95%¹ | — | 42.0%² | 93.5% | — | 开源 |
| DeepSeek V4-Pro | ~685B MoE | 87.2% | — | 80.6%Ver | — | — | $0.87 |
| GLM-5.2 | 744B MoE | 87.3% | 86% | 62.1% Pro | 91.2% | ~92% | $1.40 |
| Qwen3.5-397B-A17B | 397B MoE | — | 87.8% | 59.9%³ | — | 93.0% | — |
| Llama 4 Maverick | 400B MoE | 84.7% | — | ~65% Ver | — | — | 开源 |
¹ Kimi K3 的 MMLU 95% 来自部分来源报告,非官方正式公布,需谨慎参考。
² Kimi K3 的 SWE Marathon 42% 与标准 SWE-bench 评测方式不同,不可直接横向对比。
³ Qwen3.5-397B-A17B 的分数来自 SWE-rebench,非标准 SWE-bench Verified。
Ver = SWE-bench Verified | Pro = SWE-bench Pro(更难的版本)
几个关键观察:
- SWE-bench 是目前最能拉开差距的单一 Benchmark——Fable 5(95%)到 Llama 4(65%),差距 30 个点
- GPQA Diamond 上 GPT-5.6 Sol、Gemini 3.1 Pro、Kimi K3 三家几乎打平——都在 93-94% 区间
- DeepSeek V4-Pro 是性价比之王——$0.87/M tok 实现 80.6% SWE-bench,比闭源模型便宜 30-60 倍
- Kimi K3 作为开源模型,在 GPQA 上达到 93.5%——仅次于 GPT-5.6 Sol,超过 Fable 5
- Claude Fable 5 在代码能力上断层领先——SWE-bench Pro 80.3%,比 GPT-5.6 Sol 的 64.6% 高 16 个点
- 中文能力方面——Gemini 3.1 Ultra(93.4%)、GLM-5.2(~92%)、Qwen3.5(93%)在 C-Eval 上领先
六、去哪里查最新评测数据?
看完上面的分析,你可能会想:这些数据从哪来的?如果我几个月后再看这篇文章,数据已经过时了怎么办?
别担心——Benchmark 数据是实时更新的,有几个好用的站点你可以直接收藏。
6.1 综合排行榜网站
| 站点 | 地址 | 特点 |
|---|---|---|
| LLM Stats | llm-stats.com | 300+ 模型,按综合评分/价格/速度/上下文长度多维度排序,每个模型有完整的 Benchmark 雷达图 |
| Artificial Analysis | artificialanalysis.ai | 智能指数(Intelligence Index)汇总 10 项评测,散点图(智能 vs 价格/速度)最直观 |
| DataLearnerAI | datalearner.com/leaderboards | 国内平台,支持选 4 个模型横向对比,国产模型维度最全,含 C-Eval/AGI Eval 等中文评测 |
| Chatbot Arena | lmarena.ai | ELO 排位,人类盲评,唯一反映"真实对话体验"的排名 |
6.2 分类专项排行榜
| 专项 | 站点 | 说明 |
|---|---|---|
| SWE-bench | swebench.com | 代码修复能力的官方排行榜,Verified 和 Pro 两个版本 |
| MMLU-Pro | llm-stats.com/benchmarks/mmlu-pro | MMLU-Pro 专项,129 个模型的排名 |
| Open LLM Leaderboard | huggingface.co/spaces/open-llm-leaderboard | Hugging Face 的开源模型排行榜,只列开源权重 |
| Aider Leaderboard | aider.chat/docs/leaderboards | 代码编辑专项,测的是"在已有代码上修改"的能力 |
| LiveCodeBench | livecodebench.github.io | 编程竞赛题,实时更新抗污染 |
6.3 GitHub 上的可视化项目
如果你想直接看图表而不是翻表格,这两个开源项目把数据直接画出来了:
- ai-race:追踪 OpenAI、Anthropic、Google、xAI、国内五家实验室的模型在 10+ 个 Benchmark 上的表现,有跨时间折线图,可以看到每个模型的能力演进轨迹
- ai-benchmark-arena:纯前端交互面板,120+ 模型、11 个 Benchmark、6 种图表类型(柱状图、水平条形图、雷达图、散点图、气泡图、热力图)。支持搜索、筛选、导出 CSV,直接部署到 GitHub Pages
6.4 怎么看这些网站?
实践建议:
- 快速看排名→ LLM Stats 的综合评分排序
- 对比 2-4 个模型→ DataLearnerAI 的对比模式或 Artificial Analysis 的散点图
- 按场景选模型→ 写代码看 SWE-bench,数学看 AIME,中文看 C-Eval
- 看趋势→ AI Race 的折线图,看某个模型在过去几个月的能力变化
- 做决策前→ 不要只看一个网站,交叉验证 2-3 个来源
七、评测的"脏套路":看懂分数再信它
7.1 数据污染——最大的隐患
MMLU 的测试集是否出现在训练数据中?答案是:经常是。
大模型的训练数据来自互联网,而很多 Benchmark 的测试集也在互联网上公开。模型训练的时候"看过"这些题,测试的时候就变成了"回忆"而非"推理"。
- C-Eval 污染率估计约 45%
- MMLU 也被污染,虽然程度不同
- SWE-bench Pro 通过不断更新 Issue 来抗污染——但治标不治本
最激进的做法:一些评测方(如 Anthropic)已经不再公开新的测试集,而是使用"动态生成"的方式,每次测试生成不同的题目。
7.2 评测设置不同,结果差 10 个点
同一个模型,不同的评测设置,可以得出截然不同的分数:
模型 X 的 MMLU 分数: zero-shot, direct answer: 84.2% 5-shot, direct answer: 87.1% 5-shot, CoT: 89.5% 5-shot, CoT + 多数投票×10: 91.3%所以当你看到"MMLU: 94%"时,必须问:是 5-shot 还是 zero-shot?有没有用 CoT?有没有多数投票?评测设置可能比模型能力本身对分数的影响更大。
7.3 MMLU 饱和 → 业界往哪走?
Benchmark 的发展是一个永无止境的"军备竞赛":
MMLU (已饱和) → MMLU-Pro (正在饱和) → GPQA Diamond / HLE GSM8K (已饱和) → MATH (接近饱和) → AIME / FrontierMath HumanEval (已饱和) → SWE-bench (进行中) → SWE-bench Pro Needle-in-a-Haystack → RULER / L-Eval每当一个 Benchmark 的分数接近 95%,它就失去了区分度,业界就会开发一个新的、更难的 Benchmark。
7.4 分数≠能力:统计显著性
MMLU 的随机方差是多少?大约 ±1.2%。
这意味着:
- 模型 A 92.1% vs 模型 B 91.8% →无法判定谁更强(差距在噪声范围内)
- 模型 A 92.1% vs 模型 C 89.5% →能判定 A > C
只看分数不看置信区间 = 只看标题只看正文。
八、怎么看懂 / 怎么用 Benchmark?
场景化选型指南
| 你的场景 | 最该关注哪个 Benchmark |
|---|---|
| 代码补全 / 代码审查 | SWE-bench Verified / Pro |
| 智能客服 / 知识问答 | MMLU-Pro / C-Eval |
| 数学解题 | AIME / MATH |
| 长文档分析 | RULER / Needle-in-a-Haystack |
| 通用对话 | Chatbot Arena |
| 中文场景优先 | C-Eval + Arena 中文分榜 |
| 安全 / 合规 | TruthfulQA + 红队报告 |
| 性价比导向 | DeepSeek V4-Pro 的 SWE-bench/价格比 |
选模型的三步法
Step 1: 确定你的核心场景(写代码?问答?) Step 2: 找到对应场景的核心 Benchmark Step 3: 在 Benchmark 分数接近的模型中,优先选更便宜 / 更快 / 更容易部署的最后一条建议:在自己业务上跑一遍,比看任何排行榜都准。
排行榜告诉你的是"这个模型在标准化考试中的表现"。但你的业务场景很可能不在这些 Benchmark 的覆盖范围内——只有你自己跑过的测试,才能真正回答"这个模型适合你的任务吗"。
九、总结
Benchmark 是标尺,不是判决。它告诉你模型在特定维度的相对位置,不告诉你模型"好不好"。
最后一轮复习
- 看懂分数前先看设置——5-shot 还是 zero-shot?CoT 还是 direct?设置比分数重要
- 要对比就比同一 Benchmark 的同一版——MMLU 和 MMLU-Pro 是两个不同的考试
- 对高分保持警惕——如果一个 Benchmark 的前沿模型平均 >90%,它已经接近失效
- 中文评测有数据污染问题——C-Eval 高分要打折看
- 代码能力是 2026 年最重要的区分维度——SWE-bench 是目前最能拉开差距的单一 Benchmark
- 性价比也是一种能力——DeepSeek V4-Pro 以闭源 1/30 的价格做到 80+% SWE-bench
- 最终相信自己的测试——排行榜是参考,你自己的场景才是真理
这个专栏专注于 LLM 推理与部署的底层技术——从算子开发、显存管理、调度策略到生成优化,用可运行的代码和可复现的实验,把论文里的"黑科技"变成可以理解、可以动手验证的知识。如果你对"GPU 到底在干什么"和"推理框架做了什么优化"这类问题感兴趣,欢迎来主页翻翻其他文章。