一句话讲清楚👉🏻Agent 评测动辄上千美元、还要搭沙箱等好几天;卡内基梅隆大学团队的 PACE 从 19 个便宜原子评测里自动挑出 100 道题,花不到完整 Agent 评测 1% 的成本,就能预测 GAIA 、 SWE-Bench 等四项基准的模型得分——留一交叉验证平均误差 3.80%,两两排序准确率约 84%。
- 论文标题:PACE: A Proxy for Agentic Capability Evaluation
- 论文链接:https://arxiv.org/abs/2607.02032
- Github 链接:https://github.com/neulab/pace
- 数据集链接:https://huggingface.co/datasets/neulab/pace-bench
你现在要判断一个新模型能不能上 SWE-Bench ,得先搭沙箱、拉仓库、跑多轮工具调用、改代码、等测试——单模型单次完整评测,论文估算动辄上千美元,还要等上好几天。 GAIA 要开浏览器检索, SWT-Bench 要写能暴露 bug 的测试用例,每条轨迹都长,环境一换结果还可能飘。
贵还不是唯一的问题。评测贵 → 团队跑不起完整基准 → 只能挑子集、降频率、或者干脆不测。最后 leaderboard 上那串数字,背后是多少资源在撑,大家心里都有数。
与此同时, MMLU 、 HumanEval 、 IFEval 这些原子评测一次 API 调用就能打分,几分钱一道题,开发迭代天天都在跑。 Agent 任务再复杂,底层也离不开指令遵循、规划、写代码、工具调用——能不能用一小撮原子题,在花大钱跑 Agent 之前,先把方向和排序摸清楚?
PACE 的回答是:能。而且整套代理评测花费不到完整 Agent 评测的1%。
贵在哪: Agent 评测和原子评测差了两个数量级
论文把模型能力拆成 11 类,对照了 4 个 Agent 基准和 19 个非 Agent 基准。 Table 1 把能力覆盖、搭建复杂度、题量和单题成本放在一张表里——差距一眼能看清:
Table 1 : Agent 与非 Agent 基准对照。 Setup 栏 H=高复杂度环境, L=仅需 API 调用; Cost 为 Claude Sonnet 4.5 单题评测成本估算。
读这张表,三个信号很直观:
1.四项 Agent 基准 Setup 全是 H(红标),要搭沙箱、浏览器或完整仓库; 19 个原子基准绝大多数是 L (绿标),调 API 就能跑。
2.单题成本差两个数量级: SWE-Bench Multimodal 约 1.89 美元/题, GAIA 约 0.38 美元/题; IFEval 约 0.006 美元/题, HumanEval 约 0.004 美元/题。
3.能力有重叠: SWE-Bench 需要的规划、代码生成、验证测试,在 HumanEval 、 DebugBench 等便宜基准里都有对应列——Agent 评测贵,但底层能力信号其实已经被原子题测到了。
Agent 单题贵两个数量级,一套完整评测下来就是「小时级搭环境 + 数百次 API 调用」。论文的判断是:严格 Agent 评测正在变成大团队的特权——资源少的组天然吃亏。
PACE 想解决的就是这个:在真正开跑完整 Agent 评测之前,用极低成本拿到可靠的分数估计和模型排序。
PACE 怎么做: 100 道原子题 + 线性回归
PACE 从 19 个非 Agent 基准(覆盖 11 类能力)里自动选出 道题,用它们的得分预测目标 Agent 基准上的表现。两个目标:
目标 A (绝对分数):,预测模型 在 Agent 基准上的平均分。
目标 B (两两排序):用得分差 做逻辑回归,预测谁更强——工程上往往比精确分数更有用:「 A 和 B 该选谁做路由?」
选题和回归解耦。论文试过 Lasso/Ridge 直接在上万道题里选,但标定模型只有 13 个,严重欠定。 PACE 改用两条互补的过滤线各选一半:
PACE 总览: Local 按目标相关性选题, Global 按 SVD 杠杆分数选题,再经 Bootstrap 回归预测 Agent 分数和模型排序。
■Local:按每道题得分与 Agent 总分的 Spearman 相关 排序,选最「像」目标基准的题。
■Global:在源题矩阵上做 SVD ,用杠杆分数 乘 ,选全局信息量高且和目标相关的题。
■Bootstrap: Agent 标签噪声大,对目标实例重采样再拟合回归,平均 MAE 能降 0.77 个百分点。
主结果:预测够准,成本够低
14 个模型、严格留一交叉验证(每次留一个「未来模型」), 时:
Table 2 : PACE 在 C=100 时的 LOOCV 结果。平均 MAE 3.80%, Spearman 0.81 ,两两排序准确率 84.37%。
■平均 MAE 3.80%, Spearman0.81——100 道原子题就能逼近 Agent 绝对分和排序。
■两两排序准确率 84.37%,随机基线 50%。筛 checkpoint 、比两个微调版本,这个精度够用。
■比直接在源题矩阵上跑 Lasso/Ridge ( MAE ~6%、 Spearman ~0.55 )稳得多。
核心卖点:同等质量,成本约 1/100
Figure 1 把 PACE (蓝线)和「在 Agent 基准上随机抽子集」(红线)放在同一张成本-质量图里:
成本-质量权衡:横轴是评测花费(美元),纵轴分别是 MAE 、 Spearman 、排序准确率。 PACE 在饱和预算以下全线优于随机抽 Agent 子集。
论文结论很直白:要达到和随机抽 Agent 子集相同的预测质量, PACE 大约只要1/100 的成本。换算到工程场景:
■完整 Agent 评测:上千美元 + 数天
■PACE 代理评测:几分钟跑静态题,不到 1% 花费
附录里 从 25 扫到 500 , 是性价比甜点——再往上边际收益很小。对大多数开发阶段, 100 道题够做决策了。
顺带看清:每个 Agent 基准要什么能力
PACE 不只能省钱,选出来的 100 道题还是一张「能力指纹」:
Figure 3 : C=100 时四项 Agent 目标的能力需求分布。指令遵循和推理四项都拉满,其余因目标而异。
■GAIA:指令遵循 + 验证测试( IFEval 、 PlanBench 为主)
■SWE-Bench Verified:规划、代码生成、验证、错误恢复
■SWE-Bench Multimodal:长上下文聚合最重,多模态反而占比不高
■SWT-Bench:验证测试 + 规划几乎拉满
边界:代理不是替代,是筛子
PACE 有两个前提要心里有数:
1.标定模型得代表未来模型——新架构、新训练范式超出标定分布,误差会上去,得定期刷新标定集。
2.预测的是特定 harness 下的分数——论文用 OpenHands SDK ,换工具定义或重试策略,排序可能漂移。
即便如此, PACE 的定位很清楚:完整 Agent 评测该跑还得跑,但在花几千刀之前,先用不到 1% 的成本把方向和排序摸清楚——筛 checkpoint 、比版本、决定值不值得上完整 SWE-Bench 。对资源有限的团队,这比硬刷 leaderboard 务实得多。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~