析取与补偿型任务下的多智能体规模扩展规律
arXiv编号:arXiv:2609.31563v1
摘要
人们通常预期大语言模型多智能体系统会随着团队规模增大而性能提升,但实际扩展行为高度依赖任务本身的结构。本文核心贡献是引入Steiner群体任务分类学作为分析LLM多智能体规模扩展的理论框架,重点研究析取任务(Disjunctive)与补偿型任务(Compensatory)。本文假设:给定测试样本,独立采样得到的智能体输出为条件独立;由此推导出大团队理论极限:多数投票会收敛至模型的众数答案;取平均则收敛到模型在该样本上的固有偏置。
在代表性基准、13个开源权重模型、最大30智能体规模的实验条件下,观察到性质截然不同的缩放行为。在析取任务上,至少一个智能体答对的概率随团队规模提升5‑20个百分点;但直接对智能体原始输出做多数投票,几乎无法发挥该潜力,预测值与实测平均仅相差0.5个点。多轮修订可以显著提升准确率,但仅增加1个同伴与增加29个同伴带来的收益几乎相同。与之对比,费米估算这类天然适合聚合的补偿型任务,规模扩展收益十分有限:样本层面的固有偏置贡献约87%平方误差,因此取平均仅能降低约6%误差。混合不同模型家族在费米估算任务上有收益,但在析取任务上,混合团队性能无法超过集合内最强单体模型。实验表明:任务结构、成员输出聚合机制,是决定多智能体团队扩展能力的根本因素。【代码仓库占位:原文开放代码待发布】
关键词
多智能体;规模扩展;Steiner任务分类学;析取任务;补偿型任务;多数投票;费米估算;条件独立;集成学习
目录
- 引言
- 理论分类与规模扩展框架
- 2.1 Steiner任务分类学与LLM基准映射
- 2.2 析取任务:投票机制建模
- 2.3 补偿型任务:几何聚合建模
- 2.4 有效团队容量与不同任务的缩放极限
- 析取/补偿任务的实证评测
- 3.1 实验设置
- 3.2 两类任务实证缩放动力学
- 3.3 析取任务性能天花板内在机制
- 3.4 补偿任务天花板内在机制
- 讨论
- 结论
- 参考文献
- 附录A‑F
1 引言
随着大模型多智能体框架快速发展,大量研究开展集成、多智能体辩论实验,普遍隐含一个假设:增大智能体团队规模N NN,系统性能会单调提升。
认知科学、社会心理学早已研究群体是否优于个体的现象:Galton牛体重估测实验,群体中位数估算结果非常接近真值;而Ringelmann效应揭示另一种现象:随着群体规模变大,个体产出收益递减。
Ivan Steiner经典群体任务分类学指出:群体最终表现是“群体智慧”还是“过程损失”,由任务底层结构决定。
- 补偿型任务:群体结果由个体连续估计做统计聚合;人类个体具备独特认知偏差与独立启发式噪声,随机误差互相抵消。
- 可加、合取任务:容易出现搭便车、协调瓶颈。
近期LLM相关工作也观察到:大模型智能体团队性能具备任务依赖性;同模型内部多次采样输出存在强相关性,限制集成收益。
本文研究问题:不同任务结构下,多智能体团队规模扩展的理论边界与实证表现。
本文主要贡献
- 将主流LLM评测基准映射到Steiner群体任务分类学;数学形式化析取、补偿任务下智能体行为,推导条件独立假设下大团队极限。
- 使用13个开源权重模型,团队规模最大至30个智能体开展大规模实验;分析输出独立性与多样性假设;析取任务中pass@N随团队规模稳步上涨,但多数投票收敛到模型众数答案;多轮修订带来大幅增益,但收益几乎与团队大小无关。
- 补偿型费米估算任务上,样本固有偏置贡献约87%平方对数误差;取平均仅降低约6%误差;部分跨模型相关性来自基准本身不合理参考标签。
- 异构模型团队:补偿任务可获得显著收益;但析取任务中异构团队性能无法超过团队内最强单个模型。
2 理论分类与规模扩展框架
2.1 Steiner任务分类学与LLM基准映射
分类重点:聚合规则,并非基准数据集本身固有属性。本文聚焦析取、补偿两类任务。
| 任务类型 | 聚合规则 | 典型LLM基准 | 聚合方式 |
|---|---|---|---|
| 析取任务 | Y = max ( y i ) Y=\max(y_i)Y=max(yi)/多数投票 /辩论 /验证器重排序 | GSM8K、MATH‑500、MMLU‑Hard、ARC‑Challenge、代码生成 | 投票、验证器筛选、辩论 |
| 补偿型任务 | 连续值统计聚合(算术/几何均值、中位数) | RealFP费米估算、预测估算类任务 | 几何平均、中位数 |
析取任务:团队成功至少需要一名智能体产出正确解,并且团队能够识别该正确解。
补偿型任务:输出为连续数值,依靠多个个体估计做统计聚合抵消随机噪声。
2.2 析取任务:投票机制建模
纯析取理想场景
单个智能体独立答对概率p pp;存在神谕验证器时,团队成功概率:
P d i s j ( N ) = 1 − ( 1 − p ) N P_{disj}(N)=1-(1-p)^NPdisj(N)=1−(1−p)N
团队失败概率随N NN指数衰减;pass@N定义:至少一个智能体答对的样本占比。
多数投票与Condorcet陪审团定理
二元选择场景,每个智能体独立投票,个体正确率KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲p>0.5\),多数投票出错概率上界由Hoeffding不等式给出:
P ( y ^ m a j ≠ y ∗ ) ≤ exp ( − 2 n ( p − 1 / 2 ) 2 ) P\left(\hat{y}_{maj} \neq y^{*}\right) \leq \exp\left(-2n(p-1/2)^2\right)P(y^maj