10B激活参数如何撑起智能体模型?——MiniMax-M2 Series技术报告精读
原论文:The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence
作者:MiniMax(完整贡献者名单见原论文附录)
版本:arXiv:2605.26494v2,2026年7月30日
原文:https://arxiv.org/abs/2605.26494
30秒看懂这篇论文
- 研究问题:怎样让每个token只激活约100亿参数的稀疏模型,完成需要数十到数百轮工具调用的编码、搜索和办公任务?
- 技术路线:229.9B总参数、9.8B激活参数的MoE基础模型,加上可执行环境中的智能体数据、Forge强化学习系统、交错思考与自我迭代工作流。
- 核心结果:M2.7在多项智能体基准上接近闭源前沿模型,并较M2、M2.5持续提升;但它并非多数榜单的第一名。
- 最值得看:报告把数据构造、奖励设计和长轨迹训练基础设施讲得比一般模型卡更细。
- 最大局限:大量数据、算力和内部基准未完全公开,跨模型脚手架并不总是一致,“自我进化”也仍处在人类设目标和审查的边界内。
1. 这不是单纯的“更小模型”故事
报告的口号是“mini activations, max real-world intelligence”。这里的“mini”不是模型只有98亿参数,而是每个token只激活约98亿参数;模型总容量仍有2299亿参数。这个区别很重要:MoE把容量与单步计算量部分解耦,却不会自动把显存、通信、路由、缓存和部署成本都缩小到同样比例。
M2系列真正想回答的是:当大模型从一次性问答进入长时智能体任务,性能瓶颈是否已经从“参数量不够”转向“缺少可验证轨迹、稳定的长程信用分配,以及能承载不规则任务时长的训练系统”?报告把答案组织成四层:基础架构、数据流水线、Forge强化学习基础设施和M2.7的自我迭代。
来源:原论文 Figure 1,PDF第1页;由原PDF页面忠实裁剪,论文标识 arXiv:2605.26494v2。图中可见M2.7在若干任务上有竞争力,但SWE-bench Pro、MLE-Bench lite、GDPval-AA等并非最高。
2. 基础模型:稀疏容量、全注意力与MTP
M2是62层decoder-only Transformer,hidden size为3072,词表大小200,064,最长上下文192K。每层MoE含256个细粒度专家,每个token激活8个专家;路由使用sigmoid gating和可学习的expert bias。注意力采用48个query head与8个key-value head的GQA,并在所有层保留full attention。
报告给出的预训练总量是29.2T tokens:constant phase约19.9T,decay phase约9.3T;上下文从8K逐级扩展到32K和192K。遗憾的是,数据来源比例、去重细节、训练集污染检查、优化器参数、总训练FLOPs和硬件规模没有达到可独立复现的程度。
作者专门比较了full attention与hybrid sliding-window attention。小于32K的一些任务差异有限,SWA甚至偶有优势;但在128K检索和上下文翻译上差距明显,例如RULER 128K CWE从90降到72、MTOB K-e BLEURT从60降到45。因此M2选择了更昂贵、但在其生产评测中更稳妥的全注意力。这个结论依赖特定训练配方,不能外推为“稀疏注意力必然无效”。
来源:原论文 Figure 2,PDF第7页;由原PDF页面忠实裁剪,arXiv:2605.26494v2。
Multi-Token Prediction(MTP)同时承担训练辅助目标和推理时草稿模型。预训练初期使用一个MTP模块,后续通过权重复制扩展为三个;推理时三个模块先提出候选token,再由主模型一次前向验证。小规模消融中,MTP对MATH与HumanEval有提升,但并非所有指标都单调改善;真正明显的提升更多来自细粒度专家设计。因此,MTP更像“质量与推理吞吐的联合设计”,而不是单独解释M2.7成绩的万能组件。
3. 数据:把智能体轨迹变成可验证训练样本
报告最有工程价值的部分是数据流水线。它没有只说“使用高质量合成数据”,而是把任务环境、奖励和验收对象绑定起来。
来源:原论文 Figure 3,PDF第8页;由原PDF页面忠实裁剪,arXiv:2605.26494v2。
SWE流水线从GitHub PR与commit出发,筛选已合并且带测试的变更,再让agent构造可运行Docker环境。不同PR按bug fix、feature addition、performance optimization等类型路由,分别提取Fail-to-Pass、Pass-to-Pass或性能测试。随后还会做任务描述与测试的一致性检查,并通过注入bug、合并commit、转换为SWE-Test等方式扩增难度。
AppDev没有天然的gold patch,因而走另一条路:领域专家提供meta query和技术栈约束,模型采样开发轨迹,再由Agent-as-a-Verifier把应用部署到沙箱中,依次检查能否运行、交互功能是否正确、视觉质量是否达标。这里的关键思想是“artifact-aligned reward”:代码任务看测试,表格任务重算单元格,研究任务查证据,演示文稿既检查执行与结构,也看最终渲染。
同一原则被扩展到Terminal-Gym、深度搜索、知识工作、财务分析、电子表格和幻灯片生成。优点是奖励比单一LLM judge更接近真实产物;风险是验证器本身可能成为新的偏差来源。模型可能学会适应测试、rubric或代理验证器,而不是获得更广义的可靠性。
4. Forge:长轨迹强化学习首先是系统问题
智能体轨迹可能短至数秒,也可能长达数小时、占用192K上下文。若严格FIFO,最慢任务会阻塞整个批次;若谁先完成就先训练,短而简单的任务会被过度采样。Forge试图同时处理吞吐、训练稳定性和不同agent scaffold的兼容性。
来源:原论文 Figure 4,PDF第20页;由原PDF页面忠实裁剪,arXiv:2605.26494v2。
Forge将Agent Side、Gateway/Data Pool中间层、Rollout Engine和Train Engine解耦。白盒agent可以暴露上下文管理;黑盒agent只需把每次LLM调用呈现的状态、动作和观察交给网关。这样训练系统既可接入内部agent,也能接入API形式的外部agent,而不读取其内部实现。
算法层面,报告采用CISPO(Clipped Importance Sampling Policy Optimization),把每次LLM completion视为动作单元,但在完整episode上计算信用。奖励由任务结果、过程信号和完成时间组成;速度奖励鼓励并行工具调用,process reward惩罚格式错误或低质量中间步骤。训练数据在reasoning、coding、agent和general四域混合,避免连续单域训练造成遗忘或负迁移。
来源:原论文 Figure 5,PDF第22页;由原PDF页面忠实裁剪,arXiv:2605.26494v2。
Windowed FIFO只允许从队首窗口内抽取已完成轨迹,窗口内可乱序,跨窗口仍保持FIFO。文中实践值为窗口约占队列的0.3。它是一种清晰的工程折中:比严格FIFO少空等,又比全局greedy更能保持数据分布。然而报告没有给出完整吞吐-偏差曲线,0.3并不是可直接迁移到其他集群的通用常数。
来源:原论文 Figure 6,PDF第23页;由原PDF页面忠实裁剪,arXiv:2605.26494v2。
Prefix tree merging把共享长前缀的多个completion合成一棵计算树,公共上下文只做一次前向,分支再独立计算loss。作者声称在特定场景可获得最高40倍训练加速并降低显存,但未给出足够的任务分布、硬件和基线细节,因此应把“40×”理解为系统上限案例,而非M2训练全程的平均加速。
5. 交错思考:为什么工具调用之间要保留推理状态
来源:原论文 Figure 7,PDF第25页;由原PDF页面忠实裁剪,arXiv:2605.26494v2。
M2采用interleaved thinking:推理、工具调用、观察结果再推理,全部留在同一条轨迹中。与“先一次性想完再行动”相比,它能根据工具反馈修正计划;与每轮丢弃旧思考相比,它不用反复重建假设。作者称去掉历史thinking block会让深度搜索和软件工程任务明显下降,但报告没有给出这项消融的完整数表与置信区间。更谨慎的结论是:在其训练与脚手架下,保留推理状态与长程任务表现相关,并符合机制直觉。
6. 自我迭代:自动化研究助手,不是脱离人类的自举
来源:原论文 Figure 8,PDF第26页;由原PDF页面忠实裁剪,arXiv:2605.26494v2。
Model Iteration System中,人类负责配置harness、设定目标、通过对话引导并在关键节点review;agent读取日志、诊断异常、修改代码和配置、生成报告,并在边界内自动继续。论文称它承担RL团队日常30%到50%的迭代工作,还完成过100轮自主改进,使内部评测提升30%。这些数字有启发性,但缺少公开任务、对照组和失败记录,不能据此宣称模型已经能自主完成模型研发。
来源:原论文 Figure 9,PDF第29页;由原PDF页面忠实裁剪,arXiv:2605.26494v2。
Figure 9显示M2到M2.5再到M2.7在11项可比基准上都提高,增幅尤其集中在BrowseComp、Toolathlon、GDPval-AA和MLE Bench Lite等新数据流水线覆盖的领域。这支持“后训练系统持续改善产品能力”的叙事,却不能隔离究竟是数据规模、数据质量、RL算法、基础模型继续训练还是脚手架变化造成了提升。
来源:原论文 Figure 10,PDF第30页;由原PDF页面忠实裁剪,arXiv:2605.26494v2。
MLE Bench Lite包含22场机器学习竞赛,每次试验给agent 24小时,运行于单张A30沙箱;报告三次独立试验的平均奖牌率为66.6%,最佳一次获得9金、5银、1铜。曲线说明迭代过程中最佳验证结果逐步改善,也显示“真实/CV选择”的奖牌率低于按内部验证挑选的上限,提示模型选择仍会过拟合。三次试验足以作为案例,却不足以给出稳定方差估计,更不能覆盖真实ML工程的部署、安全和维护要求。
7. 成绩应该怎样读
M2.7的定位更接近“以较低激活量换取前沿附近表现”,而不是全面SOTA。例如SWE-bench Pro为56.2,低于GPT 5.4的57.7;Terminal-Bench 2.0为57.0,明显低于GPT 5.4的75.1;BrowseComp为77.8,低于Gemini 3.1 Pro的85.9;GDPval-AA为50.0,低于GPT 5.4的58.0。另一方面,Multi-SWE-bench的52.7、VIBE-Pro的55.6和AIME 2026的94.2确实处在前沿区间。
比较还存在三类混杂。第一,部分基准是内部的VIBE-Pro、HyperTask、RISE、MM Claw和Finance Modeling Pro,外部尚难复核。第二,编码基准中多数模型使用Claude Code统一脚手架,但GPT 5.4使用原生Codex scaffold,并非严格同构。第三,报告倾向长程、环境可验证任务,这与M2的数据和系统设计高度匹配;这是合理的产品定位,却不等于覆盖所有语言模型能力。
8. 贡献、局限与复现判断
我认为这份报告有三点实质贡献。其一,它把智能体后训练的数据单位从“问答对”提升为“环境、轨迹、产物、验证器”的组合。其二,它正面处理了长轨迹RL的调度、共享前缀计算和黑白盒agent兼容问题。其三,它把交错思考和自我迭代放入同一套训练-部署闭环,而不是只展示单轮推理分数。
局限也同样明显:预训练语料与许可信息不透明;没有总训练算力、能耗和成本;许多关键数字来自内部基准;消融无法隔离四层系统的独立贡献;安全、网络攻击、奖励黑客、工具权限和失控迭代缺少系统评测;报告由模型开发方撰写,尚非独立同行评审证据。229.9B总参数下的部署内存、专家并行通信与KV cache成本,也不能被“9.8B激活”一句话抹平。
复现层面,可复现的是设计原则:可执行任务、产物对齐奖励、混合域RL、窗口FIFO和共享前缀合并。不可复现的是同等规模结果,因为数据、训练代码、Forge实现、内部评测和算力配置均不完整。工程团队更适合先复现一个窄域闭环,而不是直接复制整个M2系统。
9. 给研究与工程实践的启发
如果要把这份报告转化为自己的项目,我会优先做四件事:先为任务定义可执行验收标准;把失败轨迹连同环境快照保留下来;区分模型策略、agent scaffold与验证器的贡献;最后才扩展RL规模。对多数团队而言,提升验证器质量和环境可重复性,可能比盲目增加参数更划算。
M2系列最值得借鉴的不是某个榜单数字,而是它对“智能体能力从哪里来”的回答:容量给出上限,数据提供任务分布,奖励决定模型追求什么,基础设施决定这些信号能否在长轨迹上稳定放大。这个闭环如果缺一环,所谓自我进化就很容易退化为对内部测试的自动化调参。
总结
MiniMax-M2 Series是一份信息密度较高的工业技术报告。它展示了一个约98亿激活参数的MoE模型,如何依靠29.2T token预训练、可验证智能体数据、Forge长程RL、交错思考和受人监督的自我迭代,在多类真实任务基准上进入前沿区间。报告最强的是系统设计与工程经验,最弱的是独立验证和完整复现条件。读者可以相信“这套方法形成了有竞争力的闭环”,但暂时不应把“激活参数少”“自我进化”或个别内部指标直接等同于低成本、通用性或自主科研能力。
参考资料与图片来源
- MiniMax.The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence. arXiv:2605.26494v2, 2026.
- 本文全部图片均来自上述论文Figure 1-10,由本地原始PDF页面忠实裁剪;未生成、重绘、增强或添加标注。