501B 总参 / 23B 激活:Reflection Beam 把开源模型的军备竞赛推到了 RL 算力这一层
2026 年 10 月 5 日,Reflection AI 发布了 Beam —— 他们的第一个开放权重模型。
但有意思的是:权重还没放出来。官方说技术报告、model card、开发者产物要"本月晚些时候"才发。
也就是说,我们现在能看到的是一份把训练工程写得非常细的公告,而不是一个可以下载的模型。
这篇文章就把这份公告里的工程细节拆开讲。
一、它到底是个什么模型
Beam 是一个**稀疏 MoE(Mixture-of-Experts)**模型:
- 总参数 501B
- 激活参数 23B
- 官方给的定位是三类负载:coding、reasoning、agentic
23B 激活 / 501B 总参,意味着它走的是"大容量、稀疏调用"的路线 —— 每个 token 只走一小部分专家。这也是它后面敢谈"推理效率"的前提:推理成本看激活参数,不看总参数。
预训练用了23.8 万亿 token,来源是网页数据加上授权(licensed)的私有数据集。
二、真正的主角是 RL,不是预训练
这篇公告里最有信息量的部分,是它把RL(强化学习)的规模写得很具体:
| 项 | 数字 |
|---|---|
| GPU | 10.5K 张 NVIDIA GB300 |
| 训练时长 | 4 周 |
| 生成的 rollout | 超过 1 亿个 |
| 最大上下文 | 256K token |
| 训练与评分用的 sandbox | 约 13 亿个 |
| 为此采购的环境 | 100 万个(coding / agentic / STEM) |
官方自己的评价是:这可能是"目前任何开源实验室做过的最大规模 RL 训练之一"。
而且他们给了一个趋势判断 ——能力随 RL 算力持续上升,没有看到平台期。
这句话比任何一个基准分数都值得注意。它意味着在 Beam 这条技术路线上,继续加 RL 算力仍然能换到能力,而不是撞到了天花板。
三、工程难点:异步 RL 下的"策略陈旧"
这部分是全文技术含量最高的地方,值得单独讲。
Beam 用的是异步策略梯度(asynchronous policy gradients)。异步的好处是吞吐高 —— 不用等最慢的那条 rollout。但它带来一个规模化的副作用:
长 rollout 的 token 是由多个不同的模型 checkpoint 生成的。
越早生成的 token,相对于"当前策略"就越旧。
这就叫policy staleness(策略陈旧)。
更要命的是,还有第二个来源:训练引擎和推理引擎之间的数值不匹配。两者算出来的东西有微小差异,在长 rollout 上会不断累积。
两个问题叠在一起,异步 RL 一放大就发散。
Reflection 的解法是新算法:他们说这套办法让完全异步的 RL 在规模化下保持稳定,即使学习的是"一天前"生成的交互。
官方给了一个很硬的自测数字:
1 天陈旧度 = 落后当前策略 107 个权重版本,数值仍然稳定。
“落后 107 个版本还能训”—— 这个数字说明他们的 staleness 容忍度做到了什么程度。做 RL 基础设施的人会知道这有多难。
四、长度惩罚:先变短,再变长
另一个有意思的细节是可控长度惩罚(controllable length penalty):奖励成功的解,同时抑制不必要的 token。
但训练过程出现了一个非单调的现象,官方如实写了出来:
- RL 早期:性能上升的同时,completion 长度下降—— 模型学会了用更少的推理把问题解出来;
- RL 后期:随着 agentic 能力增强,长度重新变长—— 但这些多出来的 token支撑了进一步的性能提升。
这个 U 型曲线值得琢磨:它说明"推理长度"本身不是一个可以直接优化的目标。早期压长度是在去掉废话,后期加长度是在做更复杂的事—— 两者都让模型变好,但方向相反。
所以一个只盯着"输出 token 数"来优化的策略,可能在早期看着漂亮,到后期反而压住了能力上限。
五、官方自己承认:它不是最强的
这一点我觉得值得单独拎出来说,因为很少见。
官方原文明确写了:
Where frontier open models like Kimi K3 remain ahead on raw capability
(在原始能力上,像 Kimi K3 这样的前沿开放模型仍然领先)
然后紧接着给出了 Beam 的定位:优势在推理时的效率。
官方给的具体口径是:
- advanced reasoning 基准上达到GLM-5.2 可比的分数,而只用 3–4 倍更少的推理算力;
- 与2T+ 参数级别的模型(点名了 Qwen 3.8-Max)相比,每 token 需要的推理算力显著更少。
官方把这件事总结成一句话:“more intelligence per token”。
“不自称最强、只说自己最划算”—— 这个定位选择本身就是一个信号:开源模型的竞争维度已经从"谁分高"转向了"谁每块钱买到更多智能"。
六、基准表要怎么读(别读成"Beam 最强")
官方放了一张 benchmark 表。但直接看结论会看错。
| 基准 | Beam | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | 61.0 | 68.0 | 51.0 | 74.2 |
| SWE Bench Pro v2-Hard | 77.2 | 84.3 | 88.2 | NR | NR |
| SWE Bench Pro v1 | 65.5 | NR | NR | 67.7 | NR |
| Terminal Bench v2.1 | 80.1 | 88.2 | 88.3 | 86.6 | 90.6 |
| SWE Atlas Codebase QnA | 34.6 | 61.0 | 68.0 | NR | NR |
| SWEBench Multilingual | 78.0 | NR | NR | NR | NR |
| SWEBench Verified | 80.9 | NR | NR | NR | NR |
三个必须注意的点:
- Beam 只在两项上领先—— SWEBench Multilingual (78.0) 和 SWEBench Verified (80.9)。这两项上其他模型都没报分。
- 在 DeepSWE v1.1 和 Terminal Bench v2.1 上,DeepSeek V4.1 Flash 明显更高(74.2 vs 44.4;90.6 vs 80.1)。
- 大量格子是
NR(官方标注 “not reported”,未报告)。这不是一次全模型同条件的横评—— 是一张把各家自报数字拼起来的表。
所以正确读法是:Beam 在部分 coding 基准上进了第一梯队,但不存在"全面领先"这回事。官方自己也没这么说。
七、"省 3–4 倍算力"这个数字的口径
这个结论对应官方 Figure 2,算法是明写的:
FLOPs ≈ 2 × 激活参数量 × 平均生成 token 数限定条件(官方原文列的,一条都不能省):
- 每次乘加算两次操作;
- MoE 用每 token 激活的参数,不用 501B 总量;
- 不含prompt prefill、依赖上下文的 attention 运算、服务开销;
- 别家模型的评测分数来自Artificial Analysis 和 DataCurve,不是自己跑的;
- 官方原话:这是近似算力比较(approximate compute comparison),不是实测推理成本。
所以不要说"实测省 3–4 倍成本"。严谨的说法是:在官方给定的估算口径下,达到可比推理分数所需的生成侧 FLOPs 少 3–4 倍。
真实成本还取决于你部署在哪、batch 多大、prefill 占多少 —— 这些这张图里都没有。
八、现在能做什么,不能做什么
能做的:
- 在 https://platform.reflection.ai/登记早期访问;
- 把这份公告当作一份RL 基础设施的工程案例来读 —— 10.5K GB300、1 亿 rollout、13 亿 sandbox、107 版本陈旧度,这些数字本身就说明了 2026 年做前沿 RL 的门槛在哪。
还不能做的:
- 下载权重:官方明说权重、技术报告、model card、开发者产物都是"本月晚些时候"发布;
- 评估许可证:还没公布;
- 算部署成本:显存占用、硬件门槛都没给;
- 看第三方复现:权重没放,任何"实测"都不存在。
官方还提到 Beam正在做最后的 red-teaming 和评估—— 这也解释了为什么先发公告、后放权重。
小结
把 Beam 这条新闻的价值浓缩成三句话:
- 开源模型的竞争维度正在从"参数量/榜单分"转向"每 token 的智能密度"—— Beam 官方自己承认原始能力不如 Kimi K3,但把"省 3–4 倍推理算力"当成核心卖点来讲。
- RL 已经成为和预训练并列的独立 scaling 轴—— 10.5K 张 GB300、4 周、1 亿 rollout、13 亿 sandbox,这套基础设施的规模,本身就是门槛。
- 异步 RL 的"策略陈旧"是可以被工程手段压住的—— 落后 107 个权重版本仍能稳定训练,这个数字对做 RL infra 的人有直接参考价值。
至于模型本身好不好用 ——得等权重放出来才算数。
参考资料
| 内容 | 来源 | 页面日期 | 核验时间 |
|---|---|---|---|
| 全部模型事实、RL 规模、基准表、效率口径 | Introducing Beam: Reflection’s 501B open-weight model(Reflection 官方博客) | 2026-10-05 | 2026-10-07 |
| 第三方报道(仅用于交叉确认发布日期与参数量) | Reflection AI debuts open-source Beam model with 501B parameters(SiliconANGLE) | 2026-10-05 | 2026-10-07 |
标签:人工智能/机器学习、AIGC/语言模型
摘要(≤256 字):
Reflection AI 于 2026-10-05 发布首个开放权重模型 Beam:501B 总参 / 23B 激活的稀疏 MoE,面向 coding、reasoning、agentic。本文逐条拆解官方公告里的工程细节 —— 23.8 万亿 token 预训练、10.5K 张 NVIDIA GB300 跑 4 周产出 1 亿+ rollout、256K 上下文、约 13 亿 sandbox;重点讲异步 RL 的「策略陈旧」问题与官方解法(落后 107 个权重版本仍稳定),以及长度惩罚带来的「先变短再变长」非单调曲线。同时说明官方基准表的正确读法(多项为 NR,并非全面领先)与「省 3–4 倍算力」的估算口径。权重与技术报告官方称本月晚些时候发布。