从训练到算子全链路开源:盘古 7 大组件落地,国产 AI「自主可控」拼图还差哪块?
【免费下载链接】openPangu-2.0-Pro昇腾原生的openPangu-2.0-Pro语言模型项目地址: https://ai.gitcode.com/ascend-tribe/openPangu-2.0-Pro
2026 年 6 月 12 日,华为开发者大会 HDC 2026 上,余承东时隔多年重掌大模型业务后的首场重磅发布,把「开源盘古 openPangu 2.0」推到了聚光灯下——稀疏 MoE 架构、512K 超长上下文、Pro/Flash 双版本,以及一句「计划从 6 月 30 日起分批开源 7 大组件」的承诺。此后三个月,承诺陆续兑现:Flash 权重与训推算子 6 月底上线,Pro 权重与技术报告 7 月底上线,预训练、SFT 与后训练 RL 代码 9 月底全部开源。
本文不满足于罗列「开源了什么东西」,而是基于 openPangu-2.0-Pro 权重仓库的真实源码,从组件全景、工程成色、完成度盘点三个维度,回答一个更尖锐的问题:当一家公司把从数据到算子的整条 AI 生产线都摊开时,「自主可控」的拼图究竟拼到了哪一步,还剩哪几块没落下去。
一、7 大组件开源全景:从「给模型」到「给生产线」
先厘清一个常见误解:openPangu 2.0 的「开源」不是一次性地放一个权重文件,而是按时间线分批交付一组可独立使用的工程资产。
已公开的交付时间线:
| 时间 | 组件 | 内容 |
|---|---|---|
| 2026-06-12 | HDC 2026 发布 | openPangu 2.0 发布,宣布 7 大组件分批开源 |
| 2026-06-30 | Flash 模型包 | 92B 总参(激活 6B)权重、基础推理代码、训推算子 |
| 2026-07-31 | Pro 模型包 | 505B 总参(激活 18B)权重、基础推理代码、技术报告 |
| 2026-09-28 | 训练代码包 | 预训练代码(openPangu-2.0-Training)、后训练 SFT 与 RL 代码(openPangu-2.0-RL) |
对照官方口径,7 大组件大致覆盖:模型权重、基础推理代码、预训练代码、后训练 SFT 代码、后训练 RL 代码、训练算子、技术报告与推理框架(推理侧由 openPangu-2.0-Infer / omni-infer 承担,见 README.md 第 4 节)。
这套组合的逻辑很清楚:权重解决「能不能用」,推理代码解决「怎么用得好」,训练代码与算子解决「别人能不能复现和续训」。从行业横向看,多数开源模型厂牌止步于「权重 + 推理脚本」,而盘古把训练侧——通常被视为各家核心壁垒的部分——也一并放出,这是本次开源叙事真正的分水岭。
二、源码级解剖:505B 的工程成色写在配置文件里
仓库ascend-tribe/openPangu-2.0-Pro表面上是标准的权重仓:275 个.safetensors分片、LFS 指针托管、model.safetensors.index.json提供分片索引。但真正的信息量藏在三个文本文件里。
1. 架构指纹:config.json
这份 55 行的配置几乎复刻了 README 中所有的架构声明,并给出了可验证的数值:
- MoE 规模:
n_routed_experts: 384,每 token 激活num_experts_per_tok: 8,加上 1 个共享专家,与「505B 总参 / 18B 激活」的官方数字吻合; - MLA(多头潜在注意力):
kv_lora_rank: 512、q_lora_rank: 1536、qk_nope_head_dim: 128+qk_rope_head_dim: 64,属于 DeepSeek 式 MLA 的昇腾实现路线; - DSA + SWA 分层混合:
dsa_layers列了 18 个稀疏全局聚合层,swa_layers列了 35 个滑动窗口层,层配比接近 1:2,与 README.md 描述一致;sliding_window从 512 到 2048 分段递增(sliding_window_list),说明长上下文窗口是分层放宽的; - mHC 拓扑:
use_mhc: true、mhc_num_stream: 4,即 4 支流残差结构; - 自投机 MTP:
num_nextn_predict_layers: 3,一次额外预测 3 个 token; - 训练标记:
use_mome: true印证 Muon 优化器路线;transformers_version: 5.0.0说明它吃到了新一代 transformers 的 RopeParameters 类型系统——configuration_openpangu_v2.py 里甚至为旧版本 transformers 做了 TypedDict 兼容兜底,工程细节可见一斑; - 上下文:
max_position_embeddings: 524288,即 512K;rope_theta: 6400000是长序列外推的关键旋钮。
2. 双语分词:tokenization_openpangu_v2.py
分词器是 BPE +byte_fallback,但预切分正则里专门为中文标点([#$%&'()*+...)和\p{Han}设计了一条独立分支,vocab_size: 151552(对应 config 中的 151552),特殊 token 为<|pangu_text_start|>/<|pangu_text_end|>。这说明 34T tokens 训练数据的混合语料设计,在中英双语上都有显式处理,而非简单拼接。
3. 推理与部署约定
generation_config.json 给出默认解码参数(top_p: 0.8、top_k: 151552、temperature: 1.0);README.md 则明确推理走 omni-infer 框架并指向 openPangu-2.0-Infer 源码仓。AutoConfig 的auto_map意味着 huggingface 生态可以直接拉起模型,但「昇腾原生」的定位决定了官方推荐链路是昇腾 NPU + omni-infer,而不是通用 GPU 栈。
4. 许可证的「双刃剑」:LICENSE
OPENPANGU MODEL LICENSE AGREEMENT V2.0 在授权自由度上并不保守——允许商用、再分发、衍生——但附加了三条硬约束:欧盟境内禁止使用(3.1 条)、对华为发起专利/版权诉讼即自动终止授权(3.2 条)、再分发须保留协议全文并标注「Powered by openPangu」与商标声明(4.2 条)。这是理解「自主可控」叙事时必须正视的制度底色:开放是分地域、分条件的。
三、自主可控叙事的完成度盘点
如果以「离开境外技术栈、独立完成从训练到推理的全流程」为标尺,盘古开源矩阵的完成度可以拆成四个象限。
已完成:
- 权重层:Pro/Flash/Embedded(1B、7B)/Ultra-MoE-718B/R-72B/R-7B-Diffusion 等已形成梯次阵容,覆盖云侧大模型、端侧轻量、扩散语言模型三条线;
- 训练层:预训练 + SFT + RL 代码全部开源,训练算子同步放出,这是国产开源阵营里少有的「连锅端」;
- 推理层:omni-infer + openPangu-2.0-Infer,配合昇腾 NPU 深度调优,官方称单卡推理吞吐率达到市面主流开源模型的 2 倍;
- 测评背书:仓库内置完整评测表(README.md 第 3 节),Thinking 版本在 AIME 2026 达 95.4、HMMT Feb 2026 达 86.2、GPQA-Diamond 达 87.9、IFEval Prompt Strict 达 94.5,SWE-bench Verified 68.5;12 月 openPangu-R-72B 又登顶 SuperCLUE DeepSearch 榜单。
仍然缺的:
- 训练数据:34T tokens 的语料构成、清洗与配比并未开源。权重、代码、算子都给了,但「喂什么」仍是黑箱——这意味着第三方无法真正复现能力曲线,续训/蒸馏只能基于权重二次加工;
- 第三方独立复现:训练代码的开源时间是 9 月底,目前尚缺乏昇腾集群之外(如通用加速卡)跑通完整训练管线的公开记录,「昇腾原生」是优势,也是复现的门槛;
- 工具链与编译器:训练依赖的算子、框架层面的编排(MindSpore/Ascend 工具链)未随模型仓一并放出,训练代码的实际可移植性有待验证;
- 社区治理机制:目前仍是「官方发布 + issue 反馈」的单向模式,没有形成类似开放社区那样的贡献者治理结构,生态扩散速度受限。
一句话总结:「自主可控」的技术底座拼图已基本成型,但「可验证、可移植、可持续」的生态拼图至少还差数据、独立复现与社区共建三块。
四、对国产 AI 生态的长远影响
1. 重新定义「开源」的资产边界
过去两年国产大模型开源的共识是「权重开源」,盘古把边界推进到了「生产工具开源」。这对行业的实际影响是:中小团队第一次可以基于昇腾原生的训推代码做二次开发,而不必从零摸索 MoE 在特定硬件上的并行切分、长序列显存调度和算子改写——这些恰恰是 configuration_openpangu_v2.py 中base_model_tp_plan/base_model_pp_plan这类工程细节所代表的隐性成本。
2. 硬件-软件-模型的闭环示范
盘古 2.0 的叙事里有一个容易被忽略的点:余承东在发布会上坦言算力大量支持了国内其他企业需求,自己预留非常有限,因此团队聚焦时延与吞吐率而非参数规模竞赛。505B 不是最大的,但「昇腾 NPU + 原生训练 + 自研推理框架 + 鸿蒙 Agent 生态」形成的是一条从芯片到应用的垂直闭环。对小艺 Claw 等系统级 Agent 任务的原生支持,意味着这套链路已经在真实产品里接受了检验,而非停留在跑分。
3. 客观的张力依然存在
- 许可证的地域与诉讼条款让部分国际开发者望而却步,开放度与「以开放换生态」之间存在张力;
- 昇腾原生的强绑定是效率优势,也是生态半径的天花板——模型好用的前提是设备在昇腾栈内;
- 从 8 月的 Flash 横评看(92B MoE 每 token 激活约 6B),openPangu 在结构化输出与指令遵循上首轮通过率最优,但响应延迟显著高于同档竞品,说明推理效率的 2 倍吞吐叙事与端到端体验之间仍有优化空间——这也正是推理代码开源后社区可以着手的方向。
4. 国产 AI 自主可控的终局判断
如果把「自主可控」拆成三层——模型能力自主(权重与训练配方)、基础设施自主(芯片与算子栈)、生态自主(工具链与开发者社区)——盘古 2.0 的开源矩阵在第二层已经交出了国产阵营里最完整的答卷,第一层完成度约七成(数据仍黑箱),第三层则刚刚起步。
「自主可控」从来不是一次开源发布会能画完的句号,而是一条需要持续迭代的曲线。盘古 7 大组件落地,把这条曲线的斜率拉到了国产阵营的最高点;至于最后几块拼图——训练数据的透明化、跨硬件的可移植性、社区从「围观」到「共建」的转化——既是华为的下一个承诺,也是检验「说到做到」的下一道考题。
【免费下载链接】openPangu-2.0-Pro昇腾原生的openPangu-2.0-Pro语言模型项目地址: https://ai.gitcode.com/ascend-tribe/openPangu-2.0-Pro
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考