深度 | 国产算力千亿模型的每一张成绩单都是自测的:技术账通了,信任账还没人签收
2026/8/26 4:20:34 网站建设 项目流程

国产算力千亿模型的每一张成绩单都是自测的:技术账通了,信任账还没人签收

核心观点:V4 上国芯四个月,技术账记了大半——推理国产化成立、后训练被 1000 颗 910C 跑通;但所有关键性能数字全是厂商自测,NIST 的第三方复测已经证明自报会注水。H200 有条件放行后,训练进口、推理国产的双轨制开始定价,而「信任账」还无人签收。

证据等级:[A] 官方/一手 [B] 2+可靠来源 [C] 单一来源 [D] 个人判断

一、这不是算力差距,是信任差距

如果英伟达发布 H200 时所有性能数字都只能自报,Phoronix、MLPerf 这些独立机构全部缺席,市场会给它定什么价?国产算力现在就是这个处境。

NIST 的第三方复测已经给过一次警告:V4-Pro 在官方报告里逼近 Opus 4.6,NIST 则认为「最接近 GPT-5」,网络安全 32% vs 71%、抽象推理 46% vs 79%,差距肉眼可见 [B]。模型侧如此,芯片侧更甚——昇腾至今没有任何一份独立机构复现的 benchmark [D]。这个差距,决定了自测数字能不能变成真金白银的定价权。

二、技术账:模型变「省」了,墙在算子层

先分清顺序:V4 能上国芯,首先不是芯片变强,而是模型变省。CSA+HCA 两层压缩注意力把单 token 推理 FLOPs 压到 V3.2 的 27%、KV 缓存压到 10%,1.6T 的 V4-Pro 每 token 只激活约 49B 参数 [A]。省下来,才有资格谈适配。

适配的墙在算子层。V4 的动态稀疏注意力算子在 CANN 原生库里不存在,迁移昇腾要重写 200 多个 CUDA 算子、做 10 万级精度一致性测试,约 30 人年;CANN 宣称 95% 的 CUDA 接口兼容,实际只覆盖约 160 个主流模型,CUDA 生态是 23,000 多个 [C]。兼容层翻译得了接口,翻译不了深度耦合的 warp 调度。

还有个被忽略的裂缝:HuggingFace 参考实现里,CSA 的 gather 矩阵复杂度是 O(S²·k) 而不是论文声称的线性——「百万上下文 = 线性成本」的叙事,在长输入预填充阶段要打折扣 [B/C]。

训练侧,华为系团队用约 1000 颗 910C 跑通了 V4-Pro 的全参数后训练,MFU 34.22%、1500 多步零系统故障 [B]。这是国产卡第一次在万亿级 MoE 上逼近国际训练效率。但这是后训练,不是预训练——V4 的预训练仍主要跑在英伟达 H800/H100 上,官方措辞是「同时验证」,验证不等于替换。

上图:V4 上国芯的技术链条——模型的「省」是前提,算子的墙是成本,复杂度裂缝提示自测数字可能被高估。

三、竞争账:推理、训练、共设计,三条赛道各自定价

维度NVIDIA H200昇腾 910C昇腾 950PR/950DT寒武纪/海光等
推理水位基准约 60% H100>2× H20 低精度Day-0 适配,无独立数字
训练能力基准后训练实证 MFU 34%950DT 训练版 H2 2026
生态CUDA 23,000+CANN 约 160 模型CANN 8.5(V4 深度定制)vLLM 等
独立基准Phoronix/MLPerf

推理赛道已分出胜负手。昇腾靠 950 系列拿话语权:950PR 低精度超 H20 2 倍,FP4 单卡约 2.87× H20;华为云自测 V4-Pro 在 8K 输入下约 4700 tok/s(20ms)[B]。数字不错,但全部是厂商口径。

训练赛道仍是英伟达的。国产只到后训练这一格,950DT 训练版 2026 H2 才上量,960 超节点要等 2027 Q4。共设计是这轮真正的变量:SemiAnalysis 从 CANN 源码挖出 950DT 代号「David」,CANN 8.5 围绕 V4 推理模式构建,让 V4-Pro API 价格降了 75% 还能盈利 [C]。模型第一次为芯片而设计 [D]。

上图:从 Day-0 到双轨制——推理侧加速、训练侧等待、政策侧定调的时间线。

四、政策与市场账:H200 有条件放行,双轨制开始定价

过去一个月最被低估的信号,是 H200 的有条件放行。7 月,北京对约十家企业的 H200 采购给出「有条件批准」:总量低于 20 万颗、仅限训练用途、推理必须优先使用国产芯片 [C]。这不是开放,是配给——用进口算力补训练缺口,用政策把推理市场留给国产。

双轨制已经成型:推理工作负载国产化率约 60-80%,高端训练国产化率只有 20-30% [C]。十五五算力投资每年约 5000 亿、五年超 3 万亿,新建智算中心国产化率被要求 70-80% [C]。IDC 数据:2025 年国产加速卡出货占比 41%,首次破 40%;Bernstein 预计 2026 超 50%、2028 年国产产能覆盖 104% 需求 [C]。

定价端,V4-Pro 输出 24 元/百万 token、V4-Flash 缓存命中只要 0.2 元,相对 GPT-5.4 / Claude Opus 4.8 约有 27:1 的成本优势 [A/B]。推理被压到接近「水电价」之后,政策托底加成本优势构成闭环:价格越低、适配越多、政策越倾斜。

上图:双轨制闭环——政策把推理留给国产、把训练缺口留给进口,成本优势反过来强化政策倾斜。

五、战略启示:谁在为信任买单

对模型厂商,双轨制把「训练进口、推理国产」变成标准配置,200 多个算子、约 30 人年的迁移成本被制度化,成了后来者的必修课。

对芯片厂商,自测数字是双刃剑:短期保护估值,但第一份独立基准出现时,整个板块会被一次性重新定价 [D]。寒武纪财报已经展示了脆弱面——营收净利双高增长,但 82 亿存货压手、经营现金流承压,市值从高点回落 [A]。

对采购方,国测是及格线不是竞争力线,验收要覆盖故障率、再适配速度、长期绑定。对投资者,最大的雷不是产能,而是「信任税」被一次性征收——任何一家独立机构放出昇腾的非自报 benchmark,叙事都可能从「全面替代」瞬间回到「还有差距」。

六、我的判断

我判断,未来 6-12 个月内一定会出现至少一份可复现的独立基准——不是英伟达阵营做的,就是国产阵营自己请人做的。它不会改变「推理国产化成立」的事实,但会给国产算力第一次标上一个可比的坐标。

我赌,双轨制会在 2027 年固化:高端训练继续用进口卡,中低端训练和全量推理用国产卡。任何「全面替代英伟达」的叙事,在 960 超节点量产之前,都是把 SFT 当预训练。

最后,如果 HuggingFace 那个 O(S²·k) 的实现问题最终被坐实,我原以为的「百万上下文线性成本」要打一个折扣——但这是模型侧的问题,不影响「国产芯片跑得动千亿模型」这个基本面。

先不下结论。我只需要三个数据:一份独立基准、950DT 的真实出货量(不是「上线」的话术)、H200 配给的实际执行率。在那之前,「全面替代」和「全是泡沫」都只是立场。

参考来源(部分)

  1. DeepSeek V4 技术报告分析
  2. NIST 评估:V4 最接近 GPT-5 (TechTimes)
  3. HuggingFace issue #45925:CSA 复杂度 O(S²k)
  4. 1000 颗 910C 跑通 V4-Pro 全参数后训练 (Pandaily)
  5. SemiAnalysis:950DT 与 V4 共设计
  6. 发改委点名指导国产大模型适配国产芯片

AI 辅助深度研究,人工视角解读。每日更新。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询