最新内容请微信搜索公众号网络研观观阅读
在国际科技博弈的宏大叙事中,超级计算机(Supercomputer)向来被视为战略威慑级别的“国之重器”。从模拟核试验、破译复杂密码,到设计高超音速飞行器与预测全球气候,超算代表着一个国家算力的最高工业结晶。
2026年6月,全球超算500强(Top500)榜单再度刷新,一台斩获冠军宝座的中国超算——“灵晟”(LineShine),在国际科技界激起了巨浪。这不仅是一次简单的跑分登顶,更是一场在西方地缘政治技术封锁下,中国利用本土芯片产业成功实现的“史诗级突围”。
一、 悄然布局的“超算双子星”与自给自足之路
长期以来,外界对中国超算存在一种误解,认为在芯片禁运的背景下,中国的算力发展已经陷入停滞。然而事实上,中国在“百亿亿次”(Exascale,即每秒进行一万亿次的一万亿次浮点运算)这一超算至高境界上,早已是轻车熟路的“头号玩家”:
- 神威·海洋之光(OceanLight)
早在2021年3月就在青岛国家超级计算中心投入运行,拥有多达4193万个核心,其理论峰值性能早已突破百亿亿次大关。
- 天河三号(Tianhe-3)
2023年底完整体正式亮相,基于混合型飞腾Arm处理器与Matrix DSP协处理器,在HPL(高性能Linpack)实际测试中达到了1.57 Exaflops的惊人表现。
面对不可逆转的外部技术禁运,中国超算彻底放弃了对海外GPU(图形处理器)和网络设备的幻想,坚定不移地走上了“全产业链自主研发、自给自足”的硬核道路。部署在深圳国家超级计算中心的“灵晟”,正是这条独立自主之路上结出的最新、最强的硕果。
二、 核心大脑解密:为什么“灵晟”敢剑走偏锋选择“纯CPU”?
现代主流顶级超算(如美国的Frontier、El Capitan等)为了追求极致的数据吞吐速度,无一例外地采用了“CPU + GPU加速器”的混合架构,大量堆叠如英伟达、AMD的AI神卡。但“灵晟”却反其道而行之,这是一台“全CPU”(All-CPU)的百亿亿次超算。
它的核心动力源自一颗名为“凌坤 LX2”的处理器,由深圳国家超算中心与华为海思(HiSilicon)芯片部门联合设计,并完全交由国内的中芯国际(SMIC)晶圆厂进行代工制造。
1. 突破良率极限的“核心大户”
LX2的设计极其激进。在一颗物理插槽(Socket)内部,它实际上包含了两个相互连接的芯片组(Chiplets),每个芯片组设计有192个原始核心,总计达384个核心。在实际量产和运行中,为了应对工艺良率的挑战,它暴露出304个活跃核心。折算下来,其核心良率达到了79.2%,这在中芯国际的先进工艺下是一个极为优秀的商业化表现。
2. 工艺智慧:低频运行的“以退为进”
据行业最新技术资料分析,凌坤 LX2 芯片采用的是中芯国际的7纳米(N+3精制版)工艺。由于代工工艺与西方顶尖晶圆厂仍存在客观代差,设计团队展现出了极高的工程智慧:他们没有盲目压榨芯片的主频,而是将运行频率保守地定在1.55 GHz。
- 频率的艺术
虽然1.55 GHz的频率远低于主流商业CPU,但低频运行能够完美平衡“内存带宽”与“核心计算速度”之间的矛盾,有效避免了超算中常见的“数据塞车”。
- 功耗与散热的权衡
即便在低频下,这颗拥有304核的算力怪兽单芯片功耗依然达到了690瓦。低频设计让整机的高密度液冷散热变得切实可行。
3. 把GPU的绝活刻进CPU的骨子里
“纯CPU”不等于放弃AI和矩阵计算。LX2 芯片基于Armv9.2 架构,不仅复制了Neoverse原生的SVE2(可伸缩向量扩展)单元,更深度集成了华为定制的SME(可伸缩矩阵扩展)单元。
通俗来说,SME单元在芯片内部构建了一个二维矩阵网格,可以直接进行大方阵的数学累加。它虽然是一颗CPU,却把原本属于GPU最擅长的“大规模机器学习和AI矩阵运算”直接做成了CPU的底层硬指令,实现了“CPU-GPU融合一体化”的进化。
4. 颠覆性的3D堆叠与混合内存架构
为了给304个核心提供充足的数据“燃料”,LX2抛弃了传统的内存插槽,采用了先进的3D芯片堆叠封装技术:
- HBM高速显存
每个插槽直接封装了64GB的HBM2E改进版显存(分布在两个芯片组上),提供了高达8 TB/s的恐怖内存带宽。
- 国产DRAM内存
在核心芯片之上,通过定制的DRAM逻辑晶圆,直接3D堆叠了256GB的国产高频内存(预计为长鑫存储的10.7GHz LPDDR5X)。
- 智能高速公路
整个插槽内总计拥有320GB的混合物理内存,划分为8个NUMA域,内部通过专门的SDMA(系统直接内存访问)引擎,全自动管理HBM和DRAM之间的数据搬运,对软件开发者完全透明。
三、 积木成塔:“灵晟”的宏大系统架构
要把千千万万颗芯片连接成一台超级计算机,其工程量堪比建造一座严密的微观城市。“灵晟”的扩容犹如搭积木,层层递进,结构异常紧凑:
节点层级 | 组成结构与数量 | 技术特点与物理连接 |
|---|---|---|
| 独立节点 (Node) | 2颗凌坤 LX2 芯片 | 构成一台双路服务器,是最基础的独立计算单元。 |
| 刀片服务器 (Blade) | 8个独立节点(16颗 CPU) | 高密度紧凑排列,高度集成化。 |
| 机架 (Rack) | 16个刀片服务器(256颗 CPU) | 机箱内部节点全部通过高带宽的PCIe 5.0进行经济高效的本地互连。 |
| 标准帧 (Frame) | 2个 机架组成 | 额定 FP64 浮点峰值性能直接达到了惊人的30.87 Petaflops。 |
独家定制的交通网络:“灵祁”互连
要让1300多万个核心协同工作,网络延迟必须控制在微秒级别。为此,“灵晟”配备了中国完全自主研发的“灵祁”(LingQi)专有互连技术。
“灵祁”采用了四层胖树(Fat-Tree)、双平面、多轨的网络拓扑结构,为每个独立节点提供高达1.6 Tb/s的超高带宽(相当于每颗LX2芯片集成了两个400 Gb/s的自研网卡端口)。
为了极致地控制成本与保障供应链安全,“灵祁”网络做到了精细的工程控制:在标准帧和机架内部,短距离全部采用高性价比的铜缆进行交叉耦合连接;而连接起整套系统多达184个标准帧时,才动用庞大的光纤网络连接到32个核心网络交换帧上。这套网络的单跳延迟仅有1.07微秒,确保了海量数据在庞大集群中瞬间送达。
四、 恐怖的数据:“灵晟”的实际战力与功耗解析
在国际公认的HPL(高性能Linpack)基准测试中,“灵晟”展现出了令人惊叹的硬实力:
- 测试规模
跑分系统调动了22,680个节点,总计拥有13,789,440个计算核心。
- 理论峰值(Rpeak)
2.74 Exaflops(每秒274亿亿次浮点运算)。 - 实际性能(Rmax)
略低于2.2 Exaflops(每秒约220亿亿次浮点运算)。
这一实际跑分成绩,直接将此前排名世界第一、美国劳伦斯利弗莫尔国家实验室的“El Capitan”超算(基于AMD MI300A混合架构)掀翻马下,性能足足高出其 21.5%!
超高效率与“大胃王”的科学辩证
“灵晟”的实际跑分效率(实际性能 ÷ 理论峰值)高达80.35%。在“全CPU”架构、规模超过千万核的超级巨兽中,能突破80%的效率大关,这在超算工业史上是罕见的奇迹(作为对比,日本全Arm CPU的“富岳”效率约为82.3%)。这充分证明了向量/矩阵单元直接融入CPU核心带来的巨大架构优势。
当然,作为算力怪兽,“灵晟”的食量也极其惊人——测试运行时整机功耗达到了42.2兆瓦(MW),明显高于美国前三大百亿亿次超算(普遍在30兆瓦以下)。这是中国采用7纳米工艺对抗西方更先进工艺时付出的必然能耗代价。
但从软件生态和科研角度来看,这个代价完全超值:由于“灵晟”是全CPU架构,它拥有完全统一的HBM和DRAM内存空间。科学家们在开发气象、核能、材料学软件时,不需要像面对GPU那样把代码痛苦地拆解、转换、卸载(Offload)到显存里。它没有昂贵的GPU软件生态壁垒,软件开发和迁移成本几乎为零。
五、 深度解析:中国超算为什么要为AI的未来转型?
“灵晟”超级计算机的成功不仅在于其夺得了Top500的桂冠,更在于它指明了未来大模型与通用人工智能(AGI)时代的算力新路径。
随着生成式人工智能(GenAI)从单一的“大模型训练”走向数以亿计的“智能体(Agent)日常推理和多模态交互”,行业的算力需求正在发生根本性转变。智能体AI需要高频交互、极为复杂的逻辑条件判断,以及超大规模、超高带宽的内存吞吐。在这类工作负载下,传统的GPU往往会因为显存容量瓶颈、复杂的逻辑控制能力不足而陷入性能卡顿。
而像“灵晟”配备的凌坤 LX2 这种芯片,恰恰就是为了这个时代量身定制的:
它拥有CPU无与伦比的高效通用逻辑控制和全整数处理单元;
内部直接集成了强悍的SME矩阵数学硬核,能像GPU一样瞬间吞吐矩阵乘法;
3D堆叠的大容量高速显存与高频DRAM,彻底消除了AI推理中的“内存墙”限制。
“灵晟”的诞生是一次完美的 engineering triumph(工程学胜利)。它向世界证明:在先进芯片制造工艺遭受重重围堵的逆境下,通过顶尖的微架构设计、创新的3D封装以及极致的系统级工程优化,中国人依然可以造出碾压全球的算力奇迹。这种自力更生,不仅是为了在世界超算榜单上摘得桂冠,更是为中国未来的AI主权、科研主权,筑起了一座坚不可摧、不被卡脖子的算力基石。