英伟达130亿收购Mellanox:GPU算力背后的网络棋局
2026/9/18 11:27:27 网站建设 项目流程

1. 这笔130亿美元,买的到底是什么

2019年3月,英伟达官宣以69亿美元现金收购Mellanox,后来交易完成时实际金额约为70亿美元。而“130亿”这个数字大概率是媒体口径把后续几年围绕网络、DPU、软件生态的持续投入全算了进去。先不纠结数字口径,单说Mellanox——这是一家做高性能网络设备的公司,核心产品是InfiniBand交换机、网卡,以及后来的以太网方案。

很多人第一反应是:英伟达一个做GPU的,为什么要花这么多钱买一个“卖网线”的公司?这恰恰是理解黄仁勋焦虑的关键切口。

GPU算力再强,数据过不去也是白搭。早期AI训练是单机多卡,几张GPU插在同一台服务器里,通过PCIe总线互联,数据交换延迟在微秒级,几乎不用考虑网络。但到了大模型时代,单台服务器撑死塞8张GPU,而训练一个千亿参数模型需要几千甚至上万张GPU一起干活。这时候每张卡不仅要算,还要频繁和其他所有卡交换中间结果。如果把每张GPU比作一个快递员,模型训练就是所有人协同完成一个超级大单,快递员业务能力再强,如果电梯和货运通道不够用,订单一样会卡死。

Mellanox的价值就在这里。InfiniBand网络天生就是为高性能计算设计的,它的延迟可以做到微秒级甚至亚微秒级,带宽是传统以太网的几十倍,还支持RDMA这种“绕过CPU直接读写远端内存”的机制。换成大白话就是:数据从一个GPU搬到另一个GPU,以前要经过操作系统、网卡驱动、协议栈层层中转,现在直接一条专线走完。

收购完成之后,英伟达把Mellanox的网络能力和自家GPU捆绑,搞出了SuperPOD这种整机柜交付方案,云厂商和超算中心只需要把柜子通电、通网,连上电就是一台万卡级超算。这套东西后来成了GPT系列、Llama系列等大模型训练的事实标准基础设施,也成了英伟达数据中心业务狂飙的重要支点。

所以黄仁勋买的不是一家公司,而是一条从GPU到网络再到集群调度全栈打通的数据通路。这笔账当时看很贵,现在回头看,某种程度上比买ARM(如果真买成的话)还要关键。

2. 黄仁勋到底在怕什么

2.1 怕算力被网络瓶颈卡死

多卡训练模型时,通信开销是真实的性能黑洞。一张H100的理论算力接近1000 TFLOPS(FP16),但实际跑大模型训练,GPU有相当多时间是在等数据。NCCL(NVIDIA Collective Communications Library)的实测数据显示,万卡规模训练中,通信耗时能占到总训练时间的30%到50%。也就是说,你买了一万张卡,真正算的只有五千张卡的活,剩下五千张卡在干等。

这不是危言耸听。以GPT-3的训练为例,参数规模1750亿,采用ZeRO等并行策略后,每次梯度同步需要搬移的参数量依旧是GB级别。在万卡集群上,每步训练都要做一次全局规约,把所有GPU的梯度求和再广播回去,这个操作对网络的延迟和带宽极其敏感。网络只要差一点,整体吞吐就会断崖式下跌。

英伟达自己的数据是:用InfiniBand组建的万卡集群,网络利用率可以达到70%以上,而传统以太网方案能做到40%就算烧高香。这30个百分点的差距,意味着同样的电费、同样的机房租金、同样的卡数量,训练效率差了近一倍。在大模型军备竞赛的今天,谁能把集群效率从60%提到90%,谁就能用一半的时间把模型训出来,提前抢占市场。

2.2 怕GPU变成白菜价的时候没有护城河

GPU硬件本身是有寿命周期的。每一代架构的红利只能维持两到三年,竞争对手用同样的制程、同样的HBM显存、类似的互联方案,很容易在性能上追到七八成。英伟达真正的壁垒如果只是硬件,黄仁勋根本不需要焦虑成现在这样。

真正让他坐立不安的是:一旦硬件同质化,云厂商完全可以换别家的卡。这时候就必须靠网络、软件生态、集群调度这些“看不见的东西”来锁死客户。Mellanox贡献的除了InfiniBand的硬件,还有它在高性能网络领域积累的大量协议栈、驱动、调试工具,以及和Linux内核、HPC生态深度绑定的软件体系。这些代码层面的东西,是竞争对手短期很难补齐的。

2.3 怕数据中心方案被整体替换

很多非技术背景的人不理解,为什么云厂商买GPU还要看英伟达的脸色。原因是现在英伟达卖的不再是一张卡,而是一整套东西:GPU + NVLink + InfiniBand + CUDA + NCCL + 集群管理软件。你买了一万张H100,如果不用它的NVLink做卡间高速互联、不用InfiniBand做跨节点网络、不用NCCL做通信库,这堆卡根本发挥不出应有的性能。

表面上看你买的是硬件,实际上你买的是整个软硬一体化方案。这套方案的学习成本、运维成本、生态工具链全都绑定在英伟达的体系里。想换AMD的Instinct、谷歌的TPU,不是换一张卡那么简单,而是要连根拔起整个技术栈,重写通信逻辑、重配集群调度器、重新调优分布式训练框架。这个切换成本,比硬件采购成本高一个数量级。

黄仁勋怕的就是这个局面被人打破。而网络层又是这套体系里最容易被切入的一环——毕竟GPU和CUDA可以自研,但InfiniBand的可靠性、性能、生态是积累了二十年的东西,不是砸钱就能短期追平的。

3. 收购Mellanox之后,英伟达的棋局是怎么落的

3.1 NVLink与InfiniBand的配合

NVLink是英伟达自家的GPU间高速互联协议,带宽远高于PCIe,在单节点内可以实现高带宽低延迟通信。但NVLink有个天然限制——它是板级和机箱级的互联,跨服务器就够不着了。

收购Mellanox之前,跨服务器的GPU通信走的是以太网加RoCE(RDMA over Converged Ethernet)或专用HPC网络方案,性能和稳定性都不尽如人意。收购之后,英伟达把NVLink和InfiniBand做成了黄金搭档:机箱内用NVLink,机箱间用InfiniBand。两层互联都掌握在自己手里,整条数据通路没有短板。

这相当于一个快递公司,不仅管快递员的配送效率,还把驿站、干线物流、最后一公里的路全修完了。你想用别家快递,就得连路一起换,现实吗?

3.2 从GPU公司到数据中心全栈方案商

英伟达现在的产品线已经远超GPU本身。从Grace CPU(ARM架构)、BlueField DPU(数据处理单元)、InfiniBand网络、NVLink交换机,到CUDA、NCCL、Triton推理服务器、Megatron-LM训练框架,再到NVIDIA AI Enterprise软件订阅服务,覆盖了从芯片到框架到部署运维的每一层。

这种全栈策略带来的效果是可怕的。客户不需要自己在开源社区里东拼西凑,英伟达已经把所有组件帮你调试好,遇到问题一个工单就能解决。云厂商的TCO计算里,除了硬件采购成本,还包括工程团队的研发成本、系统调优成本、故障排查成本,这三项加起来往往超过硬件本身。全栈方案正是靠压低这三项成本来留住客户。

值得注意的是,英伟达并没有把宝全部押在InfiniBand上。2023年之后,它也推出了基于Spectrum-X的以太网方案,目标直指那些不想被InfiniBand绑死的云厂商和AI企业。这个动作非常有意思:既然你们怕绑定,我就做一个“兼容标准以太网”的高性能方案,用软件层优化把RoCE的短板补上。意图很明确——我没有给你叛逃的理由。

3.3 GB200带来的新联动

GB200是英伟达新一代芯片,单机柜内部的互联带宽进一步拉高,同时通过NVLink Switch把更多GPU组成一个逻辑上的巨型GPU。这种“超节点”概念对网络的要求更加苛刻,也强化了英伟达在互联层的话语权。

说白了,英伟达产品的演进路径是:单卡性能提升的边际收益越来越小(制程到头了,功耗墙在那里),但通过系统和网络把几千张卡组织起来,性能的倍增空间还很大。收购Mellanox就是为这条路径提前铺路。现在回看2019年的决策,几乎可以断定黄仁勋在当时就已经看清楚了AI计算的发展方向:未来不是比单卡算力,而是比整个数据中心算力,而数据中心算力的核心瓶颈就是网络。

4. CUDA护城河受到挑战的说法靠谱吗

热搜词里有个很有意思的话题:“英伟达最新发布的CUDA tile更新可能会终结其长期建立的软件护城河”。这话有些夸张,但确实点到了敏感处。

我想聊一个技术背景:CUDA的护城河分为两层。第一层是CUDA编程模型的普及度。全世界几百万开发者的第一门并行编程语就是CUDA,几乎所有深度学习框架(PyTorch、TensorFlow、JAX)的底层都调CUDA。这个生态壁垒极其坚固,因为它不是靠技术优势,而是靠用户习惯和长期积累。

第二层是CUDA的性能实现。英伟达不断更新cuBLAS、cuDNN、CUDA Graphs,把底层算子的性能压榨到极限。竞争对手很难在这些基础库上匹敌——不是因为他们写不出算法,而是因为他们拿不到英伟达硬件的底层细节,只能在黑盒模式下调优。

所谓“CUDA tile更新终结护城河”,实际指的是英伟达在CUDA里增加了更底层的编程原语,让开发者可以更低层次地控制GPU计算流程。表面上看这是“开放了更多底层能力”,听起来像是降低了门槛,实际上恰恰相反——开发者被教会用这些底层的精细控制手段之后,对CUDA的依赖只会更深,换平台的成本只会更高。

用一个不精确但容易理解的比喻:CUDA本来是一套自动挡汽车的驾驶培训体系,你现在把驾驶标准升级成赛车级的精细化踩油门、刹车力度控制培训。学员学完之后,只会开你这套培训体系的账,换牌子就掌握不了那种细腻的操控感。

所以我的判断是:CUDA tile这种更新不会终结护城河,反而是把护城河挖得更深了。这套路和收购Mellanox的逻辑一致——每多一个深度耦合的组件,客户的迁移成本就高一分。

5. 这笔收购对行业生态的影响

5.1 对手的追赶空间被进一步压缩

AMD的ROCm这些年一直在努力兼容CUDA生态,但效果有限。谷歌TPU走的是封闭自研路线,在自家体系内性能很强,但无法替代通用GPU的位置。国内厂商的AI芯片在算力指标上可以追近,但一上到大集群训练,网络和通信库的短板立刻暴露。

英伟达通过收购Mellanox,等于在对手最薄弱的通信层又加了一道保险。现在很多芯片厂商宣传自己的集群方案,几乎都会强调“兼容XX网络的通信库”,这个“兼容”本身就说明了生态位上的被动。

5.2 云厂商的处境与选择

AWS自研了Trainium和Inferentia芯片,谷歌有TPU,微软投资了OpenAI之后也在搞自研芯片。大家嘴上都说要“摆脱对英伟达的依赖”,但实际采购依然以英伟达为主。原因很简单:自研芯片的量产规模、软件生态、集群稳定性都还在路上,强行切换会让自己的客户体验打折扣。

但云厂商也没有坐以待毙。AWS在自家数据中心里大量使用EFA(Elastic Fabric Adapter),本质上是定制版网络方案;微软在Azure里整合了InfiniBand和自家的云网络方案。这些动作都指向同一个方向:把网络层的话语权从英伟达手里抢回来一部分。

从纯竞争角度看,这个博弈还在进行中。英伟达虽然在网络层占了先机,但网络是个比芯片更讲究生态兼容性的领域,InfiniBand在超算领域是王者,在通用云数据中心里依然面临大量的成本阻力和运维习惯阻力。

5.3 对普通从业者的启示

这件事给普通开发者和技术决策者的启示,我总结三点:

第一,做技术选型不能只看算力指标,还要看整个系统的可扩展性。很多团队买卡的时候只看单卡的TFLOPS,忽略了集群规模上去之后网络会成为瓶颈。预算是死的,网络方案的差距会导致同样的预算产出完全不同的训练效率。

第二,软件生态的价值往往被低估。英伟达真正的核心竞争力是把硬件、网络、软件、生态四位一体打包了,单看任何一环都有替代品,但合在一起就是没有替代品。个人开发者在学习技术栈的时候也要有这种“全链路”思维,不要只盯着单一技能点。

第三,关注基础设施层的机会。大模型时代,GPU的上游有光模块、PCB、铜缆、HBM存储,这些领域的机会并不比英伟达本身少。英伟达花130亿美元买网络平台这件事,本质上就是给整个AI基础设施赛道做了一次清晰的定价——网络的重要性,至少和芯片一样高。

6. 实操视角:我怎么理解英伟达这套网络方案的价值

评论区经常有人问,InfiniBand到底比以太网好在哪,值得花这么多钱?我用一个很具体的场景来回答。

假设你要做一次8卡DDP训练,模型参数70亿。每训练一步,8张卡之间要同步1.4GB的梯度数据。在单机内,NVLink的带宽是900GB/s(H100),同步一次只要1.5毫秒左右,这个速度几乎感觉不到通信开销。但如果换成8台机器,每台机器1张卡,跨节点的通信就要走网络。好一点的InfiniBand(NDR 400Gb/s)理论带宽是50GB/s,但因为协议开销和集群时延,实际同步一次要20毫秒以上。如果是普通万兆以太网,理论带宽只有1.25GB/s,一次梯度同步就得1.1秒,通信开销直接把训练效率拉垮到不忍直视。

这就是为什么大规模训练一定要投资网络。很多人只盯着GPU采购成本,忽略了一个简单的事实:如果网络拖后腿,再贵的GPU也是在烧电和折旧费。

从技术实操的角度,我自己在跑多机多卡训练时的经验是:优先选择InfiniBand做计算网络,存储网络单独走以太网,两块物理隔离,避免存储IO把计算网络打满。如果预算不够,至少要用25GbE以上的RoCE网络,并配齐PFC(优先级流控)和ECN(显式拥塞通知)机制,否则RoCE在高负载下很容易丢包,一旦丢包,性能衰减是以数量级计算的。

另外,NCCL的调优不是玄学。集群搭建后,先用NCCL的all_reduce_bench跑一遍真实的通信带宽数据,再根据结果调整网卡中断绑定、NUMA亲和性、协议选择这些参数。实测下来,合理的调优往往能让通信性能提升30%以上,这不比多花预算买卡省钱?英伟达收购Mellanox之后,把Mellanox的调优工具和NCCL做了深度集成,很多以前要手动配的参数现在可以一键完成,这就是这笔收购带来的实际生产力提升。

回看这套组合拳,黄仁勋怕的不是某个具体的竞争对手,而是怕整个数据中心计算的主线从GPU身上移开。只要未来几年的AI训练和推理都离不开高性能集群,而高性能集群又离不开GPU加高速网络的组合,英伟达的这套布局就会持续吃红利。130亿美元买的不只是一个网络平台,而是未来十年算力基础设施建设里的定价权。作为吃瓜的从业者,我们要做的就是看清楚这个技术演进的底层逻辑,想清楚自己在其中处于哪个位置,提前准备技能和资源的卡位。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询