1. 这个说法到底从哪来的,为什么传播这么广
第一次听到"中国数据中心90%用博通交换机"这个说法,我的反应是:这个数字大概率是被简化甚至误传了。但作为一个在数据中心网络领域摸爬滚打多年的人,我完全理解为什么这个说法能传播得这么广——因为它抓住了一个真实存在的行业现象,只是在传播过程中被压缩成了一个过于绝对的结论。
先把话说清楚:这里的"博通交换机"其实有两层含义,一层是博通(Broadcom)的交换芯片,另一层是基于博通芯片方案做出来的白盒交换机。这两层含义经常被混在一起讲,导致很多讨论从一开始就跑偏了。博通本身并不直接卖整机交换机给最终用户(它主要卖芯片和参考设计),真正把交换机卖给数据中心的是思科、Arista、华为、新华三、锐捷、白盒厂商等等。但这些厂商的很多中高端交换机里,跑的都是博通的Trident、Tomahawk系列芯片。所以"90%用博通交换机"更准确的说法应该是:在数据中心的主流商用交换机里,博通芯片的出货占比非常高,尤其在高速率端口(25G/100G/400G)这一档。
那这个数字是怎么来的?我翻过不少第三方市场分析机构的报告,也跟做交换芯片的朋友聊过。大致的情况是:在全球范围内,商用交换芯片市场博通长期占据领先份额,这个份额在不同统计口径下从六成到八成不等。到了中国数据中心市场,由于国产芯片起步晚、生态积累薄,早期的高速交换机几乎清一色用博通芯片,所以"90%"这个数字在特定时期、特定速率段内并非完全空穴来风。但把它当成一个覆盖所有数据中心、所有速率、所有场景的铁律,就明显不严谨了。
这里有个关键点很多人忽略:交换芯片和交换机整机是两个市场。芯片市场集中度高,整机市场则分散得多。你在一个机房里看到华为的交换机、锐捷的交换机、白盒交换机混着用,它们可能用的是不同厂商的芯片,也可能都用博通。所以讨论"用了谁的交换机"之前,得先明确你问的是芯片还是整机。
我个人的判断是:这个说法之所以流行,是因为它精准戳中了行业的一个焦虑点——核心网络芯片的自主可控问题。大家关心的不是"90%"这个数字准不准,而是"如果这个数字是真的,那我们是不是被卡脖子了"。这个焦虑是真实的,也是值得认真讨论的。但讨论的前提是把事实理清楚,而不是被一个笼统的数字带着跑。
2. 拆开看:博通在数据中心网络里到底扮演什么角色
2.1 交换芯片为什么是数据中心的"心脏"
要理解博通的地位,得先明白交换芯片在数据中心里是干什么的。你可以把数据中心想象成一个超大型的物流枢纽,服务器是仓库,数据包是货物,交换机就是分拣中心,而交换芯片就是分拣中心里那台决定"这个包裹往哪个口送"的核心机器。这台机器的性能直接决定了整个枢纽的吞吐能力。
交换芯片的核心指标有几个:端口速率(现在主流是100G、400G,往800G走)、交换容量(Tbps级别)、转发时延(纳秒到微秒级)、缓存大小(影响突发流量的处理能力)、可编程性(能不能通过P4等语言自定义转发逻辑)。博通的Trident系列主打企业级和云数据中心的通用交换,Tomahawk系列主打超大规模数据中心的高密度高速交换,这两个系列基本覆盖了从几十G到800G的主流需求。
为什么大家愿意用博通?说白了就是成熟。它的芯片迭代节奏稳定,SDK(软件开发套件)完善,配套的参考设计齐全,下游厂商拿过来改改就能出产品。对于数据中心运营方来说,用博通芯片的交换机意味着风险低、生态好、遇到问题有地方查。这种"成熟度红利"是后来者很难在短时间内追上的。
2.2 白盒交换机浪潮把博通推到了台前
真正让"博通交换机"这个说法深入人心的,是白盒交换机的兴起。传统模式下,思科、华为这些厂商卖的是软硬一体的黑盒交换机,你买回去插上就能用,但软件和硬件绑死,价格也贵。后来 hyperscale 数据中心(就是那些超大规模云厂商)觉得这样不划算,于是推动了白盒模式:硬件用ODM厂商(如智邦、Celestica)基于博通芯片做的白盒,软件用开源的SONiC或者自研的NOS。
这个模式里,博通芯片成了事实上的标准硬件底座。因为白盒厂商自己没有芯片能力,只能选市面上最成熟、生态最好的方案,而博通正好符合。于是你在很多大型云数据中心里看到的白盒交换机,拆开一看,里面就是博通的Tomahawk。这也是"90%用博通"这个印象的重要来源——在超大规模数据中心这个特定场景里,博通芯片的占比确实非常高。
但要注意,白盒模式主要流行在互联网大厂和云厂商,传统行业数据中心(金融、政府、制造)还是以品牌交换机为主。所以"90%"这个数字,放在云数据中心可能接近,放在全口径的中国数据中心就明显高估了。
2.3 国产交换芯片现在走到哪一步了
说到自主可控,就绕不开国产交换芯片。国内做交换芯片的厂商这几年进步不小,在中低速率段(千兆、万兆)已经有比较成熟的产品,在25G/100G段也有量产案例。但客观讲,在最高速率段(400G/800G)和超大规模组网场景下,国产芯片和博通还有差距,这个差距主要体现在单芯片容量、SerDes性能、软件生态成熟度三个方面。
SerDes是交换芯片里负责高速信号收发的模块,可以理解为芯片的"嘴巴和耳朵",速率越高对SerDes的要求越苛刻。博通在这方面积累了很多年,国产芯片追赶需要时间。软件生态方面,博通的SDK和SAI(Switch Abstraction Interface)接口被大量NOS支持,国产芯片要融入这个生态,需要做大量适配工作。
不过我也要提醒一句:"用博通"不等于"不安全"。芯片是买来的商品,交换机是集成后的产品,数据中心的整体安全性取决于架构设计、运维管理、软件栈等多个层面,不是单看一颗芯片就能下结论的。把复杂问题简化成"用了谁的芯片就不安全",这种思维方式本身就不够专业。
3. 和AI到底有什么关系:算力集群把网络推到了C位
3.1 AI训练集群对网络的要求和传统数据中心完全不同
这才是这个话题真正有意思的地方。很多人以为AI就是GPU的事,网络只是配角。但在大规模AI训练里,网络的重要性被提到了前所未有的高度。原因很简单:AI训练是分布式并行计算,成千上万张GPU要频繁交换梯度数据,网络一旦成为瓶颈,GPU再强也得等着。
传统数据中心的东西向流量(服务器之间的流量)虽然也大,但模式相对温和,主要是存储访问和微服务调用。AI训练集群的流量模式完全不同:它是同步的、突发的、全互联的。每一轮迭代,所有GPU都要把自己的梯度发给其他GPU(AllReduce操作),这个过程中网络必须扛住瞬间的巨大流量,而且时延要极低。一旦某条链路拥塞,整个训练任务都会被拖慢。
这就对交换芯片提出了新要求:更高的端口密度、更低的时延、更好的拥塞控制能力、更强的可编程性。博通的Tomahawk系列之所以在AI集群里受欢迎,就是因为它在这些指标上表现均衡。尤其是Tomahawk 5这一代,单芯片容量做到51.2Tbps,支持800G端口,正好卡在AI集群从400G往800G升级的节点上。
3.2 组网架构的变化:从三层CLOS到Rail-Optimized
AI集群的网络架构也在变。传统数据中心用三层CLOS架构(接入-汇聚-核心),但AI集群更流行Rail-Optimized架构。简单说,就是把同一台服务器上的多张GPU网卡,分别接到不同的交换机上,让每张网卡走独立的路径,避免单点拥塞。这种架构对交换机的端口密度和布线复杂度要求更高,也进一步推高了对高性能交换芯片的需求。
还有一个趋势是**RDMA over Converged Ethernet(RoCE)**的普及。RDMA让网卡可以直接访问远端内存,绕过CPU,大幅降低时延。但RDMA对网络的无丢包要求极高,需要交换机支持PFC(优先级流控)和ECN(显式拥塞通知)。这些功能对交换芯片的实现质量要求很高,博通在这方面的成熟度是它的一大优势。
3.3 为什么AI热潮让"博通交换机"话题重新火起来
AI大模型训练需要建大量GPU集群,每个集群都要配套高速网络。这直接拉动了高速交换机的需求,而高速交换机里博通芯片占比高,于是"数据中心用博通交换机"这个话题就被AI热潮重新带火了。本质上,大家关心的不是交换机本身,而是AI算力基础设施的供应链安全问题。
我个人的观察是:AI确实给国产交换芯片提供了一个难得的窗口期。因为AI集群的组网需求还在快速演化,没有形成像传统数据中心那样固化的标准,这给了后来者切入的机会。国内一些厂商已经在针对AI场景做定制化的交换芯片和组网方案,虽然起步晚,但方向是对的。
4. 实测视角:一个AI集群网络选型的真实考量
4.1 选型时我实际会看哪几个维度
假设现在要为一个中等规模的AI训练集群(比如512张GPU)选交换机,我会从这几个维度去评估,而不是简单看"是不是博通":
| 评估维度 | 具体关注点 | 为什么重要 |
|---|---|---|
| 端口速率与密度 | 400G/800G端口数,单U密度 | 决定布线复杂度和机柜空间 |
| 转发时延 | 端口到端口时延,拥塞时延抖动 | AI训练对时延敏感,抖动大会拖慢同步 |
| 缓存能力 | 共享缓存大小,动态阈值调优 | 吸收突发流量,减少丢包 |
| 可编程性 | 是否支持P4/SAI,能否自定义 | 适配不同AI框架的通信模式 |
| 生态成熟度 | NOS支持情况,社区活跃度 | 出问题能不能快速找到方案 |
| 供应链 | 供货周期,长期支持承诺 | 大规模部署最怕断供 |
这张表里,博通方案在"生态成熟度"和"可编程性"上通常得分高,但在"供应链"这一项上,如果项目有自主可控要求,就需要额外评估。我的经验是:不要为了自主可控而自主可控,也不要为了成熟而放弃可控,关键看你的业务对哪一项更敏感。
4.2 一个容易踩的坑:芯片能力不等于整机能力
我见过不少项目,选型时只盯着芯片参数看,结果整机买回来发现散热不行、风扇噪音大、管理软件难用。交换芯片再强,也要靠整机厂商把它做好。同样是博通Tomahawk芯片,不同厂商做出来的交换机在散热设计、电源冗余、管理接口、软件稳定性上差别很大。
所以我的建议是:芯片选型定方向,整机选型定成败。先确定用哪个档次的芯片方案,然后在基于这个方案的整机里挑口碑好、服务好的厂商。别被"用了博通芯片"这个标签忽悠,标签背后的工程实现才是关键。
4.3 运维阶段真正让人头疼的事
交换机上线只是开始,运维才是长期考验。AI集群的网络运维有几个特殊难点:一是故障定位难,因为流量模式复杂,一个训练变慢可能是网络问题,也可能是GPU问题、存储问题,需要端到端排查;二是配置变更风险高,AI集群网络配置往往很复杂,改错一个参数可能影响整个集群;三是升级窗口难找,训练任务动辄跑几天,很难找到停机窗口做网络升级。
这些难点跟用谁的芯片关系不大,更多是运维体系和工具链的问题。我个人的做法是:在集群建设初期就把监控和自动化做扎实,比如用Telemetry采集细粒度的端口和队列数据,用自动化工具做配置管理和变更审计。这些投入在后期会省下大量排查时间。
5. 关于"90%"这个数字,我的几点个人判断
5.1 数字本身不重要,重要的是它反映的趋势
纠结"90%"准不准意义不大,因为不同统计口径能得出完全不同的数字。如果只统计云数据中心的100G以上高速端口,博通占比可能确实很高;如果把所有数据中心、所有速率段都算上,国产芯片和品牌自研芯片的占比会明显上升。这个数字真正的价值在于提醒我们:在高速交换芯片这个关键环节,国产化还有很长的路要走。
5.2 国产替代不是简单的"换芯片"
很多人以为国产替代就是把博通芯片换成国产芯片,其他不变。实际远没这么简单。换芯片意味着换SDK、换驱动、换NOS适配、换运维工具,整个软件栈都要重新验证。而且国产芯片在某些功能上可能还不支持,需要业务侧做妥协。这是一个系统工程,需要芯片厂商、整机厂商、软件厂商、用户一起磨合。
我参与过几个国产交换机的测试项目,感受最深的是:硬件指标追上来相对快,软件生态追上来慢得多。一颗芯片流片成功只是第一步,让它被主流NOS支持、被运维工具识别、被工程师熟悉,需要几年时间。所以国产替代要有耐心,不能指望一蹴而就。
5.3 对从业者来说,这意味着什么
对做数据中心网络的人来说,这个话题的现实意义是:你需要同时懂博通生态和国产生态。只懂博通,未来可能面临项目受限;只懂国产,可能在某些高性能场景下搞不定。最稳妥的做法是保持技术中立,把交换芯片的底层原理搞透,这样不管上面跑的是谁的芯片,你都能快速上手。
我自己的学习路径是:先搞懂以太网交换的基本原理(MAC学习、VLAN、STP、路由),再研究具体芯片的实现差异(缓存架构、调度算法、可编程流水线),最后才是具体厂商的配置命令。原理通了,命令只是查手册的事。
6. 如果你要深入这个话题,可以这样入手
6.1 从抓包和看计数器开始建立直觉
想真正理解交换芯片在干什么,最直接的办法是抓包和看计数器。找一台支持Telemetry的交换机,把端口计数器、队列计数器、缓存使用率这些数据采出来,对照着实际流量看。你会直观地看到:什么时候缓存被打满、什么时候队列开始丢包、拥塞是怎么形成的。这些直觉比看一百篇分析文章都有用。
具体操作上,可以用gNMI/gRPC把Telemetry数据推到监控系统,用Grafana做可视化。重点看这几个指标:out_discards(出方向丢包)、queue_depth(队列深度)、buffer_utilization(缓存利用率)。当out_discards开始上涨,说明网络已经出现拥塞,需要排查是带宽不够还是流量模式有问题。
6.2 用开源NOS练手,理解软硬解耦
如果想理解白盒交换机和博通芯片的关系,可以找一台支持SONiC的白盒交换机练手。SONiC是开源的网络操作系统,跑在博通芯片的白盒上,你能看到SAI接口是怎么把上层应用和底层芯片解耦的。这个过程能帮你理解为什么博通芯片生态好——因为它的SAI实现成熟,SONiC社区支持完善。
练手时可以从简单的配置开始:配VLAN、配路由、配ACL,然后逐步深入到QoS、PFC、ECN这些高级功能。每配一个功能,都去看看底层芯片是怎么实现的,这样能把抽象配置和硬件行为对应起来。
6.3 关注AI网络的前沿组网方案
AI集群网络是当前变化最快的领域,值得持续关注。几个方向:Ultra Ethernet(超以太网联盟推动的新一代以太网标准,针对AI优化)、UALink(GPU互联的新标准)、光交换(用光路交换替代部分电交换,降低时延和功耗)。这些方案背后都涉及交换芯片的演进,理解它们能帮你判断未来几年网络设备的技术走向。
我个人的习惯是:每季度花点时间读一读相关标准组织的公开文档和头部厂商的技术白皮书,不用读太细,重点是建立对技术趋势的感知。这样在项目选型时,你能判断一个方案是"过渡方案"还是"未来方向"。
说到底,"中国数据中心90%用博通交换机"这个说法,与其说是一个事实陈述,不如说是一个行业情绪的出口。它背后是大家对AI算力基础设施供应链的关切,对国产芯片进展的期待,以及对技术自主的焦虑。作为从业者,我们能做的是把事实搞清楚,把技术搞扎实,在具体项目里做出理性的选型判断。芯片会迭代,架构会演化,但把网络原理搞透这件事,永远不会过时。