Marvell发布260通道PCIe 6.0交换机,重塑AI数据中心Scale-up基础设施
2026/8/27 2:17:46 网站建设 项目流程

Marvell 这波消息,说实话我听到第一反应是"终于来了"。AI 数据中心这两年最热闹的词已经从单纯的 Scale-out 横向扩展,切到了 Scale-up 纵向互联,而 PCIe 交换机恰恰是这条赛道上最容易被忽视、又最关键的底层设施。Marvell 发布业界首款 260 通道 PCIe 6.0 交换芯片,目标直指 AI 数据中心的 Scale-up 基础设施,这件事值得所有做大模型训练、GPU 服务器、存储池化的工程师认真看一看。

这篇文章我会把几件事讲透:Scale-up 和 Scale-out 到底怎么分工,PCIe 6.0 这次升级带来的技术变化有多大,260 通道意味着多少真实带宽,它能用在哪些典型场景里,以及我们在实际工程落地时会踩到哪些坑。这个话题适合 AI 基础设施工程师、数据中心架构师、服务器硬件研发和做系统集成的朋友,对刚入门想理解下一代服务器内部互联的人同样友好。

1. AI 数据中心的 Scale-up,到底在扩什么

1.1 Scale-up 和 Scale-out:两个方向,一套逻辑

过去十几年,互联网行业谈扩展基本都是 Scale-out。业务量上来了,往机柜里加服务器,用负载均衡把流量分散到更多节点上。这是横向扩展的逻辑:靠网络把一堆独立的设备串起来,整体能力随节点数量线性增长。

Scale-up 的路子是反过来的。它不追求堆节点,而是把一个计算单元内部的资源做厚做强。比如一台服务器里挂四块 GPU、八块 GPU、十六块 GPU,让 CPU、GPU、内存之间形成一个紧密耦合的计算域。这个方向的驱动力来自 AI 训练负载的特殊性。

大模型训练有个很核心的现象:每一次迭代,所有参与计算的 GPU 都要做梯度同步。假设训练一个千亿参数的模型,模型状态和梯度加起来可能有几十 GB,每训练一步就要把这些数据在所有 GPU 之间过一遍。这一步的通信效率直接决定训练速度。如果把这些 GPU 分散到多台服务器上通过以太网通信,单次同步延时会高到让 GPU 被迫在每步之间空等;如果把它们塞进一个高速互连的域里,通信延迟和带宽就能压到可以接受的水平。

所以 AI 数据中心的两层结构越来越清晰:Scale-up 负责在一个超节点内部把计算资源焊在一起,Scale-out 负责把这些超节点连接成更大的集群。过去大家讨论 InfiniBand、RoCE 谈得很多,那属于 Scale-out 的范畴;而 Scale-up 这一层,很长一段时间都被 NVIDIA 的 NVLink 生态主导,开放生态的玩家一直在找突破口,PCIe 交换机就是那个突破口之一。

1.2 PCIe 交换机:把"内部总线"变成"内部网络"

很多人对 PCIe 的理解还停留在主板上那些长条插槽上——插显卡、插固态盘。实际上 PCIe 从物理形态上虽然像总线,但它的协议本质是一种基于数据包的串行互连。只不过传统的 PCIe 拓扑受限于 CPU 根复合体,一个 CPU 有几组根端口,直接连几个设备,设备的数量很快就被通道数卡死了。

PCIe 交换机的角色,就是在这中间加一层转发网。它的工作原理类似于交换机在以太网里的作用:CPU 不需要亲自持有所有设备的通道,设备通过 PCIe 交换机接入,交换机根据地址信息在任意两个端口之间转发数据包。这就把 PCIe 从一个"CPU 直连外设"的限制性拓扑,解放成一张真正的内部交换网络。

在 AI 服务器场景里,这个能力特别关键。一个 CPU 通常只有几十条 PCIe 通道,撑死挂上两三个 GPU 加一两块网卡。但一个 AI 计算域可能要同时挂八块 GPU、一大批 NVMe、高带宽网卡、内存扩展设备。如果没有 PCIe 交换机,CPU 的通道资源根本不够用。

Marvell 这次发布的 260 通道 PCIe 6.0 交换机,等于把一个 AI 超节点内部的可连接设备数量放大了好几个数量级。260 条通道如果按 x16 拆分,差不多能提供 16 个满速端口,这意味着 16 个加速器或存储设备可以同时全速通信。这个级别的交换能力,以前在开放生态里是很难想象的。

2. 260 通道 PCIe 6.0 的核心参数拆解

2.1 PCIe 6.0 的技术亮点全在这里

PCIe 6.0 最大的变化是传输速率从 PCIe 5.0 的 32 GT/s 翻倍到了 64 GT/s。这个"翻倍"不是一个简单的数字游戏,背后是信号调制方式的根本性变革。

PCIe 5.0 及之前的版本都用 NRZ 信号,一个符号传输 1 比特,靠电平高低区分 0 和 1。到了 6.0 这个速率,如果继续用 NRZ,信号频率会高到让 PCB 走线几乎无法承受,眼图会完全闭合。所以 PCIe 6.0 换成了 PAM4 调制,用四个电平(00、01、10、11)表示 2 比特。四个电平让单个符号携带的信息翻倍,符号速率不需要继续翻倍,就能把数据速率从 32 GT/s 推到 64 GT/s。

PAM4 不是免费的午餐。四个电平之间的电压差变小了,同样的噪声和串扰下更容易出错。所以 PCIe 6.0 引入了轻量级 FEC 前向纠错,还加了循环冗余校验机制。FEC 的作用是接收端发现错误后可以本地纠正,不需要重传,对降低误码率很有帮助;付出的代价是增加了几纳秒的延迟和部分带宽开销。

编码层面,PCIe 6.0 继续沿用 128b/130b 编码,这意味着 64 GT/s 原始速率里,实际有效数据速率要乘一个 128/130 的效率系数。单条通道的有效速率大约是 63 Gbit/s,除以 8 之后单通道单向约 7.88 GB/s。相比 PCIe 5.0 单通道 3.94 GB/s,正好翻了一倍。

2.2 260 条通道的带宽该怎么算

260 条通道是这个产品最有冲击力的数字,也是最容易被误读的数字。我第一次看到的时候先算了一笔账:

单通道有效速率约 7.88 GB/s,260 条通道单向总带宽就是 260 × 7.88 GB/s,大约 2.05 TB/s。如果算全双工双向,就是约 4.1 TB/s。这个带宽量级是什么概念呢?一块 PCIe 5.0 x16 的 GPU 双向只有约 126 GB/s,PCIe 6.0 x16 的双向带宽能到 252 GB/s。一个 260 通道的交换机理论上可以同时动态组织这些端口,让几十个设备在一个域里全速交换数据。

260 这个数字还有一个很巧妙的工程意义。常见的 PCIe 端口位宽是 x4、x8、x16,260 = 16 × 16 + 4。也就是说,这颗芯片很自然的就可以拆成 16 个满速 x16 端口,再留 4 条通道做管理路径或辅助连接。这种规整的通道分配在芯片封装层面更容易做引脚排布和信号布线,也方便系统厂商按标准端口设计主板。

需要注意,交换机标称的 260 通道是总吞吐能力,实际能同时跑多快取决于端口配置和流量模型。比如全部配置成下行端口时,所有下行设备共享上行带宽,除非上行链路也有足够的根端口承接。更常见的做法是分配一部分端口做上行,一部分做下行,形成树状或网状拓扑。所以衡量这颗芯片的能力,不光是看带宽总和,还要看端口灵活性和交换矩阵的满配置吞吐能力。

2.3 为什么 Marvell 选择 260 这个档位

关于通道数,还有一个产业视角的问题:市场上不是没有 PCIe 6.0 交换芯片,为什么 Marvell 说自己是"业界首个 260 通道"?

PCIe 交换芯片实现 260 通道的难度,主要在芯片面积、封装引脚和功耗三者之间找平衡。通道越多,SerDes 单元就越多,芯片面积和功耗同步上涨。260 通道意味着芯片上要集成 260 个高速收发器,每个收发器还要跑 PAM4 和 FEC 处理逻辑,这对设计团队和工艺选择都是硬挑战。

从市场需求看,AI Scale-up 场景需要高端口密度的交换芯片。上一代主流 PCIe 5.0 交换机很多停留在 x48 或 x64 通道级别,挂四到八个 GPU 就撑死了。但要组建 16 卡、32 卡的 AI 计算域,交换芯片必须具备 128 通道以上的能力,并且向上要能扩展到 256 以上。260 通道正好卡在"16 个 x16 端口"这个甜点上,对齐了 8 卡和 16 卡的典型 AI 服务器配置。

同时也合理推测,260 通道的设计考虑到了 CXL 的延伸需求。CXL 3.x 的物理层和 PCIe 6.0 同源,未来这颗芯片如果支持 CXL 协议模式,260 通道能同时承担加速器互连和内存池化的负载。这从产品生命周期的角度看,比单纯只做 PCIe 交换更有价值。

3. 这颗交换芯片能做什么:三个典型场景

3.1 GPU 资源池化,让每块卡都不闲着

GPU 资源池化是 AI 数据中心降本增效的大趋势,也是 PCIe 交换机最直接的应用场景。

传统的 GPU 服务器配置是"一台物理机对应固定数量的 GPU",GPU 通过主板或专用的扩展板直连 CPU。问题在于 GPU 利用率是不均匀的:训练任务把 GPU 吃满,推理任务可能只用到一半,有的业务甚至只是偶然需要 GPU。如果 GPU 是物理绑定的,就很难在多个业务之间动态调度。

引入 PCIe 交换机后,GPU 可以不固定在某个 CPU 上,而是挂到交换机上形成一个资源池。多台主机通过各自的上行端口连接交换机,按需申请 GPU 资源。任务结束,GPU 释放回池子,下一个任务可以立即接管。这个思路在推理场景尤其有价值,因为推理服务通常有波峰波谷,资源池化能显著提高 GPU 的平均利用率。

PCIe 6.0 的高带宽让这种方式变得可行。之前用 PCIe 5.0 做池化,单 GPU 的带宽瓶颈比较明显;现在 PCIe 6.0 x16 能提供 252 GB/s 的双向带宽,这对推理和多数训练场景已经足够,CPU 和 GPU 之间通信不会成为主要矛盾。

3.2 内存扩展和异构加速器解耦

AI 场景还有一个被忽视的痛点:内存容量和带宽不够。单个 GPU 的显存容量有限,当模型规模超过单卡显存时,要么模型并行切分,要么引入统一内存。PCIe/CXL 交换机正好是解决内存池化的重要手段。

CXL 协议允许 CPU 和加速器访问共享内存池,PCIe 6.0 的物理层是 CXL 3.x 的基础。260 通道交换机如果支持 CXL over PCIe,就能构建一个跨多主机的内存池。比如训练任务需要 1TB 内存,但单台机器只有 512GB,通过内存池化,另一台服务器的内存也能被访问,扩展内存不需要改动应用逻辑。

这块对高性能计算和大规模图计算尤其有意义。传统方式中数据要从内存搬到另一台机器的存储系统,协议开销大、延迟高;内存池化让所有计算节点像访问本地内存一样访问共享内存,带宽和延迟都大幅改善。

3.3 支持开放的超节点式 Scale-up 拓扑

Scale-up 超节点的讨论是当前 AI 网络最热的题。一个超节点内包含几十个加速器,它们需要在一个低延迟、高带宽的域内紧密协作。NVIDIA 用 NVLink 和 NVSwitch 构建了自己的超节点;开放生态这边的思路,则更多依赖 PCIe 交换和 UALink 这样的联合标准。

Marvell 的 260 通道 PCIe 6.0 交换机,等于给了开放生态一个能真正撑起超节点规模的硬件支撑。它可以把多 GPU 直接通过 PCIe 交换互联,不需要经过以太网,也不依赖封闭的私有协议。这对做国产化 AI 服务器、或者想摆脱单一供应商绑定的团队来说,是很有吸引力的方案。

具体到部署,可以设计成 16 个节点的计算域:每台节点占一个 x16 端口,上行连到交换机,节点之间跨交换通信,做梯度同步和数据交换。相比走以太网,这个方案延迟低得多;相比走私有协议,它又是标准产品,采购和运维的灵活性都更好。

4. 对产业格局和服务器设计的影响

4.1 和 NVLink、Broadcom PEX 摆在一起看

Marvell 这枚芯片的发布,放在产业格局里看很有意思。

NVIDIA 的 NVLink 是目前 AI Scale-up 的事实标准,带宽确实做得很高,但它是封闭的,只有 NVIDIA GPU 能接入。AI 数据中心一旦选了 NVLink,等于绑定了 NVIDIA 的整机方案。很多大型云厂商都有动力扶持开放生态来打破这种绑定,PCIe 交换这类通用标准器件就是最自然的抓手。

在 PCIe 交换这个细分领域,Broadcom 的 PEX 系列一直是老牌玩家,在存储和服务器市场占有率很高。Marvell 这次抢在 PCIe 6.0 时间点上放大端口密度到 260,等于向市场喊了一个最强音:在 AI Scale-up 这个新战场,我不只做存储连接的交换芯片,我要做整个 AI 超节点的底座。

从时间点看,PCIe 5.0 交换芯片在数据中心刚刚铺开,Marvell 直接推进到 PCIe 6.0 260 通道,这个代差能形成一段产品空窗期。对系统厂商来说,如果现在规划下一代 AI 服务器,直接基于 Gen6 设计可以避免一年后又升级一轮的痛苦,这也是发布节点卡得很准的原因。

4.2 这枚"世界首发"会给系统设计带来什么

从服务器设计角度看,260 通道 PCIe 6.0 交换机带来的连锁反应比想象中更复杂。

第一,主板上必须预留大量高速走线空间。260 条通道如果全走 PCB 表层,会占掉相当大的板面积,而且 64 GT/s 速率下对走线长度和过孔残桩的要求非常苛刻。系统设计基本要采用链路预算法,在交换芯片和终端设备之间规划好走线长度,超过阈值就必须加 retimer 或 redriver。

第二,端口速率上去了,连接器标准也在升级。PCIe 6.0 对应的连接器需要在更高速率下保持信号完整性,普通的 PCIe 5.0 连接器是否能用是个问题。很多高端系统可能会转向专门设计的背板连接器,比如加高型连接器。这部分成本会传导到整体服务器造价上。

第三,散热问题不容忽视。260 通道的交换芯片集成了大量高速 SerDes,功耗一定不低。我判断整颗芯片的功耗会在百瓦级别,散热量接近一颗中高端 CPU。系统设计需要给它安排独立散热器、合理风道,甚至可能影响机箱的尺寸和布局。这不是简单换颗芯片的事,整套机械和热设计都要跟着变。

5. 我在工程上会重点盯的坑

5.1 信号完整性:Gen6 不是开玩笑的

PCIe 6.0 的 PAM4 信号对链路损耗极其敏感。同样一段 PCB 走线,在 PCIe 5.0 上可能没问题,换到 6.0 速率眼图就会闭合。工程上的第一原则是:设计阶段必须做完整的链路仿真,而不是等板子打回来再调。

实测中我发现最容易出问题的点有三个:PCIe 走线跨层换层时的过孔残桩、连接器附近阻抗不连续、以及多通道并行时的串扰叠加。64 GT/s 下这些问题的劣化效应会被放大,严重时会出现链路训练失败,或者设备协商到低速模式。规避方法包括:选择低损耗板材、缩短走线、使用背钻工艺、预留 retimer 位置。

5.2 功耗与散热:面积和风道冲突

很多团队在新设计里只关注了带宽提升,对功耗预估不足。PCIe 6.0 交换芯片的功耗相比 Gen5 会有明显跃升,PAM4 的 DFE 和 FEC 逻辑都是耗电大户。如果系统原本按 PCIe 5.0 的功耗预算设计,上 Gen6 后可能会过热。

我能给的经验是,前期规划时把功耗余量放大 20% 到 30%。散热设计要考虑到交换芯片临近大量高速走线,不能用太厚的散热器把风道堵死,必要时要做导风罩或增加静压风机。更重要的是,要实时检测交换芯片的温度并把降频策略做好,防止极端工况下芯片掉速影响业务。

5.3 向后兼容和生态成熟度:别当好高骛远的图纸党

PCIe 标准是向后兼容的,Gen6 插槽可以跑 Gen5 设备,但我们要清醒认识到一个现实:目前许多 CPU 和 GPU 的 PCIe 控制器还停留在 Gen5,原生 Gen6 的加速器端口还没大规模铺开。这意味着即使买了 260 通道 Gen6 交换芯片,短期内连接的可能还是大量 Gen5 设备,跑在 Gen5 速率上。

这不是说芯片不值得买,而是提醒我们在规划系统时要算清楚性能账。如果所有终端设备都是 Gen5,交换芯片的 Gen6 能力就吃不满,投资回报率存疑。稳妥的策略是分阶段演进:先在交换层面支持 Gen6,终端设备逐步升级,同时保证端口的自适应协商能力做得好,这样新老设备能混跑不翻车。

另外,PCIe 交换机不是装上就能跑,固件配置、端口分组、QoS 策略都要花时间调。我建议小规模验证时就把链路训练时间、错误重传次数、FEC 纠错率这些指标监控起来,这些数据最能反映整个链路是否健康。

5.4 延迟和业务适配:高带宽不自动等于高性能

最后一个容易被忽视的坑是延迟。PCIe 6.0 引入 FEC 后,链路的误码率降低了,但 FEC 处理本身会带来额外的延迟开销。虽然这个延迟通常是纳秒级,对多数场景无感,但在对延迟极其敏感的通信同步场景,还是要做实测评估。

另外,PCIe 交换机本质上是一个存储转发和路由设备,引入交换层级会增加端到端延迟。AI 训练中的 NCCL 通信如果走 PCIe 交换,需要确认通信库对长距离 PCIe 拓扑的优化情况。我在实际调优中发现,相同硬件条件下,通信库是否感知交换拓扑,性能差距可能高达两位数百分比。这部分不能只看交换机规格,要和软件栈一起做整体调优。

从我这几年做 GPU 服务器互连和 AI 算力集群的经验来看,PCIe 在 Scale-up 领域的价值正被重新定义。Marvell 这颗 260 通道 PCIe 6.0 交换机最大的意义,不只是把单芯片带宽拉高了一个量级,而是证明了一条比私有封闭方案更开放、更通用的 Scale-up 路径可以走通。对很多不想被单一供应商绑死的团队来说,这是值得认真评估的技术路线。如果真的准备用这类芯片做下一代方案,我的建议是尽早和芯片原厂拿到参考设计,把信号完整性仿真和散热验证提前到原理图阶段,别等板卡打样回来再去解决物理层的各种问题。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询