声明:本文作为笔者个人备忘的文章,不喜勿喷。
AI算力时代,“内存墙”(Memory Wall)是比算力更关键的瓶颈。本文系统性梳理显存与内存的四大技术路线——DDR、GDDR、LPDDR、HBM 的带宽数据,并对比 NVIDIA 的 NVLink 与 PCIe 互连带宽,帮你建立一张完整的“数据搬运”全景图。
一、带宽计算基础
内存带宽的核心公式:
带宽(GB/s) = 每引脚数据率(Gbps) × 数据总线位宽(bit) ÷ 8
- DDR / LPDDR:64-bit(单通道)起算,双通道翻倍;
- GDDR:按整卡显存位宽(128/192/256/384/512-bit);
- HBM:单堆栈 1024-bit(HBM2/3/3E)或 2048-bit(HBM4),多堆栈并联。
二、系统内存 DDR 系列
| 代际 | 传输速率 | 单通道带宽 | 双通道带宽 | 发布年 |
|---|---|---|---|---|
| DDR3 | 800–2133 MT/s | 6.4–17 GB/s | 12.8–34.1 GB/s | 2007 |
| DDR4 | 1600–3200 MT/s | 12.8–25.6 GB/s | 25.6–51.2 GB/s | 2014 |
| DDR5 | 4800–8400 MT/s | 38.4–67.2 GB/s | 76.8–134.4 GB/s | 2021 |
要点:DDR4-3200 单条理论带宽 25.6 GB/s;DDR5-4800 起步 38.4 GB/s,相比 DDR4 带宽提升约 2.5–3 倍。DDR5 采用“双 32-bit 子通道 + 片内 ECC + PMIC”架构。
三、移动端低功耗 LPDDR 系列
| 代际 | 峰值速率 | 64-bit 带宽 |
|---|---|---|
| LPDDR4 | 4266 MT/s | 34.1 GB/s |
| LPDDR5 | 6400 MT/s | 51.2 GB/s |
| LPDDR5X | 8533–10667 MT/s | 68.2–85.3 GB/s |
要点:LPDDR5X 在 AI 数据中心若采用 16 条 32-bit 通道的多控制器配置,系统级理论带宽可达 384 GB/s(美光实测高于 DDR5 的 358 GB/s)。
四、显存 GDDR 系列(整卡带宽)
| 代际 | 单引脚速率 | 常见位宽 | 典型整卡带宽 | 代表 |
|---|---|---|---|---|
| GDDR5 | 8 Gbps | 256/384-bit | 256–384 GB/s | GTX 1000系 |
| GDDR6 | 16–20 Gbps | 192/256/384-bit | 336–768 GB/s | RTX 40主流 |
| GDDR6X | 19–21 Gbps | 384-bit | 672–1008 GB/s | RTX 4080/4090 |
| GDDR7 | 28–36 Gbps | 256/384/512-bit | 528–1792 GB/s | RTX 50系 |
实例(RTX 50系):RTX 5060:192-bit → 720 GB/s;RTX 5070:256-bit → 960 GB/s;RTX 5080:384-bit → 1440 GB/s;RTX 5090:512-bit → 1792 GB/s(满血旗舰)。
GDDR7 采用 PAM3 三电平调制(两个时钟传 3 bit),取代 GDDR6 的 NRZ,带宽较前代翻倍,并引入片内 ECC。
五、高带宽内存 HBM 系列(单堆栈带宽)
| 代际 | 发布年 | 接口位宽 | I/O速率 | 单堆栈带宽 | 典型整卡 |
|---|---|---|---|---|---|
| HBM2 | 2016 | 1024-bit | ~2.0 Gbps | ~256 GB/s | V100 ~900GB/s |
| HBM2E | 2019–2020 | 1024-bit | 3.2–3.6 Gbps | ~410–460 GB/s | A100 ~2.0TB/s |
| HBM3 | 2021–2022 | 1024-bit | 6.4 Gbps | ~819 GB/s | H100 ~3.35TB/s |
| HBM3E | 2023–2024 | 1024-bit | 9.2–9.6 Gbps | ~1.2 TB/s | H200 ~4.8TB/s |
| HBM4 | 2025 | 2048-bit | 8–11 Gbps | 2.0–2.8 TB/s | 下一代 |
技术本质:HBM 通过 TSV 硅通孔把多颗 DRAM 垂直堆叠,再用 1024/2048-bit 超宽接口实现单堆栈接近 1–3 TB/s 的带宽,代价是 2.5D/3D 先进封装(CoWoS)成本极高。
六、苹果 Mac 的统一内存方案
苹果桌面 Mac 采用统一内存架构:CPU、GPU、神经网络引擎共享同一块高带宽内存池(基于 LPDDR5X)。
| 机型/芯片 | 统一内存容量 | 内存带宽 |
|---|---|---|
| Mac mini M4 | 最高32GB | 约120 GB/s |
| Mac mini M4 Pro | 最高64GB | 273 GB/s |
| Mac mini M6 | 最高32GB | 153–170 GB/s |
| Mac mini M5 Pro | 最高64GB | 最高307 GB/s |
| Mac Studio M4 Max | 最高128GB | 410–546 GB/s |
| Mac Studio M3 Ultra | 最高256GB | 819 GB/s |
| Mac Studio M5 Ultra | 最高512GB | 1.2 TB/s |
要点:M5 Ultra 内存带宽 1.2 TB/s 已接近 HBM3E 单堆栈带宽,超大规模统一内存(512GB)+ 高带宽使其成为本地跑百亿级大模型的性价比选择。
七、NVIDIA Blackwell 架构
Blackwell 采用“双 Die Chiplet + 微缩放”设计:
| 维度 | Hopper H100 | Blackwell B200 |
|---|---|---|
| 工艺 | 台积电4N(单Die) | 台积电4NP(双Die合封) |
| 晶体管 | ~800亿 | 2080亿 |
| Die互联 | 无 | NV-HBI ~10TB/s |
| 显存 | HBM3 | 192GB HBM3E |
| 带宽 | 3.35TB/s | 8TB/s(Hopper的2.4倍) |
微缩放(Micro-scaling):第二代 Transformer 引擎支持 FP4 四比特精度,将内存支撑的模型规模提升 1 倍。产品矩阵:GPU芯片(B100/B200/B300)→ 超级芯片(GB200/GB300)→ 服务器(HGX)→ 整机(DGX)→ 机架超算(NVL72,机架总带宽 >13TB/s、FP4推理达1.4 exaFLOPS)。
八、数据搬运速率:NVLink vs PCIe
NVLink 各代(GPU↔GPU直连):NVLink 1.0 P100 ~160GB/s;2.0 V100 ~300GB/s;3.0 A100 ~600GB/s;4.0 H100 ~900GB/s;5.0 B200/GB200 1.8–3.6TB/s;6.0 Rubin 再翻倍。
PCIe 各代(x16):PCIe 3.0 x16单向16GB/s/双向32GB/s;4.0 32/64;5.0 64/128;6.0 128/256 GB/s。
对比结论:PCIe 5.0 x16 双向128 GB/s vs NVLink 5.0 3.6TB/s,差距约14–28倍;NVLink 延迟几ns远低于PCIe,且数据访问无需CPU中转,GPU直接互访。
九、数据搬运全景:三层金字塔
| 层级 | 技术 | 带宽量级 | 代表数值 |
|---|---|---|---|
| 片上存储 | HBM3E/HBM4 | TB/s级 | 1.2–2.8 TB/s |
| 片上存储 | GDDR7整卡 | 1–1.8 TB/s | RTX5090 1.79TB/s |
| 统一内存 | 苹果Mac | 0.1–1.2 TB/s | M5 Ultra 1.2TB/s |
| 计算单元互连 | NVLink5 | TB/s级 | 1.8–3.6TB/s |
| 系统总线 | PCIe 5.0/6.0 | 128–256GB/s | 0.13–0.26TB/s |
| 节点间网络 | InfiniBand | 12.5–100GB/s | NDR 50GB/s |
核心结论:
- 数据搬运呈金字塔三层:显存/内存(TB/s)> GPU互连 NVLink(TB/s)> 系统/网络(GB/s),跨设备搬运永远是最大瓶颈。
- H200 显存带宽4.8TB/s 远大于 NVLink 900GB/s,说明片内读取远比片间搬运快,算法要最大化数据复用。
- 大模型训练时调度器优先把高频通信的 GPU 放在同一 NVLink 域。
十、总结
| 类别 | 带宽范围 | 定位 |
|---|---|---|
| DDR3–DDR5 | 6–134 GB/s | 主流系统内存 |
| LPDDR5/5X | 34–85 GB/s | 移动/嵌入式 |
| GDDR5–GDDR7 | 256–1792 GB/s | 游戏/图形/边缘AI |
| HBM2–HBM4 | 256GB/s–2.8TB/s | AI训练/推理/超算 |
| NVLink | 160GB/s–3.6TB/s | GPU集群互连 |
| PCIe | 4–512 GB/s | 系统通用总线 |
从 DDR 到 HBM,从 PCIe 到 NVLink,每一次带宽跃迁都源于对“内存墙”与“数据搬运瓶颈”的突破。在 AI 算力时代,谁能把数据更快地送到计算单元,谁就掌握AI性能的制胜关键。