全球 AI 算力军备竞赛中,电力正在取代芯片,成为最稀缺的资源。“马斯克:2027 年约 15GW 算力无法启用”这类判断之所以被反复讨论,不是因为 GPU 产能不足,而是因为算力集群建设完成后,电网接入容量、变电站、变压器、柴油发电机和冷却系统没有同步就位,导致价值不菲的设备只能放在机房里等待供电。大模型训练、推理 token 生成、数据预处理,说到底都会变成 GPU 的负载,而 GPU 负载最终会变成机房的电费单。下文不评价任何公司或个人的预测,而是从工程角度拆解“算力无法启用”这个现象:15GW 到底是什么概念,GPU 集群的功耗怎么算,电力链路哪里最容易断,以及如何提前发现和规避这类问题。
1. 15GW 是什么?先理解算力与电力的换算关系
1.1 为什么一个算力话题会用到 GW 这样的电力单位
讨论“15GW 算力”时,GW 并不是算力单位,而是功率单位。1GW 等于十亿瓦,也就是 1000MW。算力通常用每秒浮点运算次数衡量,比如 PFLOPS、EFLOPS,但项目从规划阶段开始,团队之间沟通用的往往是功率:某个数据中心能接入多少兆瓦市电,某个机柜能提供多少千瓦容量,某个 GPU 满载时功耗是多少瓦。
这会让人觉得奇怪:为什么算力规模要用电力容量表述?其实原因很直接:一台 GPU 服务器无论是用来训练大模型,还是对外提供 token 生成服务,最终都会变成热量,都必须由电力系统供给、由制冷系统带走。芯片性能可以用不同的算力单位描述,但机房的变压器、UPS、PDU、空调和供电局给的接入容量只认功率。功率不足,算力就是纸面数字。所以当新闻说“15GW 算力无法启用”时,技术含义是“约 15GW 电力容量对应的算力设施,因为供电或配套原因无法通电投入运行”。
1.2 从设备到货到算力可用的完整链路
一台 GPU 服务器到货后,距离真正对外提供算力还要经历一串环节:到货验收、拆箱检查、上架安装、光纤接入、交换机配置、存储挂载、操作系统部署、驱动安装、容器或调度平台接入、通电自检、满载压测、业务接入。这里面的任何一环都可能阻塞,但最容易出现“卡住不动”的环节通常是通电运行之前。
以一次真实的上线流程为例,顺序大致如下:
- 确认机柜位置、承重和网络端口;
- 确认机柜 PDU 额定电流和可用插口;
- 将服务器固定在导轨上,连接电源线、网线和信号线;
- 合上 PDU 对应断路器,观察服务器电源状态;
- 启动服务器,进入 BMC 或系统日志确认没有电源告警;
- 安装驱动后,用加压工具让 GPU 负载逐步上升,观察温度和功耗曲线。
“算力无法启用”往往不是停在真机测试环节,而是更早:要么机柜里根本没有足够的电力余量,要么整层配电间负载已经接近上限,要么电网近期无法增容。许多设备即使已经开箱上架,也只能保持“待电”状态。
1.3 算力可用的四重约束:电力、散热、网络、空间
一个机柜内单台 GPU 服务器能否稳定运行,至少受四个约束同时限制:电力、散热、网络、空间。电力解决“有没有能量输入”,散热解决“能量能否及时排出”,网络解决“数据能否进得来、参数能否出得去”,空间解决“物理设备能不能放进去、承重是否足够”。四个约束缺一不可。
规划阶段最常犯的错误是只算 GPU 卡功耗,忽略电力和其他约束的联动。比如一个机柜设计功率为 40kW,但空调送风能力只能带走 25kW 热量,那么实际可用的算力上限就是 25kW 对应的设备数量,而不是 40kW 对应的数量。电力容量足够但冷却不足,同样会让 GPU 因温度过高降频甚至关机。因此,后续功率估算要从整柜维度计算,而不是只看单卡。
2. 算力集群的真实功耗:从芯片 TDP 到整柜功率
2.1 用 nvidia-smi 查看 GPU 真实功率
规划功耗前,先要能拿到实际数据。对于 NVIDIA GPU,最直接的工具是nvidia-smi。下面这条命令会列出每张 GPU 的索引、型号、当前功耗和功耗上限:
nvidia-smi --query-gpu=index,name,power.draw,power.limit --format=csv输出示例类似:
0, NVIDIA H100 80GB HBM3, 62.50 W, 700.00 W 1, NVIDIA H100 80GB HBM3, 700.00 W, 700.00 Wpower.draw是当前实时功耗,power.limit是驱动允许的最大功耗。满载跑大模型训练时,power.draw 会快速逼近 power.limit;空闲时只有几十瓦。查看多卡服务器时,可以用循环把每一张卡的数据打印出来,但注意不要在同一时刻执行太频繁的查询,否则查询本身会占用少量 CPU。
如果要持续观察 GPU 功耗和温度变化,可以使用nvidia-smi dmon,它类似 top 命令,每秒刷新一组 GPU 状态,适合在启动训练任务时观察功率和温度曲线。
nvidia-smi dmon -s p -d 5这条命令以 5 秒为间隔显示功耗信息,-s p表示只显示功率相关列。
2.2 常用 GPU 设备的功耗参考
不同 GPU 的最大功耗差异很大。下面是常见的参考值,实际以具体厂商 SKU 和散热设计为准。
| 设备 | 典型最大功耗 | 适用场景 |
|---|---|---|
| RTX 4090 | 450W | 桌面开发、中小规模推理 |
| L40S | 350W | 推理、中小训练 |
| H100 SXM | 700W | 大规模训练 |
| H200 SXM | 约 700W | H100 升级平台 |
| GB200 NVL72 整柜 | 120kW 至 132kW | 超大规模训练,液冷整柜 |
有些设备会支持动态功率管理,功耗上限可以通过软件调整。比如部分 H100 可以限制power.limit到 500W 或 600W,牺牲少量性能来降低散热压力和电费。在做容量规划时,不能只看峰值参数,还要看实际工作负载下的长期功耗,最好以 24 小时运行数据为准。
2.3 从单台服务器到机柜功率的估算方法
以一台 8 卡 H100 服务器为例。8 张 GPU 满载功耗是 5600W;加上 2 颗 CPU 约 800W,内存约 400W,网卡、硬盘、风扇、管理模块约 300W;电源模块转换效率按 93% 计算,输入功率约是输出功率的 1.07 倍。于是这台服务器的输入功率大约为:
- 服务器内 IT 负载:5600 + 800 + 400 + 300 = 7100W
- 输入功率:7100 × 1.07 ≈ 7600W
一个 42U 机柜通常可以放 3 到 4 台 4U 或 8U 的 8 卡服务器。按 4 台计算,IT 设备功率约 30.4kW,机柜顶部再加一台接入交换机约 1kW,整柜功率约 31.4kW。为了给电源冗余和未来扩容留余量,这个机柜的设计功率至少应按 36kW 到 40kW 来规划。如果使用液冷机柜,单柜还能做到 100kW 以上,但对配电和冷却的要求会完全不同。
2.4 用一段 Python 脚本快速完成功率估算
下面这段 Python 脚本用于估算单台服务器、单机柜和 1000 卡集群的数量级,目的是让规划人员在采购前先建立“功率预算”的概念,不能替代电气设计。
def estimate_server_power(gpu_count=8, gpu_watts=700, cpu_watts=800, mem_watts=400, other_watts=300, psu_loss=0.07): gpu_total = gpu_count * gpu_watts output_power = gpu_total + cpu_watts + mem_watts + other_watts input_power = output_power * (1 + psu_loss) return input_power servers_per_rack = 4 switch_watts = 1000 server_watts = estimate_server_power() rack_watts = server_watts * servers_per_rack + switch_watts num_servers_for_1000_gpu = 125 cluster_it_power_kw = num_servers_for_1000_gpu * server_watts / 1000 print(f"single server input power: {server_watts:.0f} W") print(f"rack input power: {rack_watts:.0f} W") print(f"1000 GPU cluster IT power: {cluster_it_power_kw:.0f} kW")运行后输出的数量级应该接近:
single server input power: 7597 W rack input power: 31388 W 1000 GPU cluster IT power: 950 kW这里需要注意的是,上面的结果是 IT 设备输入功率,还没有包含空调、UPS 损耗、配电损耗和照明。如果对 1000 卡集群按 PUE=1.4 估算,数据中心总输入功率约为 950 × 1.4 = 1330kW,也就是 1.3MW 左右。这也是为什么生产型机房往往会同时要求较高等级的市电容量,而不是简单把 GPU 功率加起来就算完。
3. 为什么电力建设周期会成为算力交付的最大瓶颈
3.1 设备交付周期和电力建设周期的时间错配
GPU 服务器的采购周期通常以“月”为单位,在供应链正常的情况下,订单到货可能需要 12 到 20 周。而一个数据中心从选址、电力申请、变电站建设、配电系统安装到正式送电,通常需要 2 到 5 年,具体取决于是否新建变电站、电网裕度、行政审批和施工环境。
这就形成了明显的时间错配:算力设备已经按季度规划,电力设施却按年度推进。一旦机房土建完成但变电站无法按期送电,已经到货的 GPU 就只能堆在仓库或机房里等待。对超大规模集群而言,15GW 对应的不是一栋楼,而是一整片区域的电网改造,周期会更长。
3.2 数据中心电力系统的主干结构
数据中心从外部电源到服务器电源,通常经过多级设备。常见架构如下:
- 市电接入:高压线路进入园区总降压站;
- 主变压器:将 110kV 或 35kV 降压到 10kV;
- 中压配电柜:分配给各机房模块的变压器;
- 低压变压器:将 10kV 降到 400V/230V;
- UPS:在市电异常时提供不间断供电;
- 列头柜和 PDU:分路到每个机柜;
- 服务器电源模块:将交流电转换为服务器内部直流电。
这中间每一级都有容量上限。主变压器容量用 kVA 表示,不是 kW。实际有功功率还取决于功率因数,通常按 0.9 到 0.95 折算。很多规划人员只看“电力部门批了多少 kVA”,然后直接乘以 1 当作 kW,结果设备上电后变压器过载或低压母线电流越限。
例如某园区申请到 2000kVA 的变压器容量,功率因数为 0.93,实际可用有功功率约 1860kW;但 IT 设备功率估算为 1800kW,再加上冷却系统 500kW,总需求 2300kW,已经超过变压器有功容量。结果就是变压器满载,甚至低压电流越限。
3.3 电网接入、容量审批与现场施工约束
接入电网不是采购服务器那么简单。要新增或扩大用电容量,一般需要经历可研、设计、接入系统方案评审、设备采购、土建施工、设备安装、试验、送电验收等多个阶段。
一个常被忽略的细节是电网裕度。即使电力部门愿意批准 100MW 容量,如果上级变电站或线路没有足够的剩余容量,最终接入容量也可能大打折扣。负载率高的区域,新增大量 GPU 集群可能还需要对输电线路进行改造,这会进一步拉长工期。因此,“能不能启用”的判断往往在电力接入阶段就已经决定了。
3.4 光伏、储能和燃气发电只能是补充方案
为了缓解市电容量不足,有些项目会引入分布式光伏、储能电池或燃气发电。这些措施可以提升能源供给的灵活性,但不应在设计阶段把它们当成唯一的容量来源。原因有三个:第一,光伏在夜间和阴雨天出力大减,无法支撑训练集群 24 小时负载;第二,储能电池容量有限,适合削峰填谷,不适合持续供能数千小时;第三,燃气发电涉及燃料供应、排放和审批,运行成本也明显高于市电。
并行使用这些能源时,还要考虑并网控制、电能质量和调度策略。比如训练任务可以配合电价低谷和光伏出力高峰期调整功率上限,但这已经是“能源调度”的范畴,而不是简单的电力容量规划。
注意:临时电源可以用于测试和应急,但不能作为生产集群长期稳定运行的主要供电来源。否则一次天气变化或燃料中断,就会让训练任务全部