一、提高流速对下一代液冷系统的影响
1. GPU的TDP和流速
核心问题: 随着GPU的TDP(热设计功耗)呈指数级增长,冷却系统的流速也必须大幅提升,这会带来一系列连锁问题。
行业标准: 目前普遍遵循OCP建议的“每千瓦1.5升/分钟”的流量标准。
流速增长预测:
- 当前GPU(1200W):约1.0 LPM。
- 下一代GPU(2400W):约4.0 LPM。
- 未来GPU(3600W):约6.0 LPM。
连锁问题: 流速的大幅增加会导致压降、泵功和流速的急剧上升,超出当前基础设施的设计范围。
结论: 需要在刀片内部和外部采用新的架构来应对。
文档文本+视频(中英文版本)已上传至星球:https://t.zsxq.com/NImzO
或知识星球搜索星球号:54295154
2. 流速和压降
物理定律:
压降: 根据达西-魏斯巴赫方程,压降(ΔP)与流速(Q)的平方成正比。
泵功: 泵功(Power)与压降和流速的乘积成正比,即与流速的立方成正比。
实际影响: 流速的微小增加会导致压降和泵功的剧烈增长。
举例: 流速从1 LPM增加到4 LPM(4倍),压降可能增加16倍,泵功需求可能增加64倍。
结论: 压降和泵功将从次要问题变为系统设计的关键变量。
3. 机架密度增加
冷却范围扩大: 液冷不再仅限于GPU,客户开始要求对DIMM、SSD、互连等所有组件进行液冷。
影响: 刀片内的总热密度增加,“每千瓦1.5升/分钟”的标准不再适用。
单刀片GPU数量增加: 单个刀片内的GPU数量从2个增加到8个甚至更多。
影响: 刀片的总流速随组件数量线性增加,进一步加剧了高流速带来的挑战。
4. 流速、速度和侵蚀
核心关系: 流速增加,流体速度也随之增加。
行业标准: 目前行业默认的最大流速限制约为3米/秒(10英尺/秒),该标准源自ASHRAE手册,旨在最小化侵蚀。
现状: 该标准正在被讨论和研究中,可能会根据材料、几何形状等因素进行调整。
过高流速的风险:
- 导致材料降解和侵蚀腐蚀。
- 最终后果: 产生泄漏,对昂贵的机架造成巨大风险。
5. 系统级影响仿真模型
模型设定: 使用一维流网络模型模拟传统数据中心部署。
基础设施: 3英寸母管、1.5英寸支管、6个125kW机架并联,由CDU供液。
冷却介质: PG25。
研究目标: 在不改变任何基础设施的前提下,将流量比从0.7 LPM/kW提升至2.0 LPM/kW,观察其影响。
6. 系统级影响仿真结果
关键发现: 压降和泵功需求呈指数级增长。
压降: 从8.0 psid增加到54.1 psid,增长了6.8倍。
泵功: 从0.7 kW增加到13.9 kW,增长了19.4倍。
流速问题: 系统内的流速接近6米/秒,远超3米/秒的安全上限。
结论: 简单地增加流速而不改造基础设施是行不通的,存在物理限制。
7. 刀片中的解决方案
方案一:微通道并行化: 通过增加并行微通道的数量,缩短单个流道长度,在保持高换热效率的同时大幅降低压降。
方案二:高性能几何结构: 采用先进的微通道设计,降低冷板的基础热阻,从而在相同TDP下使用更低的流速。
方案三:两相冷却: 利用冷却液的相变潜热,相比单相冷却,可以在显著降低流速的情况下带走更多热量。
注意: 两相冷却需要对数据中心基础设施进行较大改动。
1)流道并行化示例
仿真对比:
- 标准微通道: 200μm宽,200μm壁厚,40mm长。
- 并行化微通道: 将相同体积分割成9个4mm长的并行通道。
- 测试条件: 使用PGW25,6 LPM流量,45°C入口温度,4kW热负载。
结果:
- 压降: 并行化通道的压降比标准通道低33倍。
- 热性能: 并行化通道的平均壁温比标准通道低7°C。
- 原因: 每个短通道的边界层会重新发展,从而获得更高的有效换热系数。
8. 系统级缓解措施
最小化阻抗: 尽可能使用全通径阀门和连接器。
探索并行路径: 为机架支管和快接头设计并行路径。
面向未来设计:
- 根据未来的流量需求,预先选择更大的管道/软管直径。
- 预留额外的支管和隔离阀,以便未来增加CDU和IT设备机架。
模块化解决方案: 采用模块化CDU和TCS歧管设计,使基础设施能够随负载扩展。
1)未来证明系统示例
改进设计:
- 使用6英寸母管和4英寸支管(带变径至2英寸)。
- 支持并行部署两个CDU。
结果:
- 在2.0 LPM/kW的流量下,所需液压功率为7.5 kW,比之前案例降低了19%。
- 系统内流速降至3米/秒以下,符合安全标准。
核心观点: 提前规划是应对未来高流速挑战的关键。
9. 行动号召
问题重申: 不断上升的流速正对压降、泵功和整个系统设计构成挑战。
行动建议:
- 制定OCP规范: 创建标准化的测量方法和系统级压降预算,用于建模、比较和验证基础设施能否扩展。
- 参与OCP工作流: 积极参与冷板、浸没、门式换热器等冷却环境工作流。
- 联系作者: 欢迎合作与交流。
二、知识小结
要点归纳
主题 | 核心观点 | 主要论据 | 文中金句 |
下一代液冷系统流量增加的影响 | 随着GPU TDP指数级增长,冷却液流量必须大幅提升,但现有基础设施无法应对压力降、泵功率和流速的剧增 | GPU TDP从当前水平增至2400-3600W,流量需求从1 L/min增至4-6 L/min;压力降与流量平方成正比,泵功率与流量立方成正比 | “这些我们今天不太担心的量(压力降和泵功率)可能很快成为驱动系统设计的变量” |
流量增加带来的物理限制 | 压力降、泵功率和流速将呈指数级增长,超出传统设计范围 | 流量增加4倍可能导致压力降增加16倍、泵功率增加64倍;流速接近6 m/s,远超行业公认的3 m/s限值 | “你不能只是增加流量然后期望一切正常工作,存在物理限制” |
刀片内部解决方案 | 微通道并行化可显著降低压力降并保持高热性能 | 并行化微通道(9个并行通道)相比标准微通道,压力降降低33倍,平均壁温降低7°C | “每次有一个小微通道,边界层重新开始,从而获得更高的有效传热系数” |
基础设施规划策略 | 提前规划、适度超配是应对未来高流量需求的关键 | 使用6英寸集管和双CDU并行配置,可降低19% 泵功率,并将流速控制在安全范围内 | “提前规划听起来简单,但确实是关键” |
流体特性对比 | PG25和乙二醇在热性能上存在差异,但毒性是选择的关键因素 | 乙二醇具有更好的导热性、热容量和更低粘度,但毒性限制了大规模应用 | “从热管理角度看很难反驳应选择EGW而非PGW,但毒性是巨大缺点” |
两相冷却前景 | 两相冷却可大幅降低流量需求,但面临环境与健康挑战 | 常见两相制冷剂全球变暖潜能值较低,但PFAS问题令人担忧;CO₂作为冷却剂具有GWP=1的优势 | “两相冷却值得研究,但单相冷却仍有很长的路要走” |
趋势对比
对比项 | 当前状态 | 未来趋势 | 影响程度 |
GPU TDP | 当前水平 | 2400-3600W | 指数级增长 |
流量需求 | 1 L/min | 4-6 L/min | 4-6倍增长 |
压力降 | 可忽略 | 16倍增长 | 系统设计关键变量 |
泵功率 | 可忽略 | 64倍增长 | 能源成本剧增 |
流速 | 安全范围内 | 6 m/s(超限值) | 侵蚀/泄漏风险 |
冷却组件范围 | 仅GPU | GPU+DIMM+SSD+互连 | 总热密度增加 |