AI 会带来气候收益,但它可能同时把化石燃料的“续命时间”拉得更长。这是最近关于 AI 环境影响的讨论里最值得技术人关注的一个判断:模型能力上去了,数据中心耗电上去了,AI 又被油气行业拿去做勘探和钻井优化。两件事叠在一起,净效果很可能不是减排,而是增排。
这篇文章不站在道德角度评判,只做技术拆解:AI 的能耗账单到底有多大,AI 为什么会被化石燃料行业使用,气候收益为什么会被抵消,以及如果我们继续做 AI 工程,有没有办法让模型在同等效果下少耗电、可测量、可优化。
如果你正在做模型训练、推理服务、本地部署或数据中心规划,这篇文章的核心内容可以直接对应到你的工程决策里。
1. 核心观点速览
| 维度 | 内容 |
|---|---|
| 核心矛盾 | AI 能优化能源系统、加速材料发现,但自身高能耗 + 被化石燃料行业大规模采用,可能抵消气候收益 |
| 主要耗能环节 | 大模型训练、推理服务、数据中心散热、芯片制造 |
| 化石燃料行业如何使用 AI | 油气勘探、钻井参数优化、炼化调度、供应链管理 |
| AI 正面气候用途 | 气象预测、电网调度、电池材料发现、碳封存选址、能效优化 |
| 抵消机制 | 回弹效应、算力竞赛、效率提升被新增需求吃光 |
| 工程侧可做的事情 | 量化、蒸馏、剪枝、低精度推理、绿色调度、碳足迹追踪 |
| 核心工具 | CodeCarbon、nvidia-smi、云厂商碳强度 API、MLPerf 功耗基准 |
| 合规重点 | AI 用于资源开采、能源调度、供应链等场景需遵守数据和环保合规要求 |
| 给读者的建议 | 先建立“一次推理耗多少电”的量化意识,再谈减排 |
2. 先看现实:AI 的能耗账单来自哪里
讨论 AI 的气候影响,不能停留在“训练一个大模型很费电”这种模糊说法。能耗分布是分层的。
第一层是训练阶段。大规模语言模型和扩散模型的训练,需要在成千上万张 GPU 上跑数周到数月。每一张高算力 GPU 的整机功耗在几百瓦级别,一台 8 卡服务器满载时,功耗接近一台重型空调机组。训练集群不是一台服务器在跑,而是几百上千台同时跑,还有配套的存储、网络、CPU 节点和散热系统。
第二层是推理阶段。很多人以为训练结束就不耗电了,实际上推理服务的总能耗会随着用户量上升而快速超过训练。每个请求都要过一遍完整的前向计算。大模型上线之后,用户越多、上下文越长、生成 token 越多,单次请求的算力消耗就越大。推理服务为了降低延迟,往往不会把 GPU 塞满,这种“低利用率 + 高基数”的模式会让电力浪费更明显。
第三层是数据中心基础设施。GPU 工作时产生大量热量,数据中心需要空调、冷水机组或液冷系统把温度压住。制冷本身可以占数据中心总能耗的 30% 到 40%。再叠加供配电损耗,最终体现在电费账单上的数值,往往比 GPU 标称功耗高出一截。
第四层是芯片制造。先进制程芯片的生产本身就是高耗能、高耗水过程。这个部分虽然不在模型运行现场,但属于 AI 产业链的间接排放。
如果只想记住一个结论:AI 的能耗不是单点问题,而是“算力硬件 + 模型规模 + 服务规模 + 基础设施”的乘数问题。任何单点优化都会被其他环节放大或抵消。
3. AI 如何进入化石燃料产业链
AI 被化石燃料行业使用,并不是“未来可能发生”,而是已经在多个环节落地。
油气勘探是最典型的场景。传统勘探依赖地质学家人工分析地震数据,周期长、成本高、成功率有限。深度学习模型可以在地震切片中识别地下构造,自动标注可能的油气藏位置。模型跑得越多,勘探人员就能在更短时间内筛选更多区块。效率是真实提升,但结果是把更多原本不具备经济性的油气储量变成了可开采资源。
钻井优化是第二个场景。钻井过程中有大量实时参数:钻压、转速、泥浆性能、地层压力。过去靠工程师经验判断,现在可以用强化学习和时间序列模型实时推荐最优参数,减少卡钻、井漏事故,缩短钻井周期。单口井的成本下降、成功率提高,直接结果就是更多钻井被排上日程。
炼化和供应链调度是第三个场景。炼油厂需要根据原油价格、产品需求、设备状态做生产计划。AI 优化器可以分钟级输出排产方案,降低能耗和原料损耗。这种优化让炼化环节的单位排放下降,但也会让整体产能维持在更高水平。
从企业角度看,这些都是合法且理性的商业决策:AI 降低了发现和生产化石燃料的成本,提高了资产回报率。但从气候角度看,AI 在这里扮演的角色是“提升化石燃料供给效率”,而不是“降低化石燃料消费”。新闻标题说“AI 的潜在气候效益被它在推动化石燃料中的作用所抵消”,指的就是这层逻辑。
技术人需要注意的是:我们开发出来的通用能力,比如时序预测、强化学习、大模型推理,并不天然指向清洁用途。同样的模型架构,可以用来做电网负荷预测,也可以用来做油田产量预测。部署场景的选择,决定了最终的气候效应。
4. AI 的正面气候贡献仍然真实存在
先说清楚:AI 在气候领域确实有不少正面应用,不是“全无用处”。
气象预测是最成熟的方向之一。传统数值天气预报需要超级计算机跑几小时,深度学习方法可以在更短时间内给出可比的预测结果。更精准的极端天气预警,能减少灾害损失,也能帮助风电场、光伏电站安排发电计划。
电网调度是另一个高价值场景。风电和光伏发电具有波动性,AI 可以基于历史数据和实时天气预测发电量,优化储能充放电策略,降低弃风弃光率。这类应用不产生新的能源,但能提高清洁能源在电力结构中的占比。
材料发现和碳封存也是重要方向。锂电池电解质、催化剂、碳捕集材料都涉及巨大的化学空间,AI 高通量筛选可以缩小实验范围,把新材料研发周期从十年级缩短到年级。碳封存选址需要分析地质结构和压力场,AI 可以辅助建模,降低封存项目的风险。
如果只看这些案例,AI 确实能帮助减排。但这些正面应用的共同特点是:它们优化的是“过程的效率”,而效率提升不一定能抵消系统规模的膨胀。这就是下一节要展开的问题。
5. 为什么潜在收益可能被抵消
5.1 回弹效应
经济学里有个概念叫回弹效应:技术进步让某个行为更高效,人们反而会增加这个行为的规模,最终总消耗可能不降反升。
放到 AI 上:模型推理变得更便宜、更快,于是应用方会在更多场景里使用 AI。原来的能源优化模型只用在新风电场,现在因为部署成本低了,传统火电厂的运行优化也上了 AI。单位优化效果确实存在,但优化对象的基数扩大了,总排放反而可能上升。
5.2 算力竞赛
这是最直接的抵消机制。当前大模型领域的竞争逻辑是“更大、更长、更多模态”。每一代模型的参数量和训练数据都在增长,训练能耗随规模超线性上升。单模型能效提升的速度,很难跟上算力总规模扩张的速度。
这种竞赛不只在少数公司发生。开源社区也在持续训练更大模型,企业与高校各自部署训练集群。全球 AI 算力总需求的年增速远高于单芯片能效的年改善幅度。
5.3 效率不等于减排
模型量化之后,同样的推理任务功耗可能下降一半。很多人会直接把它等同于“减排”。实际不是。效率提升会降低单次调用成本,调用量增加后,总能耗可能回到原样。
要真正让 AI 对气候产生净正面影响,至少需要三个条件同时成立:AI 服务的总规模增长速度受控、被优化对象本身向清洁方向转型、AI 能力不被用于放大高排放产业。
从目前信息看,这三个条件没有完全成立。
6. 工程侧:降低 AI 自身能耗的四个方向
作为工程师,我们很难直接左右油气公司是否使用 AI,但可以控制自己负责的模型和服务消耗多少能源。这部分是确定能做的。
6.1 模型压缩:量化、蒸馏、剪枝
量化是目前收益最明显的工程手段。把模型权重从 FP16 降到 INT8 或 INT4,显存占用下降,推理吞吐提升,单位请求功耗下降。对多数生产场景,INT8 量化结合少量校准数据,质量损失可以控制在很小区间。
蒸馏是用小模型学习大模型的输出分布,训练完成后只部署小模型。蒸馏后的 7B 模型可以在部分任务上接近原版 13B 模型的效果,推理成本却低一截。
剪枝适合已经训练好的模型。把冗余注意力头或网络层去掉,再微调恢复精度。剪枝的收益不如量化稳定,但和大模型蒸馏结合使用,效果不错。
6.2 低精度推理与批处理
推理阶段尽量使用低精度。GPU 推理时,FP8 和 INT8 能有效提升计算密度。同时注意 batch size:小 batch 延迟低但 GPU 利用率低,大 batch 吞吐高、单 token 能耗低。离线批量任务应该优先用大 batch,在线交互服务再根据延迟要求调整。
6.3 绿色调度:错峰和跨区域调度
电力碳排放强度随时间变化。夜间风电出力高、白天光伏出力高,不同地区电网的碳强度差异很大。如果任务不要求实时响应,可以推迟到低碳时段执行。
云厂商通常会提供电网碳强度数据或碳排放 API,本地数据中心也可以接入区域电网的实时碳强度接口,把训练任务调度到碳强度较低的时段。
6.4 数据中心散热与硬件选型
新建或扩容算力时,优先考虑能效更高的硬件和散热方案。液冷比风冷在功率密度高时更节能,温水冷却还能回收热量。这属于基础设施决策,但对长期电费影响很大。
7. 如何测量 AI 的碳足迹
没有测量就没有优化。建议从三个层面积累数据:单次推理能耗、单次训练任务能耗、月度总量。
7.1 用 nvidia-smi 记录 GPU 功耗
最基础的能耗记录方式,是轮询 GPU 功耗并累加。下面脚本可以在训练或推理过程中验证单张显卡的功耗曲线:
import subprocess import time import csv def read_gpu_power_mw(): output = subprocess.check_output( ["nvidia-smi", "--query-gpu=power.draw", "--format=csv,noheader,nounits"] ).decode().strip() return [float(x) for x in output.split("\n")] with open("gpu_power.csv", "w", newline="") as f: writer = csv.writer(f) writer.writerow(["timestamp", "gpu0_watt", "gpu1_watt"]) try: while True: powers = read_gpu_power_mw() writer.writerow([time.time()] + powers) time.sleep(5) except KeyboardInterrupt: pass这个脚本只能看到 GPU 本身,看不到 CPU、内存、制冷的耗电。要估算整机功耗,可以乘以 1.3 到 1.5 的经验系数,但以实际测量为准。
7.2 用 CodeCarbon 自动追踪训练碳排放
CodeCarbon 是目前使用较广的开源库,可以监测训练过程的 GPU/CPU 功耗,并结合所在地区的电网碳强度换算成二氧化碳排放量。
pip install codecarbon训练代码里只需要加几行:
from codecarbon import EmissionsTracker tracker = EmissionsTracker(project_name="my_finetune") tracker.start() # 模型训练代码 model.train() emissions = tracker.stop() print(f"training emissions: {emissions} kg CO2eq")CodeCarbon 需要联网获取地区电网碳强度数据,如果训练环境断网,可以改用离线模式或手动指定碳因子。项目文档里有具体参数,按实际环境调整即可。
7.3 训练全周期的能耗估算公式
更粗略的估算方式是:
训练总能耗(kWh) = 训练时长(小时) × 平均总功耗(kW) 训练碳排放(kg CO2eq) = 训练总能耗(kWh) × 电网碳足迹(kg CO2eq/kWh)其中“平均总功耗”需要覆盖服务器整机、网络设备和制冷。取数时最好用数据中心级电表读数,而不是只看 GPU 功耗。
8. 数据中心与本地部署的能效优化实践
无论你用的是云上 GPU,还是本地服务器,都有可以落地的优化项。
8.1 关注 PUE 和空间碳因子
数据中心行业用 PUE 衡量能效:PUE = 数据中心总能耗 / IT 设备能耗。PUE 越接近 1,说明制冷和供电损耗越小。选择云服务商时,可以优先看对方是否公布 PUE、是否采购绿电、是否有区域碳强度数据。
本地部署 AI 模型时,如果只追求“跑通”,容易忽略散热设计。机柜摆放在通风好的区域、空调温度设置在合理范围、闲置 GPU 主动休眠,这些都能省下可观的电费。
8.2 把训练任务调度到低碳时段
如果训练任务没有硬性交付时间,可以做一个最简单的“碳强度门控”脚本:
# 假设已经从一个碳强度 API 获取当前值 carbon_intensity=$(curl -s https://api.example.com/carbon-intensity/current) threshold=200 if (( carbon_intensity < threshold )); then echo "carbon intensity is low, start training" nohup python train.py > train.log 2>&1 & else echo "carbon intensity is high, wait" fi这个脚本只是示意,实际使用时需要替换为具体的数据源和阈值逻辑。生产环境建议用队列系统加调度策略,而不是 shell 脚本硬等。
8.3 按场景拆分推理路径
同一份模型部署,不同请求对延迟的要求差别很大。实时对话要求首 token 低延迟,日志分析、批量审核则完全不要求实时。把两类请求拆到不同部署实例,离线实例可以用更大的 batch、更低的精度、更高的 GPU 利用率。
9. 关于 AI 气候影响评估的几个现实问题
9.1 数据不一致会误导判断
不同研究对“AI 训练一次消耗多少电”的估算差异极大。差异主要来自硬件配置、训练时长、数据中心 PUE 的假设不同。看到一张“某大模型训练排放图表”时,先确认它的计算口径,再决定是否引用。
9.2 模型能力增长与能耗增长不是线性关系
更常见的规律是:模型质量进入平台期后,继续提升一个点需要翻倍甚至翻几倍的算力。这种边际收益递减意味着,算力投入会越来越大,但用户感知的提升越来越有限。这对气候是不利的。
9.3 开源模型的部署地点分散
开源模型发布后,会被部署到全球各地。同一个模型在绿电充足地区运行,碳足迹接近零;在煤电为主地区运行,碳足迹高出一个数量级。模型本身不能决定碳排放,部署地的电力结构才决定最终碳足迹。
10. 本地部署 AI 模型的性能观察要点
很多读者关心本地部署 AI。抛开气候因素,单从工程角度,本地部署至少要观察几个指标:GPU 利用率、显存占用、功耗、温度、吞吐量。
启动推理服务后,可以用 nvidia-smi 持续观察:
nvidia-smi --query-gpu=utilization.gpu,power.draw,temperature.gpu,memory.used --format=csv -l 1输出示例格式如下:
utilization.gpu [%], power.draw [W], temperature.gpu [°C], memory.used [MiB] 95 %, 287 W, 68 °C, 8123 MiB如果 GPU 利用率一直很低,但功耗不低,说明模型推理没有充分利用算力,可能是 batch size 太小或存在 CPU 瓶颈。如果显存占用接近上限,但利用率不高,则可能需要优化 KV Cache 或改用更小的上下文长度。
本地部署的一个隐藏成本是闲置功耗。即使没有请求,模型常驻显存也会维持一定功耗。如果业务有波峰波谷,建议在低峰期卸载模型或缩容实例。
11. 常见问题与排查方法
| 问题现象 | 可能原因 | 排查方式 | 解决方案 |
|---|---|---|---|
| 模型量化后效果下降明显 | 校准数据不充分或精度选择过激进 | 对比量化前后验证集分数 | 换校准集、改用 INT8 混合精度 |
| GPU 功耗高但利用率低 | 数据加载瓶颈、batch size 太小 | 观察 CPU 和磁盘 IO | 加大 batch、预加载数据 |
| CodeCarbon 无法联网 | 网络隔离环境 | 查看报错信息 | 改用离线模式或手动指定碳因子 |
| 推理服务功耗比预期高 | 空闲时模型未卸载 | 监控请求数和 GPU 功耗曲线 | 增加自动缩容或模型卸载策略 |
| 训练任务总在碳强度高峰执行 | 无调度策略 | 记录任务开始时间 | 接入碳强度 API 错峰调度 |
| 数据中心温度过高 | 制冷不足或机柜布局问题 | 检查 PUE 和热点分布 | 调整气流组织、考虑液冷 |
12. 最佳实践与合规边界
想把“AI 节能减排”真正落地,建议在团队里建立这么几条规则。
第一,每个上线模型都要有能耗基线。记录一次训练的总耗电、一次推理的平均功耗、部署后的月度总功耗。没有基线之前,任何“节能优化”都无法量化验证。
第二,模型压缩要作为默认步骤,而不是可选项。对生产推理模型,先量化再上线,效果不达标再回退并记录原因。蒸馏和剪枝则需要结合评测集判断。
第三,批量任务必须做好任务画像。同一批任务里,有些是实时交互,有些是离线处理。离线部分统一走低碳调度,节省成本的同时降低碳排放。
第四,涉及 AI 在能源、资源、供应链等领域的使用时,需要关注对应的合规要求。比如 AI 用于油气勘探、矿业分析、能源交易预测,要遵守数据处理、数据安全和行业监管规则。不能因为“模型效果更好”就忽略数据来源和用途合法性。
第五,对外宣传减排效果时要谨慎。一家公司同时做“AI 优化电网调度”和“AI 提升油田产量”,就不能只讲前者的减排故事。这个道理对机构和媒体同样适用。
13. 总结与下一步
回到文章标题:AI 的潜在气候效益,确实可能被它在推动化石燃料方面的作用所抵消。判断这个命题是否成立,不能只靠几篇报告,而是要回到工程数据:模型训练用了多少电、部署在什么电网、被什么行业调用、优化对象是否属于高排放产业。
建议你先从自己最可控的部分开始验证:用 nvidia-smi 或 CodeCarbon 记录一次推理训练任务的能耗,尝试对模型做 INT8 量化,对比量化前后的功耗和质量差异。数据积累起来之后,再谈你的 AI 系统到底是在帮助减排,还是在扩大排放。
下一步可以继续深入的方向包括:绿色算力调度平台、数据中心余热回收方案、低精度训练、模型碳足迹标准化评估。先把测量体系建起来,这是所有优化决策的基础。