AI加速卡的规格表上那一串数字——几百TOPS算力、几TB/s带宽、每瓦多少TOPS的能效——看着非常唬人,但真把卡买回来一跑,很多人会怀疑是不是发错了货。最近后台总有人问:"这卡标称200 TOPS,怎么跑我的模型还不如另外一张100 TOPS的卡?"问的人多了,我觉得有必要系统写一篇关于AI芯片指标怎么看的文章,把宣传页上的数字和实际部署体验之间的差距讲清楚。这篇内容主要写给做AI基础设施选型、算法工程落地,以及被供应商宣传页绕晕的评估人员。我会拆开算力、功耗、带宽、互联四类核心指标,补上规格表里不会写的小字,最后给一套我自己实测选型时用的检查清单。
先排个雷:搜"AI芯片指标"的时候,你会看到大量"副图指标源码""通达信公式""主力资金指标"之类的搜索热度,那是二级市场看K线用的技术指标,和芯片评测完全是两个物种,别花时间点进去。芯片指标讲的是算力、带宽、功耗、时延,股票指标讲的是均线、MACD、成交量,除了名字里都带"指标"两个字,没有任何关系。
1. 先搞清楚:AI芯片的数字到底是谁定义的游戏规则
1.1 为什么同一颗芯片在不同厂商嘴里能差出3倍
我在做选型评审的时候,经常被人甩过来两张规格表,一张写"300 TOPS",另一张写"150 TFLOPS,支持稀疏加速",有人就会说:"明显300那个强啊。"但你真把两颗卡放到同一个机箱里跑同一个模型,结果往往和纸面对不上。
问题不在芯片本身,而在"TOPS"和"TFLOPS"这两个单位压根就不是同一把尺子。TOPS是每秒多少万亿次整数操作,TFLOPS是每秒多少万亿次浮点运算。整数操作和浮点操作不一样,稀疏和稠密不一样,FP16和INT8差一倍起步,FP32和FP16再差一倍。这一层层换算折扣叠下来,同一颗芯片的理论峰值可以从100炒到400。
更麻烦的是,A厂商喜欢报"INT8稀疏算力",B厂商喜欢报"FP16稠密算力"。如果采购只看最大那个数字,A会显得比B强一大截,可你实际业务要跑的是FP16密集推理,那A真实可用的算力可能只有标称值的四分之一。所以第一步不是学怎么算,而是建立一种警惕:在看任何一个AI芯片指标之前,先问清楚它是在什么精度、什么密度、什么负载下测出来的。
1.2 一张"指标翻译表":TOPS、TFLOPS、FLOPS的换算关系
为了把口径问题说明白,我把几个常见指标单位放在一张表里:
| 单位 | 全称 | 统计口径 | 常见用途 |
|---|---|---|---|
| FLOPS | Floating-point Operations Per Second | 每秒浮点运算次数,一个乘加指令按2次运算计 | 传统CPU/GPU算力衡量 |
| TFLOPS | Tera FLOPS | 每秒10^12次浮点运算 | 训练卡、加速卡标称 |
| TOPS | Tera Operations Per Second | 每秒10^12次操作(通常指乘加操作) | 推理卡、NPU、端侧芯片 |
| POPS | Peta Operations Per Second | 每秒10^15次操作 | 极少见,光计算和超大芯片宣传时用 |
换算关系没法用"1 TFLOPS = 2 TOPS"这种固定等式,因为不同架构在同精度下的吞吐比不一样。但有个经验规律:在当代主流AI芯片里,如果按每时钟周期能处理的乘加数来看,INT8算力大约是FP16的2倍,FP16大约是FP32的2倍。于是你能看到很多卡的规格是有规律的:FP32是40 TFLOPS,FP16通常做到80 TFLOPS上下,INT8做到160 TOPS上下。
这个规律不绝对,有些架构FP8和FP16一样快,有些架构FP16反而比BF16慢。真正对比的时候,一定要拉到同一张表的同一列再比,拿A卡的FP16去对B卡的INT8,那叫关公战秦琼。
1.3 同一系列芯片,顶配和中配差的不只是频率
还有一个容易忽略的坑:同一系列芯片,顶配和中配的算力差距往往来自芯粒数量、AI加速单元数量和内存控制器数量,而不是单纯主频。比如同一架构的小芯片算力只有大芯片的三分之一,但功耗可能只低40%。这时候你按"每秒算力/每瓦功耗"算,大芯片反而更划算。选型如果只盯着"标称算力/价格",很可能错过真正适合你功耗预算和散热条件的那颗。尤其在做边缘盒子这类功耗预算卡得很死的项目时,为了省一点采购成本选了小芯片,结果同等吞吐需要双倍数量的卡,机箱、供电、维护成本全涨上去了,反而更贵。
2. 算力指标拆解:FLOPS的数字游戏与精度陷阱
2.1 FP32、FP16、BF16、INT8:精度维度如何影响算力数字
算力数字前面那个精度前缀才是精髓。同一块芯片,不同数据格式的吞吐差异巨大,原因很简单:一个时钟周期内,硬件能处理的比特数大致是固定的,32位浮点一次只能处理一个数,换成16位能塞进去两个,换成8位能塞进去四个。如果芯片里有专门的矩阵乘单元,这个倍数关系还会被进一步放大。
各精度的真实定位我按使用场景梳理一下:
- FP32:传统数值计算的标准格式,AI领域主要用来做梯度累积、部分归一化和稳定训练。它的算力数字通常最难看,因为硬件限制最大。
- FP16:混合精度训练的主流格式,动态范围小但深度学习梯度的分布通常忍得住。训练卡宣传的重点一般都在FP16/BF16上。
- BF16:指数占8位、尾数只有7位,牺牲精度换动态范围,训练大模型尤其受欢迎。
- TF32:名字叫32位,实际是19位有效精度,在矩阵乘单元上跑得比FP32快很多,很多训练卡规格表里的TFLOPS峰值其实是TF32。
- INT8/INT4:推理量化的主战场。INT8比FP16通常快2倍,INT4在专用架构上还能再翻倍。
实际看规格表时,我建议只盯住两个数:你训练用得上的那个精度(一般是FP16/BF16)的稠密算力,和你推理目标精度(一般是INT8)的稠密算力。如果厂商只给了稀疏值,那就按下面一节的方法折算。
2.2 稀疏算力与密集算力:500 TOPS的"稀疏"水分
稀疏算力是现在被用得最多的营销话术之一。原理上,从Ampere时代开始推广2:4结构化稀疏:四个权重里只保留两个非零,配合专门的存储格式和指令,理论算力直接翻倍。这在学术上站得住脚,模型里确实有很多权重接近零,剪掉之后精度损失可控。
但选型时必须清醒:稀疏翻倍是"理论"上限,你的模型必须真的能被剪到50%稀疏,推理引擎还必须真的支持结构化稀疏的加速路径。很多开源模型直接跑,稀疏度连30%都达不到,更别说不少推理框架压根没有启用稀疏算子,这时候规格表上的"500 TOPS(稀疏)"对你就是无效数字。
我自己的习惯是:看到标称稀疏算力,先除以2当稠密算力看;看到没标密度的算力,默认它是稠密值。这样横向比才不吃亏。另外,规格表角落经常有一行小字"with sparsity"或者"稀疏模式下",那才是它算力的真实语境,电子版PDF里按Ctrl+F搜一下"sparsity",你会回来感谢我的。
2.3 实测案例:一张规格表里藏着的真实算力
拿一张我前一阵评审过的训练卡规格表举例,厂商和型号我就不点了,数字做了脱敏处理:
- FP32:32 TFLOPS
- TF32(矩阵单元):132 TFLOPS
- FP16/BF16(矩阵单元):264 TFLOPS
- FP16(稀疏):528 TFLOPS
- INT8:528 TOPS
- INT8(稀疏):1056 TOPS
乍一看,最后那个1056 TOPS非常吓人。但你仔细看表格底部,通常还有一行小字:"上述数值为理论峰值,实际性能取决于散热、供电和软件栈。"这句话才是重点。
我把这张卡拿到手实测,跑了三个负载:中等规模Transformer训练(BF16混合精度)、Stable Diffusion微调(FP16)、一个LLM聊天模型推理(INT8量化)。三个负载的实测吞吐分别只有理论峰值的60%、55%、70%上下。这不是卡不行,而是理论峰值本来就是在最高频率、正好命中缓存、指令流水完美的情况下才能碰到的上限。
所以记住一句话:规格表上的算力是赛车手在完美赛道刷出来的圈速,你的模型是早晚高峰的拥堵路况。
3. 功耗、能效与散热:TOPS/W参数背后的数学把戏
3.1 TDP的统计口径:满功耗测试为什么总比规格表高
AI芯片的TDP(热设计功耗)是另一个博弈场。同一颗卡,厂商可以采用"典型负载""极限压测""板卡级""整机级"四种口径,数字能差30%以上。
我在实测里见过一个很典型的例子:某推理卡规格上写TDP 150W,我按这个数准备在一台2U服务器里塞6张。结果满负载实测,单卡整卡功耗到了230W,因为标注只算了核心部分,没算显存、PCIE转接和板载调理电路。6张卡加起来1400W,供电直接超了,最后只敢插4张。
所以选型时要找的不是TDP,而是"整卡功耗(Board Power)",更保守一点还要看"系统功耗(System Power)"。专业AI服务器产品页一般都会标"单卡最大功耗"和"整机功耗墙",这才是机房配电、散热设计真正需要的数字。凡是只给TDP不给整卡功耗的,大概率有水分。
3.2 能效比的三种算法:厂商偏好哪个,你又该用哪个
能效比TOPS/W(或TFLOPS/W)比绝对功耗更有说服力,但它也有口径问题。常见三种算法:
- 峰值能效:芯片跑到最高频率、算力达到峰值时测得的比值,数字最漂亮,厂商最爱标。
- 持续能效:跑30分钟稳定负载之后,用实际吞吐除以平均功耗,这个数字更诚实。
- 系统能效:把整机CPU、内存、散热风扇、电源转换损耗都算进去,最能代表你真实电费支出。
举个例子:某端侧NPU标称"能效26 TOPS/W",看起来非常惊艳。但那是INT8稀疏算力除以纯核心功耗得出的。按整板整体功耗算,实际大概只有5到8 TOPS/W,即便如此在端侧已经算不错的水平。问题不在于数字真假,而在于你拿哪个口径去跟别的平台比。我一般要求供应商同时提供持续能效和系统能效,如果对方给不出,我就用整卡功耗除以自己实测的稠密INT8吞吐来补算。
3.3 从功耗倒推供电和散热,避免买得起用不起
算力再高,供电和散热跟不上也白搭。这里给一个我自己常用的快速估算方法:单卡功耗确定后,先算单服务器功率,公式是"单卡功耗 × 卡数 + 主机其他部件功耗(CPU、内存、硬盘,通常按200到400W估)"。一个标准42U机柜如果放10台4卡服务器,整柜功耗可能到30到40kW。传统风冷机房单机柜供电上限一般是8到15kW,超过这个数,你以为多塞了几张卡,实际是机房跳闸。
我之前帮一个团队做方案,6张750W的加速卡,单机上电瞬间就有接近5kW的功耗,两台设备上架就把那个机柜的A/B路都怼满了。后来只能降频运行。这个教训让我养成了一个习惯:任何选型评审里,功耗指标和算力指标必须同等对待,先确认供电和散热,再谈性能。别到最后发现算力是够了,机房不给力,卡全在降频摸鱼。
4. 存储与带宽:为什么内存带宽才是卡脖子的那个
4.1 HBM、GDDR、LPDDR:显存类型决定了AI芯片的性能天花板
很多人只看算力,但AI芯片的实际表现有一半是由内存子系统决定的。按主流存储介质,可以分为三类:
- HBM(HBM2e/HBM3):训练大模型、大batch推理和KV Cache膨胀场景的标配。单个堆栈带宽大概在0.4到1TB/s,一颗卡集成4到8个堆栈,总带宽能做到2TB/s甚至4TB/s以上。
- GDDR(GDDR6/GDDR6X):推理卡和消费级显卡常用,带宽在0.5到1TB/s量级,容量大、成本低,但带宽和HBM有明显差距。
- LPDDR:端侧NPU、手机SoC、小盒子推理设备用,带宽从几十GB/s到一百多GB/s,优先保证功耗。
为什么带宽如此重要?因为AI推理和训练的核心就是"把数据从内存搬进计算单元,算完再搬出去"。任何时刻计算单元在等数据,它就只能闲置。算力再高,带宽喂不饱,照样是瓶颈。判断一个芯片是算力强还是带宽强,不是看规格表里谁的数字大,而是看带宽能不能匹配算力。
4.2 带宽的计算方式与"多通道"宣传里的水分
内存带宽的计算公式其实很简单:
带宽(Byte/s)= 位宽(bit) / 8 × 有效传输速率(GT/s)
举个例子:某推理卡显存位宽256bit,GDDR6有效速率16Gbps,理论带宽就是256/8 × 16 = 512GB/s。但这只是理论峰值,实际受访存模式和ECC开销影响,能跑到80%到90%已经算很优秀了。
规格表里还有个容易误导的点:"支持多通道内存"不代表带宽翻倍。真实能翻倍的只有多个独立内存控制器同时工作的情况。很多端侧芯片标"四通道LPDDR5",实际应用里因为单笔访问量小、地址交叉不完美,带宽利用率很低。我看到宣传文案里最想确认的一句话是"实测带宽达到理论峰值X%",有这句话再往下谈。
4.3 用算术强度判断你的业务是算力密集还是访存密集
带宽和算力怎么匹配,业内有个经典工具叫Roofline模型,核心概念是算术强度(Arithmetic Intensity):每个字节的数据平均参与多少次计算。公式是FLOPs/Byte。把芯片的"峰值算力/峰值带宽"叫做机器指标,你模型的算术强度大于机器指标就是算力瓶颈,小于就是带宽瓶颈。
拿大语言模型推理算一笔账:假设一个7B参数模型,FP16权重大概14GB,生成阶段每个token大约需要14GFLOPs级别的浮点运算,同时要流式读取14GB权重加KV Cache,算术强度大约只有1 FLOP/Byte。而一颗典型训练卡"300 TFLOPS / 3TB/s"的机器指标是100 FLOP/Byte。1远小于100,所以LLM生成(decode)阶段是实实在在的带宽瓶颈。这就解释了为什么跑同样量级的模型,算力低但带宽高的推理卡,有时候反而比训练卡更快。选芯片之前先拿自己的模型算一遍算术强度,能少走很多弯路。如果是视频超分、图像生成这类大访存业务,带宽权重也应该给得很高;小batch稠密矩阵乘场景,则算力权重优先。
5. 互联与集群扩展:单卡指标再漂亮,一联网就现原形
5.1 互联带宽指标:NVLink、RoCE、PCIe该怎么看懂
单卡评测看完,还得看卡跟卡之间怎么连。分布式训练里每隔几步就要同步一次梯度,通信时间占比往往高得惊人。当前几类主要互联选项:
- PCIe:PCIe 5.0 x16单方向约64GB/s,双向约128GB/s。通用性强,但跨CPU、跨NUMA时延迟偏高。
- NVLink/NVSwitch:GPU专用高速互联,第四代NVLink单卡总带宽能做到900GB/s级别,远高于PCIe,基本把多卡捏成一个逻辑大卡。
- 以太网/RoCE:节点间通信主流,400G网络单方向约50GB/s理论带宽,算上协议开销,实际有效带宽通常只有70%到80%。
最容易忽略的是"单卡通信带宽"和"单机对外通信带宽"的差别。有些卡的NVLink很猛,但对外只剩两个100G网口,跨机通信立刻变成瓶颈。看互联指标不能只看单卡,要把节点拓扑、网卡数量、线速都看全。
5.2 集合通信效率:扩展率比峰值更有意义
多卡集群"1+1=2"是理想状态,真实世界通常小于2。业界用"线性扩展率"来衡量:扩展率=多卡吞吐/(单卡吞吐×卡数)。等于1是完美,0.85以上算优秀,0.6以下就得查通信问题了。
影响扩展率的直接因素是集合通信算子和网络拓扑。数据并行靠AllReduce,梯度量与模型参数量正相关,通信量很大;张量并行靠AllGather,每层前向反向都要互相搬中间结果,跨机延迟直接拖垮性能;流水线并行主要靠点对点通信,相对轻但存在气泡。大型训练集群的一般做法,是把通信最重的并行方式限制在NVLink域内,跨机用RoCE跑通信量轻的部分。
5.3 从8卡到千卡:集群指标怎么提前估算
我一般不用厂商"集群支持多少个节点"这种话术,而是自己做一个两步估算:第一步,算单节点内通信能支持什么样的并行方案;第二步,算跨节点带宽是否撑得起梯度和中间激活量。
举个例子:8卡节点,卡间NVLink 900GB/s,单卡要发1GB梯度,理论耗时大约1.1ms;跨节点用400G RoCE,如果8张卡共享一个400G口,单卡分到的带宽只有50GB/s左右,同样发1GB要20ms,差了接近20倍。所以很多训练任务根本不能把张量并行跨节点做。
如果要建千卡集群,建议不只看"总算力=单卡算力×卡数",而是让供应商提供一份"不同模型并行策略、不同batch size下的扩展率测试报告"。拿不到就自己在8卡、32卡规模上测,再外推。集群规模越大,通信指标的影响权重越高,单卡指标反而越来越不重要。
6. 拿到手的芯片怎么验货:我总结的一套实测指标清单
6.1 跑分工具与通用基准怎么选
纸面指标看完,最后一定落到实测。我的验货流程分三层:第一层是微基准,跑矩阵乘GEMM(比如用厂商算子库空跑常见尺寸)和内存带宽测试,确认芯片算力、带宽没有虚标;第二层是行业基准,跑MLPerf Inference或Training里和你业务接近的子项,注意同子项、同batch size才能跨平台对比;第三层是真实业务,用你线上模型缩小版配上目标batch size,测吞吐和时延分布,这一层最有发言权。
顺带说一句有点冷门但重要的话:视觉类业务跑完吞吐还要看输出质量。视频超分、图像编解码加速这类场景,光看FPS不行,得同时看MS-SSIM这类画质指标有没有明显下降,高质量重建通常要求0.98以上。RAG和长文本场景则要关注faithfulness这类"生成是否忠于输入文档"的模型级指标。我见过有人为了冲高帧率做激进量化,算力指标很好看,但MS-SSIM掉到0.95以下,业务基本不可用。硬件算力指标和模型质量指标是两套评价体系,验货时要一起验收。
6.2 实测中容易踩的坑:降频、功耗墙、benchmark优化
实测最容易踩三个坑:一是降频,新卡冷机状态跑benchmark,温度低频率高,跑几分钟后撞上温度墙或功耗墙,频率掉20%到30%,吞吐随之下降,所以至少连续跑30分钟,记录功耗和温度随时间变化的曲线,看稳定吞吐;二是厂商benchmark特调,存在专门针对跑分优化的算子库和工作负载,一定要在同样软件栈下用公开通用算子库复测,或者干脆用自己的模型;三是时延只报均值不报p99,推理业务很看尾部时延,特别是有动态shape入场时,p99可能比均值高好几倍,表格里同时记mean、p50、p99才不会被骗。
另外,同一款芯片在不同BIOS、不同功耗墙设置下的性能差异可能很大。验货前统一固件版本和驱动版本,并在测试报告里写清楚环境,这是基本功。别拿别人"最高性能模式"的结果和自己"省电模式"的结果比,那又是另一种口径错位。
6.3 从指标到选型:我用的评估矩阵和最终判断
最后给一套我自己用的选型打分方法,先分两类业务。训练为主场景的权重我习惯这样设置:稠密算力(FP16/BF16)占35%,互联扩展率占25%,显存带宽占20%,显存容量占10%,系统功耗占10%。推理为主场景则是:有效带宽占30%,INT8稠密算力占25%,时延稳定性(p99)占20%,整卡功耗占15%,软件栈成熟度占10%。
权重可以根据业务特征微调,但有一个底线:所有候选芯片先统一口径,精度统一到FP16或INT8,密度统一为稠密,功耗统一为整卡或整机,再进入这张表打分。千万别拿A卡的INT8稀疏和B卡的FP16稠密去加权。
我做选型的最后一个习惯动作是:所有纸面指标先信一半,然后用一个极小真实负载对比卡1和卡2,谁跑完谁上。指标能帮你把候选范围从20颗缩到3颗,但最后选谁,一定得是实测跳出来的那个。
这些方法我讲了这么多年,自己也没少踩坑。最贵的一次,是拿着一份顶配规格表下了单,装机之后才发现散热系统撑不住,整柜功耗超限,最后只能降频跑,性能和低配卡差不多。从那以后,我对AI芯片指标的态度就一句话:数字是地图,不是目的地。地图能帮你少绕路,但你已经站在路口的时候,最好还是自己走过去看一眼。