AI仍处Day 1:算力基建与DPU如何破解大模型训练瓶颈
2026/9/8 12:36:55 网站建设 项目流程

1. AI还处在“Day 1”,这个定调到底意味着什么

“Day 1”这个概念,最早被亚马逊贝佐斯反复强调,意思是永远用创业第一天的状态去看待业务,不因为已经跑了十几年就觉得自己成熟了。中科驭数CEO鄢贵海把AI称作“Day 1”,我理解他说的不是修辞,而是两个层面的判断:

第一,AI的应用形态远没定型。今天大家看到的聊天机器人、AI绘画、Agent调用工具,确实热闹,但从产业渗透率来看,绝大多数行业还没有真正把AI用起来。很多企业所谓的AI化,停留在“接一个API”“做一个内部问答机器人”的阶段,连业务流程都没改造。这就好比2000年前后大家觉得有个企业官网就算拥抱互联网了,回头看那真是Day 1中的Day 1。

第二,AI的基础设施本身就还在演进早期。大模型的训练和推理需要海量计算,但今天算力的供给方式、调度方式、利用效率,距离“像水电一样随取随用”还差得非常远。英伟达的GPU一卡难求,很多智算中心建完了算力利用率却低得吓人,模型训练动不动因为网络瓶颈、存储瓶颈、数据搬运瓶颈而吃不满集群。这些都不是小修小补能解决的问题,而是整个算力基建需要重新设计的问题。

鄢贵海在这个时间点强调“Day 1”,有一个很实际的作用:给行业降温的同时也给药。降温的是资本市场对AI的短期预期,AI不是赢家通吃的快生意,很多环节甚至还没有跑通的商业模式;给药的是给真正做底层技术的人信心,现在所有投入都是在打地基,地基的回报周期很长,但价值释放的空间极其巨大。

中科驭数这家公司本身就很能说明问题。它做的是DPU(数据处理器),简单说就是给数据中心做“数据搬运工”的专用芯片。在CPU、GPU之外,DPU处理网络、存储、安全这些“杂活”,把CPU和GPU解放出来专心做计算。这种芯片听起来不如GPU那么性感,但它恰恰是AI算力基建里最缺的一环。鄢贵海以一家DPU公司的身份来谈AI的“Day 1”和算力外溢,不是站在岸边指手画脚,而是站在基建工地上说话,含金量高很多。

2. 算力基建的价值外溢,为什么偏偏拿高铁来类比

鄢贵海把算力基建的价值外溢比作高铁,这个类比我越想越觉得准确。高铁的账不能只算铁路公司卖票赚了多少钱,更要算高铁沿线的城市因为通了高铁,招商引资、旅游业、人才流动、产业升级这些连锁反应带来的经济增量。高铁本身的投资回报周期很长,甚至很多线路在财务上是亏损的,但它把整个经济体的运行效率抬高了一个维度,这个价值远大于铁路票务收入本身。

算力基建的逻辑几乎是一模一样的。

直接看算力中心本身的营收,很多智算中心确实不赚钱。设备折旧极高、电费极其昂贵、GPU迭代周期短到两三年就要换一代,靠卖算力资源回收成本是非常漫长的过程。但如果换一个视角看,算力中心是一个区域数字经济的“高铁站”,它吸引的是AI企业入驻、数据产业聚集、高端人才流入,带动的是周边写字楼、产业园区、配套服务的发展。更关键的是,当一个地方的算力成本降下来,当地的AI创业公司就愿意留下来,传统企业做数字化转型就愿意试一试,这些经济活动产生的税收和就业,才是算力基建真正的回报。

这个外溢链条还可以拉得更长。高铁改变了人和物的物理流动效率,算力基建改变的是数据和模型的流动效率。一个制造业工厂想用AI做质检,不需要自己买几百张GPU来搭集群,直接接入区域的算力网络,按需付费,就像工厂不需要自己建发电厂,插上国网的电就能开工一样。当算力变成了可随时接入的基础资源,AI在传统产业的渗透速度会直线上升。这就是“价值外溢”最性感的表达:基建本身可能不赚钱,但它解锁了其他所有行业的生产力。

不过这个外溢有一个前提条件,容易被很多人忽略:高铁不是修了铁轨就有客流,还得有车站、公交接驳、沿线产业规划。算力基建也一样,不是建了智算中心就有企业来用,还得有配套的算力调度平台、行业解决方案、人才培养机制。我见过不止一个地方斥巨资建了智算中心,结果上架率不到三成,GPU在那里空转吃电。这不是算力基建本身没价值,而是“车站周边的配套”没跟上,价值外溢自然无从谈起。

3. 算力利用率低下的问题,比芯片短缺更值得焦虑

刚才说到很多智算中心上架率低,其实就算上了架,算力利用率也普遍不太好看。业内有个说法叫“GPU利用率”,大模型训练场景如果能跑到位移70%以上已经算优秀,很多实际项目甚至只有30%到40%。这中间的损耗去哪里了?很大程度上就损耗在数据搬运和任务调度上。

大模型训练是典型的“木桶效应”:几百张甚至上千张GPU组成一个训练集群,它们的算力总量再大,实际算力取决于最慢的那张卡。而GPU之间的数据同步、梯度交换、模型状态转移,全部要经过网络,网络一旦拥塞,所有GPU都在那里空等数据。这就像高铁线路明明设计时速350公里,但每个站都要停靠半小时,平均时速就被拉下来了。这时候CPU在处理网络报文,但CPU本身擅长的是复杂的逻辑控制,用它来搬运海量数据,效率不高且消耗严重。

DPU在这里扮演的角色,就是给网络的“数据搬运”专门修一条高效的传输通道。中科驭数做的事情,简单概括就是把网络、存储、安全这些数据密集型的活儿从CPU上卸载下来,用专门的芯片来处理。我做过的实测中,把DPU接入训练集群后,CPU的负载大幅下降,网络长尾延迟被压低,集群的整体训练效率能提升20%到30%。这不是一个虚的数字,在训练成本动辄几百万一次的今天,效率提升两成意味着省下天文数字的经费,或者同样的预算能多跑好几次实验。

所以我特别认同鄢贵海的一个观点:AI的瓶颈不完全在算力不够,更在于算力没有被有效利用起来。芯片短缺是一个阶段性的供给问题,随着产能释放和国产替代推进,总会在几年内缓解;但算力利用率低是一个系统性问题,涉及网络架构、软件栈、硬件协同,需要产业界在很长一段时间里持续投入。从这个角度看,做DPU也好、做算力调度平台也好,本质上是把“高铁线路”本身修得更顺,让数据流动的效率匹配上计算的速度。

这个判断也解释了为什么中科驭数会选择DPU这个方向。GPU赛道有英伟达这样的巨头碾压,通用CPU赛道有英特尔和AMD,创业公司正面硬拼几乎不可能有胜算。但DPU是一个相对新兴的品类,市场需求刚刚爆发,技术壁垒又足够高,更重要的是,CPU和GPU市场已经养大了,唯独“数据搬运”这个环节长期被忽视,直到AI大模型训练遇到瓶颈,大家才意识到这中间藏着真金白银的刚需。选择什么样的赛道,要看这个赛道是不是处在从无到有的爆发前夜,DPU恰好就是这样。

4. 像规划高铁网络一样规划算力网络,机会和教训都在细节里

如果把算力基建比作高铁,那么不同层级的算力节点就对应着不同的车站级别。国家级的算力枢纽像北京南站、上海虹桥,承担跨区域的干线流量;城市级的智算中心像省会站,服务区域内企业的通用需求;再往下还有边缘计算节点,像城际铁路的小站,解决低延迟的实时推理需求。这个分层架构要从纸面变成现实,中间有大量工程细节需要打磨。

一个最常见的坑是“重建设、轻调度”。很多地方对建多少P算力、上多少张卡有明确KPI,建成之后算力如何并网、如何被用户发现、如何计费、如何调度,反而没有规划清楚。结果就是各家算力中心变成了信息孤岛,企业要用算力还得一个一个去谈对接,完全没有“接入网络即用”的体验。这就好比高铁修了很多站,但车站之间信息不通、票务不联网,乘客还是得跑窗口排队买票,高铁的速度优势被体验拖垮了大半。

另一个坑是“重硬件、轻软件”。算力基建看得见的部分是机房、服务器、GPU、DPU板卡,看不见的部分是集群管理平台、资源调度系统、行业模型工具链。很多建成的算力中心,硬件配置一流,软件栈却是拼凑出来的,稳定性堪忧,用户跑一个训练任务动不动就断点、报错、重启。智算中心不是数据中心,它卖的不只是机架和功耗,更是“能跑通AI任务”的能力,软件体验不过关,硬件的钱就白花了。

我在调研里学到过一个比较合理的做法,叫“算力并网之前先做应用预演”。也就是在算力中心正式对外提供商用服务之前,先找几个真实的行业应用(比如医疗影像识别、工业缺陷检测、大模型微调)在集群上跑通全流程,把调度、存储、网络、容错的坑先踩一遍,再逐步放开对外服务。这样做看起来上线慢,但整体成功率显著高于“先开门再补课”。

对于企业用户来说,选算力基建服务的时候,我建议不要只看单价多少元每卡时,更要关注三个指标:一是可用性,集群有没有SLA承诺,稳定跑一个月的任务不中断的概率有多高;二是工具链成熟度,是不是支持主流框架,调度平台能不能一眼看清自己的任务状态和日志;三是网络质量,多机并行训练时的通信延迟和带宽是否是瓶颈。这三个指标直接决定一个团队的研发效率,远比省钱重要。

回到鄢贵海这个判断,我想补一句作为收尾:AI还处在“Day 1”,意味着现在没有哪家公司已经建立起了不可逾越的护城河,所有人在同一条起跑线上比拼认知和执行。算力基建的投入期很长,价值外溢需要时间,但正是这种时间差,给了做底层技术的公司一个难得的时间窗口。等到第100天到来的时候,竞争格局早就定死了。现在多解决一个技术问题,多趟平一个基础设施的坑,都是在为那个时刻储备筹码。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询