作者 | 姚戈
有关于AI的开发, 还有AI的大量落地, 这正在将一批过去并不够显眼的基础设施问题, 推到台前。
前两年, 在市场里提及AI算力时存在着一种用于使认知简便的说法: 就AI算力而言, 它几乎是跟GPU相等同的。
跟这相类似的简化情况是在云上出现的, 在好多人看来, 云计算就跟“租算力”是一样的, 云好似一座远程大机房, 它承担着将算力供应出去的职责, 至于应用究竟是怎样运行、协作以及演进的情况, 常常会被放置在次要的位置上。
这套认知已经脱离产业事实了。
AI产业渐渐从仅仅着重于模型训练, 转而同时看重模型部署、推理效率以及真实应用落地。在Agent蓬勃发展的情形下, AI工作负载正变得更加碎片化、更加动态, 还更加依赖高频任务调度、内存管理、工具调用以及系统编排。
基于AI负载类型出现变化, 且其规模有所变动, 云计算被赋予了重要使命, CPU也被给予了新的期待。
首先,CPU 正在重新获得更高的关注度。
Agent负载具备的特点, 当前正在促使市场上对高核心数CPU的需求不断升高, 特别是在云端多租户、沙箱执行、会话并发以及多Agent协作等场景当中, CPU承担着任务编排的关键职责, 承担着执行铺开的关键职责, 还承担着资源调度的关键职责。
已然传导至业务侧呈现出了这种变化。AMD全球副总裁、中国区互联网事业部总经理刘宏兵也有所提及, 在过去的几个月当中, 公司始终都在竭尽最大可能性去保障客户需求以及AI基础设施。
在这同一时间, 阿里云智能集团研究员、容器服务负责人易立称, 云计算的角色正经历着改变, 过去云计算主要给予的是算力, 然而当前, 云还得提供一整套可让智能体安全运行、稳定交付且持续进化的平台能力。
因作为云原生的操作系统, 容器的重要性再度凸显, 它是Agent身处云端之时进行部署所采用的颇为流行的承载形式, 能够提供标准化且轻量隔离的运转环境, 还会协同编排系统达成任务调度以及弹性扩容, 进而为上层的持续治理与监控筑牢根基。按照发布的《State of AI》报告所示, 在Agent的开发或者生产环境里, 有94%的受访者运用容器, 其中98%延续了传统软件时代的云原生工作流。这意味着什么呢, 那就是一当 Agent 从进行实验的阶段转而迈向投入生产的阶段时, 整个行业实际上并不是选择放弃已经存在的基础设施体系, 相反的是, 行业对于这些历经检验并且得到证实的交付以及治理能力表现出了更为强烈的依赖之情。
这件事背后所对应的, 实际上恰恰是 Agent 开发人员与使用者最为在乎的几件事情, 它们分别是安全, 是稳定, 以及可持续迭代。
近期突然火爆起来的 Agent 项目, 其中涵盖了 Kimi 的深入研究, 还有通用 Agent 模式“OK ”以及其他一些类别的产品, 这些项目及产品的背后, 都有着阿里云给予的支撑, 此支撑助力它们得以呈现。并且, AMD 还为阿里云提供了底层算力方面的支撑。
云计算厂商为支撑这一轮变化, 做了哪些调整, 芯片厂商为支撑这一轮变化, 做了哪些调整, 云计算和芯片厂商如何共同应对 Agent 负载带来的新压力?
在本期的《C位面对面》里, 极客邦科技的创始人兼CEO霍太稳, 邀请了阿里云智能集团研究员兼容器服务负责人易立, 还有AMD全球副总裁兼中国区互联网事业部总经理刘宏兵, 一同探讨Agent时代基础设施正出现的变化, 以及这些变化会将云计算和芯片导向怎样的方向。
技术和商业的早熟,推动龙虾爆发
由于其爆火, 使得行业头一回更为直观地瞧见 Agent 接管工作具备的可能性。紧接着, 越来越多的厂商着手推出“国产龙虾”, 将部署门槛、使用成本以及上手难度一并予以拉低。其结果便是, Agent 不再仅仅是少数人的玩具, 而是得以在更广的范围内迅速扩散。
易立身为阿里云智能集团从事研究工作的人员且担任容器服务负责人, 已然将龙虾切实嵌入自己工作流程之中, 他于各异环境里部署了具备不同角色的Agent, 云上的Agent, 会于他上班途中预先整理好其留意的新闻、热点以及技术论文, 身为容器服务团队负责人, 他还需要那种进行24小时值守的SRE Agent, 用以协助分析线上集群所出现的问题、处理异常情况, 而桌面端的Agent, 则承担日程整理、技术规划、会议安排以及纪要输出等职责。
InfoQ留意发现了更为“激进”的应用, 霍太稳声称, TGO鲲鹏会硅谷分会长黄东旭跟超过2500个智能体有协作, 已然重写了以往一个团队花10年才达成的TiDB体系, 他每日耗费的Token数量远超10亿。
与此同时, 一些平台着手使 Agent 跟 Agent 之间直接进行通信以及协作, 智能体渐渐构建成网络结构, 不再单单是围绕人而展开。
对这种规模跃迁予以观察后, 刘宏兵, 也就是 AMD 全球副总裁和中国区互联网事业部总经理, 打趣着说道, 说不定未来会冒出个“龙虾社会”。随着越来越多的人同时具备、调用、依靠多个 Agent, 而且这些 Agent 相互协作, 这个略带玩笑意思的说法, 正变成一种实际情况。
这一轮的增长, 并非仅是由技术能力所引发的, 而是跟商业闭环比往昔来得更为迅速存在关联。
就像 AMD 全球副总裁、中国区互联网事业部总经理刘宏兵所讲的那样, 互联网客户以往一直存在着时间焦虑, 具体是什么情况? 也就是前期有着大规模投入, 可是到底什么时候才能够真的实现变现? 不管是早年的云计算, 还是后来的 AI, 产业都曾经历经了很长的投入阶段, 商业闭环到来的速度十分缓慢。
此番 Agent 热潮的独特之处在于, 于模型、平台以及应用层面来看, 整个链条里的变现速度均显著加速了。那些提供 Token 以及云资源的大厂能够更迅速地获取收入;而个人用户与中小企业, 也可以更为直接地将 Agent 转变为效率的提升, 甚至是业务收益。
AI 负载的新需求
在 Agent 相关应用趋向于大规模地实现落地的趋势之下, AI 所涉及的工作负载处于一种状态: 这一状态呈现出经历结构划分而产生变化的情况。
和传统软件处理那种具有确定性, 边界清晰的任务不一样, Agent得面向开放式目标去自主作出决策, 持续与环境交互, 并执行长链路任务。这样的一种范式转变呢, 造成了Agent在应用 , 推理以及训练这三个层面展现出和传统AI负载完全不相同的技术特征。
在应用层面, Agent 不仅不再只是单纯的简单文本生成那般了, 它能够进行工具调用、连接系统, 以至还能执行代码。安全、隔离以及可控性变成了首要前提。各个 Agent 都得在沙箱环境里运行, 依靠计算、存储和网络的协同调节才行, 这样才能够既保证安全又高效地达成任务。与此同时, Agent 常常会把复杂任务分解成多步并行的动作情况是这样的, 比如新闻检索、数据分析或者子 Agent 协作这些方面, 这就对冷启动延迟、并发吞吐能力提出了很高的要求。不止这样, 还要再加上任务跨越了多轮对话, 并且是多阶段执行, 状态保存以及休眠唤醒的能力, 这就变成了保障连续性和降低成本的关键之处。
推理层的负载特征出现显著改变, 变化明显, Agent的上下文窗口不但涵盖用户指令, 除此之外, 还需对规则定义、工具返回数据以及历史交互轨迹进行动态嵌入工作, 致使内存占用和计算开销呈现出非线性增长态势。这种情况要求底层架构摒弃单一GPU加速的传统想法, 要做出转变, 转向CPU、GPU、内存以及高速网络的协同优化方向, 从而在确保长窗口推理稳定性的同时达成成本控制目的。
易立还指出, Agent模型训练跟传统的预训练差异显著。传统预训练更看重GPU性能, 然而, Agent模型得在真实场景里头模拟、开展对复杂任务决策的学习, 它的能力在很大程度上由对工具调用的把控来决定, 这便意味着, CPU计算吞吐、内存带宽以及分布式调度架构在一起时的协同效率, 反倒成了牵制训练迭代速度的关键瓶颈。
从整体上来说, Agent Infra的核心所要探讨的命题, 早就已经不是让模型能够高效地运行了, 而是要达成智能体的安全隔离, 以及实现智能体的状态管理, 并且还要达成智能体的规模化运行。
Agent Infra 的四个关键问题
AI负载出现变化, 这也对行业真正在意的指标产生了改变。刘宏兵表示, 以往大家更为关注模型刷分, 会观看榜单, 查看参数, 留意单点能力;转而到了生产环境当中, 客户最终所关心的, 是能否稳定地交付业务结果, 以及端到端的体验和ROI。
于这样的前提状况之下, Agent Infra起码是要去解决四个方面的问题喽: 其一为强隔离方面的问题, 其二是高并发以及低时延方面的问题, 其三是状态和记忆管理方面的问题, 其四为长链路执行方面的问题。
首先是强隔离。
文本生成并非 Agent 的唯一功能, 它还能够调用各类工具, 接入 , 进而执行既定代码。至此阶段, 安全已非可有可无的后置补充, 而是关乎所有部署的强制性前提。基础架构需提供安全沙盒, 实现细粒度权限管控确保隔离, 还要提供计算存储网络一体化保护。唯有先精细化界定范围, Agent 方可从基础通畅迈向可管可控。
第二个问题是高并发和低时延。
实施 Agent 的时候, 常常会把一项繁杂任务分解成好多个有着并行推进特征的步骤, 像是工具调用步骤, 子 Agent 协作步骤, 搜索动作步骤以及分析动作步骤。这就表明了, 系统实际所面对的并非少量能够持续运行的大任务, 而是数量众多并且是同时涌入进来的小任务。沙箱系统自身具备的冷启动时延特性以及并发吞吐能力, 会对 Agent 的执行效率产生直接影响, 并且对于用户体验同样会带来直接影响。
第三个问题是状态和记忆管理。
Agent的任务常常跨越好多轮对话, 并非一次调用就完结。它得保留上下文, 记住用户意图, 况且在任务中断之后接着延续此前的状态。所以, Agent沙箱基础设施必定要拥有高效的“休眠—唤醒”能力, 能使任务如同人一般, 随时自行暂停, 随时再度恢复, 维持记忆连贯性。
最后,是长链路带来的系统复杂度。
Agent, 不是那种一次性的模型响应, 它是一个有着持续多轮交互的过程, 是要持续规划的过程, 是会调用工具的过程, 是会观察结果的过程, 是会修正决策的长链路过程。像这样的执行方式, 能提升复杂任务的完成质量, 不过也会极大地放大系统复杂度, 会放大Token消耗, 会放大故障排查难度。所以, Agent Infra, 不单单是“把Agent 跑起来”的运行环境, 它是支撑Agent在生产环境里稳定的系统, 是支撑Agent在生产环境中可控的系统, 是支撑Agent在生产环境中可观测的系统, 是支撑Agent在生产环境里可持续优化的系统。
再进一步深入去看, 未来的智能形态会朝着由单智能体朝着动态生成的集群进行进化。Kimi的Agent Swarm, 对于Agent (ACP)的支持均指向同一个方向, 那就是: Agent从单体应用, 逐渐演变成分布式、能够自我规划、自我组织的软件系统。而这就需要Agent Infra的职责, 从单一智能体的生命周期管理, 提升为对于动态协作集群的编排、治理以及资源统筹。
该架构的演进, 与此同时带来了效率范式的重新构建, 于企业方面, 竞争的逻辑从对固定流程的优化转变为依靠智能来驱动的价值创新, 借由多智能体通过协同达成从数据到决策的自动化闭环, 在个人层面, 开发者能够凭借“一人多 Agent”的模式完成团队级别的产出。
向着集群化协作以及长链路执行引致的工程复杂性, 易立表明, Agent 的开发范式正在由早前的提示词工程转至上下文工程以及且指Agent ;该Agent Infra需要把安全沙箱、全链路可观测性、自动化评测体系以及安全护栏等积淀成标准化平台能力哟。
云计算与芯片的新任务
符合新的负载形态, 符合 Agent Infra 的要求, 云和 CPU 的任务, 均处在发生变化的状态之中。
阿里云有所察觉, 云的角色不再单单是供给算力, 还得供给那成套的能使智能体安全运转、稳定交付且持续进化的平台能力。也就是说, 云正从“资源池”更进一步转变为“Agent 工厂”, 需要对智能体怎样启动、怎样隔离、怎样调度、怎样恢复、怎样监控, 及怎样在生产环境里获得持续性运营负起责任。
那些正在积极推进 Agent 创新的新锐 AI 厂商, 已然开始着手联合云与芯片厂商去处理解决这个问题。其中, 不管是 Kimi 的深度研究以及通用 Agent 模式“OK ”, 还是 的 以及别的全栈 Agent 产品, 它们背后都脱离不了阿里云所起到的支撑作用, 然而 AMD 有为这一套云基础设施供给了更底层的算力基础底座。
这种变化, 首先在运行时设计方面有所体现, 为了去应对Agent的强隔离需求, 以及突发式并发的需求, 云基础设施需要更快速地创建执行环境, 同时也需要具备更强的弹性调度能力。
正因如此, 阿里云 ACS Agent 能够达成百毫秒级别 的沙箱创建, 拥有按需供给的弹性资源池, 还围绕安全 的。与挂载能力 、身份授权能力以及审计能力共同, 构建起了端到端 的隔离。
具有功能的 ACS Agent, 借助自定义模板预热这一方式, 达成将镜像、依赖以及配置预先向缓存里进行有效加载。而后并加上特定的具备特点的某个功能, 成功能让拉起到 Agent 实例的时间, 在 20 毫秒到 40 毫秒这个范围中被大幅度紧缩。与此同时, 它还能够给予支持, 在弹性伸缩方面, 对于最高每分钟 15000 个沙箱的情况, 在任务触发之际, 依据需求来创建, 而在结束之后, 则会自动地释放掉。
Agent的另外一项关键要求, 是云得更会处理“有状态”的任务, 传统云服务更善于处理无状态、短生命周期的请求, 然而Agent的好多任务要跨越多轮对话, 甚至在暂停一阵子后再接着执行, 所以, 基础设施得能保留上下文、保存运行现场, 并且在任务恢复时以差不多实时的速度把它重新拉起, 对用户来讲, 这是“记忆连续”, 对底层系统来说, 却是更繁杂的状态管理能力。
面对要解决的这个问题, 阿里云会将运行环境跟状态进行解耦, 并且借助持久化存储来保障任务续接入, 状态会实时保存在ESSD以及NAS之中, 即设碰到点故障、实例迁移或者弹性调度, Agent也能够凭借历史状态迅速恢复上下文, ACS Agent与此同时会提供运行时能力, 让实例于迁移或者网络波动阶段依旧能够维持执行链路不中断。先增添上, 阿里云容器服务ACK充任统一控制面, 其职责所在为负责实施集中处理, 针对任务编排以及状态管理这两方面的事宜 , 原本身存在于单机之上的逻辑, 此刻已然被提升转变成为平台级能力。针对长链路任务来讲, 于这种情形之下意味着系统不但能以快速的方式予以拉起, 而且还能够在出现中断之后, 依旧可以接着持续运行下去。
正因Agent的状态是被持久化存储着的, 所以任务能够随时去暂停或者迁移, 且不会让执行被中断, 这使得计算资源能够按照需求去释放而非一直被占用;与此同时, 对于每个Agent实例而言, 其恢复还有调度都需要秒级响应、高并发予以支持以及具备灵活扩缩容的功能。正是处于这样的情形之下, 有着事件驱动、动态编排以及细粒度调度的特性, 天然地就契合于Agent的状态管理还有弹性需求。
过去, 有着一种更多被视作是一种能简化开发以及节约资源的云服务模式, 然而呢, 在 Agent Infra 场景当中, 它所具备的重要之处可不单单只是“省资源”这一点, 而是在于其拥有的事件驱动、动态编排、细粒度调度这样的机制, 这种机制天然地就更加贴近 Agent 的工作方式。函数计算沙箱以及 ACS Agent 的运行机制, 跟 Agent 的并发执行、动态触发、会话亲和、快速弹性存在着一种高度的一致性。这有着这样的意味, 在Agent时代, 它不再单单只是一个能够被选择的项目了, 它极有可能会演变成许多智能体应用的默认的基础部分。
另一侧, AMD所察觉到的首个改变是, 在Agent时期, CPU被置于更为关键的位置。
AMD 作出这样的判断, 即 Agent 业务会将算力需求, 从集中式的大任务那里, 朝着高并发的海量小任务方向来扯动。在如此这般的变化情形之下, CPU 的角色被再次进行了抬高。缘由在于, 任务编排、工具调用、数据处理、安全隔离以及状态管理, 这些对于支撑 Agent 能够正常运转的环节, 其更多依靠的是通算能力, 并非仅仅只是 GPU 的矩阵计算能力, 是这样的情况。
在 Agent Infra 针对芯片所提出的这一系列要求当中 , 至少涵盖了三个不同层面。其一 , 是需要具备更高的多核并发能力 , 其目的在于能够顺利承接大量同时涌入的小任务以及沙箱线程。其二 要求有更强的单核以及指令集效率 以便加速检索 解析 压缩 加解密 向量计算等工具调用背后涉及的通用计算。其三 要有更高的内存带宽以及 I/O 能力 以此用于支撑上下文保留 状态维护以及快速恢复。
以第五代AMD EPYC Turin来讲 , 其有着192核 , 具备全链路AVX - 512特性 , 还有12通道DDR5 , 在Agent场景里 , 这些指标能够满足高峰期并发承载的相关需求 , 并且还能优化单任务完成的时间以及执行环境恢复的速度?
在安全上,云计算与芯片也需要联合解决新的问题。
易立讲了这么个事儿, Agent, 一开始是个聊天伙伴, 后来成了实实在在的工作同事, 再之后, 它就会去调用工具哩, 还会执行命令,然而, 它并不承担啥责任, 这样的情况, 给用户带来了新挑战, 也给基础设施构建者带来了新挑战哩。易立觉得, 不能理所当然地认为Agent不会犯错, 一定要给它一个受到约束的执行环境, 得让它在可控的边界范围之内去行动。
因此, 安全理应成为平台默认具备的能力, ACS Agent 在计算层面通过为每个 Agent 实例供给独立内核, 使得安全边界近乎完整虚拟机, 还准许开发者进一步掌控其是否能够访问互联网, 是否能够访问公司核心应用, 与此同时配合细粒度授权以及安全审计。
因 Agent 权限增大, 仅凭借往昔最小权限、纵深防御这般思路, 便开始显现乏力。易立称, 于下一代 Agent Infra 当中, 数据可用却不可见会变成一项愈发关键的需求。像关乎支付、账户、隐私数据的情形, 企业固然期望 Agent 能够达成任务, 然而并不愿其直接展露用户的银行密码、账号或者其他敏感信息。所以, 机密计算开始从一种偏向底层、偏向专业的能力, 迈向 Agent 基础设施的核心位置。代表着机密计算能力的, 是以AMD的SEV, 它能使数据于执行进程里始终处于受保护情形, 仅能被受控的Agent运用, 然而无法被平台方或者别的恶意Agent直接进行调用。
安全始终伴随代价。
刘宏兵表明, 要是加密致使CPU算力出现损失, 损失幅度达到30%至50%, 那么多数企业是很难承受得住的, 而AMD依靠把CPU内部硬件加密性能损耗控制在3%至5%以内这样的成果, 明显地提升了客户接受程度。
假设存在上一轮的AI基础设施竞争, 其核心要点为将模型训练得更大, 同时把GPU堆积得更多, 不过, Agent时代所真正检验的, 却是究竟是谁能够把一整套系统组织起来。
如此这般究其原因, 云计算要面临角色重新的标定, 芯片同样要经历角色的被另样定义, 云不再单纯只是资源集成的池子, 而是要转化成运行与维系治理智能体的平台场域, CPU 不再仅仅作为 GPU 的次要辅助角色, 更急需再塑、变为并发以及状态、安全再者成本的关键支撑点。
现今外界所目睹的, 是Kimi等厂商旗下的Agent产品于台前迅速推进, 然而真正左右它们前行距离的, 常常是背后那套更为繁重、更为复杂且鲜少被察觉的基础设施。
今日好文推荐
会议推荐
Agent, 从Demo迈向工程化, 究竟欠缺什么? 安全与可信这道难关, 要怎样跨越? 研发体系若不进行重构, 还能够支撑多长时间?
在2026年的AICon上海站上, 13个极为重磅的专题当前已经上线, 在此真诚地邀请你登上台去分享实际作战的经验, 在2026年的AICon中, 满心期待着与你一路前行, 赶快过来扫描二维码, 把8折的专属席位锁定或者提交参与演讲的议题。