Cloudflare Agents Week 拆解:从 Sandboxes 到 Project Think,智能体云的五层拼图
2026/9/7 11:41:07 网站建设 项目流程

Cloudflare 首届 Agents Week 刚刚落下帷幕。官方一口气发布了横跨五个层面的产品与功能,把"智能体云"这个概念第一次变成可以上手的工程现实。他们的首席技术官与产品副总裁在欢迎文章里给出一组测算:只要全球知识工作者里有一小部分人各自并行运行几个智能体,需要的并发会话就是数千万个。这不是加几台服务器能解决的问题。整个云计算模型都要因此重写。

传统云计算的根基是"一个应用服务多个用户",一个实例反复处理不同人的请求,资源被共享、成本被摊薄。智能体时代的负载恰恰相反,每个智能体都有自己的状态、自己的工具链、自己的一套长期任务,本质是"一个用户跑多个应用"而不是"多个用户挤一个应用"。这个差异看起来只是方向不同,落到架构上却是全套重做。Cloudflare 想表达的观点是,他们八年前用 Workers 埋下的无容器无服务器模型,恰好是为这一刻准备的。

这次发布不是五六个孤立的新功能,而是一套互相咬合的拼图。Sandboxes 提供运行环境,Mesh 解决网络与身份,Project Think 统一开发体验。AI Search 与 Agent Memory 补齐记忆和检索,智能体就绪度评分把 Web 端也拉进体系。五层缺一层,智能体就只能停在演示阶段。本文按官方叙事线逐层拆解这五层,并在最后给出今天就能动手的落地清单。

在进入细节之前,先交代一个判断框架:智能体云与普通云服务器的区别,不在于机器多不多,而在于工作负载的形态。普通云服务按请求计费、无状态优先,智能体则要长跑、要记忆、要持续存在。因此每一层发布的验收标准只有一条,就是它能不能支撑"思考、行动、持续存在"这三个动作。下面先从计算层看起。

计算层的核心是 Cloudflare Sandboxes 正式发布。它给每个智能体一台"自己的计算机",带 shell、文件系统和后台进程。智能体可以按需启动,也能从上次中断的地方恢复。与传统容器最大的区别是持久性与交互性,智能体能在里面安装依赖、执行终端命令、跑几小时的批量任务。对编码智能体来说,这意味着它们终于有了一个稳定的工作台。

与 Sandboxes 配套的 Artifacts 是面向智能体的 Git 兼容版本化存储。它可以创建数千万个代码库,也能从任意远程仓库复制。开发者把一个 URL 丢给任何 Git 客户端就能开始工作。智能体写的代码、改的数据不再散落在临时目录里,而是有了一个可以追溯、可以回滚的家。自动化流程也因此获得了真正的工程化底座。

Sandboxes 的出站流量还有一个容易被低估的更新。Outbound Workers 为智能体提供可编程的 Zero Trust 出站代理。开发者可以按需注入凭据、强制执行动态安全策略,同时不让不受信任的代码直接接触敏感令牌。这个设计把凭据管理从应用层抽出来,变成网络层的能力。智能体在沙箱里再怎么折腾,也碰不到真正值钱的东西。

计算层还有两个量级上的变化。Durable Object Facets 让动态生成的 Worker 拥有各自独立的 SQLite 数据库,解决了"每个 AI 生成的应用都要独立状态"的难题。Workflows 控制平面重构后支持五万并发与每秒三百次的创建速率,让后台智能体可以大规模长跑。前者解决的是状态隔离,后者解决的是规模上限。两者都直接决定智能体能不能从原型走向生产。

把计算层五件套放在一起看,它其实在回答一个根本问题:智能体应该跑在哪里。答案不是虚拟机,也不是无状态函数,而是介于两者之间的持久执行环境。Sandboxes 负责长任务,Workers 负责短请求,Artifacts 负责产出物,Durable Objects 负责状态,Workflows 负责编排。五样东西互相补充,恰好覆盖了智能体生命周期里的全部计算形态。

安全层紧接着计算层出现。智能体一旦能执行代码,就一定会访问私有网络、调用内部服务、替用户做自主操作。Cloudflare Mesh 把用户、节点和自主智能体统一放进安全私密的网络访问模型。与 Workers VPC 集成后,开发者可以给智能体授予对私有数据库与 API 的限定范围访问权限,不再需要手工配置隧道。网络权限从"开不开"细化到了"开多少"。

受管 OAuth for Access 走的是 RFC 9728 标准。它让智能体可以代表用户完成身份验证,而不是给每个机器人发一个不安全的长期服务账户。服务账户一旦泄露就是整个网络的钥匙,而按用户代理的令牌生命周期短、可撤销、可审计。权限跟着调用者走,而不是跟着 Agent 走。企业里智能体数量一多,这个差异会直接决定安全审计的工作量。

非人类身份管理也同步补齐。可扫描的 API 令牌、增强的 OAuth 可见性、限定资源范围的权限正式推出。开发人员终于可以把最小权限原则落到智能体上,每个令牌只覆盖它真正需要的资源。令牌一旦泄露还能自动撤销,凭据防泄露从靠自觉变成了平台强制。这是智能体规模化落地之前必须跨过的一道坎。

最值得 MCP 玩家关注的是官方分享的企业 MCP 部署参考架构。这套方案用 Access 管谁能连接,用 AI Gateway 管流量与成本,用 MCP 服务器门户做统一治理。他们还推出了 Code Mode 来降低 token 消耗,并在 Gateway 里提供检测影子 MCP 的规则。这些规则能发现团队在不知情的情况下接入的未受控服务器,把灰色地带收进治理范围。

安全层的设计思路可以总结成一句话:智能体是新的主体类型,身份、网络、令牌都要围绕它重新建模。过去我们信任一个进程,因为它跑在我们自己的机器上。现在智能体会代表用户访问任意服务,信任必须被拆成一次一次可审计的动作。这种思路与传统的内网即信任完全不同,默认状态从可信翻转为需要证明。

每个出站请求、每次工具调用、每个令牌的使用都留下痕迹,这是智能体云的安全底线。对开发者来说,这意味着多一层配置成本,日志与审计也需要纳入日常运维。但对运行着大量自主任务的团队来说,这是唯一能长期维持的姿势。安全与效率从来不是二选一,而是先有护栏再有速度。没有审计痕迹的智能体,出了事故连复盘都无从下手。

有了运行环境和安全底座,接下来是智能体工具箱:思考、记忆、交流、观察。Project Think 是这次发布的核心,它是下一版 Agents SDK 的预览,定位从轻量组件到功能齐全的平台。官方用三个词概括它的目标,让智能体可以思考、行动并持续存在。这恰好对应推理、工具调用与状态保持三条主线,也是智能体工程里最难的三件事。

语音管道是 Project Think 里最直观的实验功能。通过 WebSockets 做实时语音交互,大约三十行服务器端代码就能搭出连续语音转文字加文本转语音的智能体。对大多数团队来说,这省掉了自己拼 STT、TTS 与流式传输协议的工程量,也不用再维护一整套音频网关。语音交互从月级项目压缩到周级,这个差距会直接影响产品决策。

Cloudflare Email Service 进入公开测试,让智能体原生收发和处理邮件。智能体正在向多渠道发展,用户在哪里,智能体就应该能出现在哪里,收件箱是办公场景里绕不开的入口。有了官方邮件基础设施,智能体处理工单、自动回复、信息汇总都有了标准通道。邮件这个最古老的协议,反而成了智能体落地最快的场景之一。

推理层方面,Cloudflare 正在把平台统一成智能体推理层。开发者可以调用来自十四个以上服务商的模型,新增了运行第三方模型的 Workers 绑定和扩展的多模态模型目录。模型选择不再绑定单一厂商,路由、限流、成本控制都集中在同一个网关后面。对团队来说,这意味着换模型不再等于换基础设施。

为了把大模型跑在自己网络上,他们公布了定制技术栈。Unweight 是无损推理期压缩系统,能在不损失精度的情况下把模型体积减小最多百分之二十二。GPU 内存带宽是推理成本的核心瓶颈,同样的显存能装下更大的模型、服务更多请求。这是工程优化而不是营销话术,数字背后是一整套带宽利用策略。

Agent Memory 是托管式持久记忆服务,让智能体记住关键内容、遗忘冗余信息。注意它的定位是托管,记忆的存取、压缩、过期策略都由平台处理,开发者只需要声明要记住什么。这恰好回应了行业共识:在当前的 Agent 架构里,记忆不再是可选项,而是与工具调用并列的标配组件。托管服务的出现,把记忆从自建难题变成了配置项。

AI Search 是智能体的搜索原语,动态创建实例、上传内容,用混合检索加相关性加权做跨实例搜索。它把搜索能力从应用层下沉为平台层,智能体不用自己维护索引和向量库,也不用操心分片与容量规划。创建一个搜索实例、把内容丢进去就能开始查询。这个体验比自建向量检索简单一个数量级,更适合快速验证业务想法。

Browser Rendering 升级为 Browser Run,带来实时视图、人工干预、CDP 访问和会话录制,智能体并发限制提高了四倍。浏览器操作是智能体观察世界的重要通道,人工干预意味着在智能体跑偏时可以随时接管。会话录制则让每一次浏览器操作都可回放,这对生产环境的排障非常关键。多模态模型的普及,让浏览器通道的价值还在继续放大。

工具箱这一层的逻辑很清楚:模型、记忆、搜索、语音、邮件、浏览器,全部变成可组合的基础组件。开发者不再需要自己把十几个开源库粘起来,而是像搭积木一样按需取用。每个组件都有清晰的边界与标准接口,换掉一个不会牵连其他部分。这正是智能体云和普通云服务器最本质的区别,平台卖的不是机器,而是能力单元。

好用的基础设施必须出现在开发者已经在的地方,这是 Cloudflare 这次发布里反复出现的判断。cf 是全新的统一命令行工具,目标是让开发者和智能体都能以一致的方式操作将近三千个Cloudflare API。配套的 Local Explorer 用来调试本地数据,把云端状态拉到本地看。终端、编辑器、提示词三处入口被同一套工具串起来,不需要上下文切换。

Agent Lee 是嵌入仪表板的智能体,用户直接在对话框里输入提示词获取信息,不用手动切换选项卡。它使用沙箱化 TypeScript 执行逻辑,定位是可靠的技术合作者,帮助用户做故障排除和配置管理。这相当于把 Cloudflare 自己的运维经验做成了对话式产品。对团队来说,复杂的控制台操作第一次有了自然语言入口,门槛明显下降。

Flagship 是原生功能标志服务,基于 KV 和 Durable Objects 实现亚毫秒级的标志评估。功能开关是灰度发布和 A/B 测试的基础设施,过去依赖第三方服务会引入额外延迟。现在标志评估跑在全球网络上,速度不再是取舍项。智能体做动态行为调整时,这个延迟差异会直接体现在响应质量上。平台原生组件的价值,在这里体现得最具体。

Registrar API 进入公测,开发者或智能体可以直接在编辑器、终端里搜索域名、检查可用性并完成注册,全程不用离开自己的工作流。域名是 Web 应用的起点,把这个动作接入自动化,意味着从想法到上线之间少了一个人工环节。对自动化流程来说,注册域名终于成了可以编程的动作。智能体可以替用户完成从域名到部署的整条链路。

从原型到生产这条链路补齐后,智能体生成的应用有了明确的演进路径:中午的原型可以在同一平台上逐步变成生产服务,而不需要在演示系统和正式系统之间搬来搬去。这条路径的价值在于,它把试错成本降到了可以忽略的量级。开发团队敢反复实验的前提,是失败不需要付出迁移代价。同一套 API 从实验直接滑向生产,这种连续性本身就是效率。真正的门槛从来不是工具,而是组织愿不愿意让智能体进入正式流程。

最后是智能体 Web 层,这层经常被开发者忽略,却决定智能体能不能正确消费互联网内容。智能体在快速增长,但它们访问的互联网仍然是为人设计的。智能体就绪度评分帮助网站所有者了解自己的站点对 AI 智能体的友好程度,官方还公布了 Radar 数据。他们把自家文档打造成了网络上对智能体最友好的资源之一。这份用心,算是身体力行。

AI 训练重定向允许网站通过一个开关,把经过验证的爬虫重定向到规范内容页面,不需要改动源站。软指令拦不住那些抓取废弃内容的爬虫,重定向从机制上保证了智能体拿到的是正确版本的页面。这对内容所有者和智能体双方都是改进。一边保护内容资产,一边提升抓取质量,一举两得。

网络性能层面,请求处理层迁移到名为 FL2 的 Rust 架构,把性能优势覆盖到全球六成顶级网络。他们用真实用户监测数据与 TCP 连接耗时指标来验证效果,确保数字反映的是真实互联网体验而不是机房里的理想环境。对智能体这种高频率、小请求的访问模式来说,连接耗时就是体感延迟。底层架构的替换往往无声无息,等用户注意到性能差异时,收益早就发生了。

共享字典压缩技术也被提前展示,它通过让客户端与服务器共享压缩字典来改善页面加载时间。对智能体密集访问的场景来说,重复内容的传输成本会显著下降。这项技术对普通浏览器的收益同样直接,页面体积减小意味着首屏更快。压缩这件事做到协议层面,才是真正的基础设施优化。字典共享的前提是双方协商,标准化的价值就在这里。

Web 层三件套放在一起看,本质是给网站装上了面向机器的接口。告诉爬虫该去哪,告诉智能体哪些内容是权威,告诉网络如何压缩重复传输。当智能体流量占比持续上升,这些能力会从可选项变成默认项。网站运营者现在不处理,未来会被动接受默认行为。早一步适配,就早一步拿到智能体流量红利。

从工程视角看,这套拼图里最值得马上试的是 Project Think 与 Workers AI 的组合。下面这段代码展示一个真实的 Workers 端点如何调用 Workers AI 完成对话,并读取 Agent Memory 作为上下文。它可以直接部署到 Cloudflare 的免费额度上运行,适合作为智能体云的第一块试验田。代码里的绑定名与真实产品一致,复制到项目里改改就能跑通第一条链路。

import { Agent } from "@cloudflare/agents"; import { Ai } from "@cloudflare/workers-ai"; export default new Agent({ model: "@cf/meta/llama-3.1-8b-instruct", tools: { async queryMemory(env, key) { const row = await env.MEMORY.get(`agent:${env.agent.id}:${key}`); return row ?? "暂无记忆"; }, async saveMemory(env, key, value) { await env.MEMORY.put(`agent:${env.agent.id}:${key}`, value); return "已保存"; }, }, async onMessage(env, message) { const ai = new Ai(env.AI); const memory = await env.agent.callTool("queryMemory", "last_topic"); const reply = await ai.run(env.model, { messages: [ { role: "system", content: `历史话题:${memory}` }, ...message.history, ], }); await env.agent.callTool("saveMemory", "last_topic", message.text); return reply.response; }, });

代码里只出现三个关键绑定:AI 负责推理,MEMORY 负责记忆读写,Agent 负责工具调用与生命周期。真正复杂的会话管理、模型路由与状态持久化全部由平台接管,开发者要写的业务逻辑只剩薄薄一层。这就是智能体云想表达的开发体验:能力单元化,组合即产品。这段代码可以直接跑在 Workers 免费额度上,作为团队的第一块试验田。注意 Tools 与 Memory 都是平台提供的原语,不需要自己实现通信协议。这正是智能体云想表达的开发体验:能力单元化,组合即产品。

如果团队今天就想动手,建议按三条线并行推进。第一条用 Sandboxes 跑通智能体的长任务执行,把原先放在本地或临时容器里的自动化迁移过去。第二条用 Project Think 重新组织 Agent 代码,把记忆、工具、模型绑定收敛到 SDK 层。第三条用 AI Gateway 统一模型入口,先拿到成本和流量的可观测性,再谈规模。三条线互不阻塞,可以分别启动,每一条都能在两周内看到初步收益。

安全配置不要等上线前才做。Mesh 的限定范围授权、受管 OAuth、可扫描令牌这三样应该从第一天就启用,它们的配置成本远低于事后补救。智能体一旦开始访问内部服务,身份与审计就是底线而不是加分项。很多团队踩过的坑,都是先跑通功能再补安全,最后被迫推倒重来。智能体的权限面比普通应用大得多,漏掉一个令牌就等于把内网钥匙挂在门口。早一天把身份与审计接好,就早一天睡得安稳。

对于已经在用 MCP 的团队,官方参考架构可以直接抄作业:Access 管接入、AI Gateway 管流量、MCP 门户管治理,再配合影子 MCP 检测规则。这些组件在 Cloudflare 上都有免费额度,验证成本几乎为零。先跑通一条内部 MCP 链路,再逐步扩大范围,是风险最低的切入方式。治理规则先于接入量建立,后面每接一个新服务器都走同一条审批通道。

需要提醒的是,智能体就绪度评分和 AI 训练重定向面向的是网站运营者。如果你的业务同时运营内容站点,这两项值得优先处理。它们不改变用户体验,却直接影响智能体能否正确消费你的内容。在智能体流量占比持续上升的背景下,内容可见性会越来越依赖这类基础设施。评分工具会直接告诉你缺什么,照着清单补,比瞎猜高效得多。

还要留意一个容易误判的点:语音、邮件、浏览器这些能力看起来是给消费级产品准备的,实际上企业自动化场景同样需要。工单系统接入邮件通道、客服机器人加上语音入口、流程机器人操作内部网页,都是现成的落地场景。多通道不是炫技,而是智能体触达用户的必要路径。企业智能体一旦进入生产,渠道覆盖度就直接决定业务闭环能不能成立。

成本账也要算清楚。Unweight 的百分之二十二模型压缩、AI Gateway 的集中路由、Flagship 的亚毫秒评估,每一项都在降低单位任务的推理成本。智能体规模化之后,成本结构从固定资源变成按能力计费,财务模型也随之改变。提前把成本观测做起来,比事后优化账单容易得多。把单位任务成本写进每次发布的验收清单,成本失控的概率就会小很多。

最后回到开头的测算:数千万并发会话不是营销数字,而是智能体规模化的真实约束。谁先把计算、安全、工具箱、生产路径和 Web 适配这五层拼图拼齐,谁就拿到了下一阶段基础设施的入场券。现在正是从演示走向生产的窗口期,动手越早,试错成本越低,这是这轮发布给所有开发者最直接的信号。接下来几个月,差距会体现在谁先把这套平台用起来。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询