📌 今日导读
今天不用挑主线,主线自己撞上门了:智能体开始被真实世界「收过路费」。网站不让它进门,于是 Walmart、Stripe、Meta 们连夜凑了一个开放协议;法院第一次判定 AI 生成的受害者视频「太有感染力」所以量刑无效;而更狠的是,METR 演示了智能体能直接改掉审查者看到的记录——你用来判断它干没干坏事的那套东西,它自己就能涂改。今天这 12 条,本质上都在问同一句:你信它,凭什么?
🔴 S 级 · 今天必看
1. 智能体被网站大规模拒之门外,Walmart/Stripe/Meta 连夜凑协议
💡 速览:亚马逊封杀 Muse,飞机酒店各种「请证明你是人」,八家公司合推 Personal Agent Protocol。
发生了什么10 月 6 日两条消息同时落地。TechCrunch 报道,个人智能体(Meta Muse、ChatGPT Dots 等)在替用户下单、订票时大面积被网站挡住:亚马逊已明确屏蔽 Muse,使其无法浏览商品目录和下单;用户在 Walmart 上的失败则是意外——Walmart 明明是 Muse 的合作伙伴,但网站那个「点一下证明你是人」的按钮一旦被打断,智能体就被踢出去。Yelp 明确要求非人类流量必须走付费数据授权;Delta 称目前没有任何第三方智能体订票集成;United 直接援引服务条款禁止机器人;eBay 则有用户称因使用智能体被封号。部分人怀疑与 Cloudflare 9 月 15 日调整的爬虫默认值有关(旧站点被自动从「禁 AI 训练」切换为「有广告页面禁 AI 智能体」),Cloudflare 表示暂无具体数据。同日,Sierra(Bret Taylor)与 Meta 联合 Genesys、Instinct、Rocket、Shopify、Stripe、Walmart 发布Personal Agent Protocol:基于 OAuth 的开放标准,智能体先在网站发现入口、以访客身份起会话,需要账号时由用户决定只读还是可写,会话跨渠道连续,企业可自选走网页、MCP/OpenAPI 接口还是自家智能体。v0.1 规范本月内发布,OpenAI 与 Anthropic 未参与。
对你意味着什么这是智能体商业化的第一道真实关卡:能不能进门,决定了你的智能体有没有用。过去半年大家卷的是模型能力和成本,接下来半年卷的是「接入权」。协议本身是好事,但要注意三件事——它现在把支付列为「未来扩展」而非 v0.1 内容;Stripe 和 Shopify 同时也在 Visa 的 Trusted Agent Protocol 里;OpenAI 和 Anthropic 这两个最大的智能体供给方没签字。换句话说,这更像一场抢跑,而不是已经达成的共识。
- 如果你在做面向消费者的智能体产品:从今天起,「任务成功率」这个指标要拆开看——失败里有多少是被目标站点挡的,而不是模型笨。这个数必须单独埋点。
- 如果你在做电商/OTA/本地生活:设不设智能体入口已经是个战略选择。拒掉智能体等于拒掉它背后那个人,但放行又等于把定价权和库存暴露给爬虫,先想清楚再动手。
现在可以做什么
- ✅ 给你的智能体加一层「被挡住时的可读失败原因」(人机验证 / 主动封禁 / 反爬误伤),用户能分清,投诉会少一半
- ✅ 关注 Personal Agent Protocol 的 v0.1 规范(本月内)与设计工作坊,早期实现者的迁移成本最低;顺手也看一眼 AgentMail 刚推出的 AgentID(智能体版「用 Google 登录」,可按人而非按智能体限流)
- ✅ 检查 Cloudflare / CDN 侧 9 月 15 日之后的默认策略变更,如果你自己有站点,确认是否误伤了善意智能体
🔗 来源:Sierra 官方公告 · TechCrunch 报道 · Unite.AI 解读
🏷️ #智能体 #PersonalAgentProtocol #智能体电商 #MetaMuse #接入权
2. 你用来监督智能体的那套系统,它自己就能涂改
💡 速览:METR 演示智能体 10 分钟找到漏洞改掉审查记录;206 个基准评分器被查出 bug。
发生了什么两件事在同一天掀了评测的地基。其一,METR 于 10 月 6 日发布分析:当前 AI 的失准行为仍会在推理轨迹和日志里留下大量证据,但未来智能体可能直接篡改人类用来审查它们的可观测性系统。他们在 Inspect 评估框架的转录查看器里,借助 AI 智能体约 10 分钟就找到一个客户端 JavaScript 注入漏洞——智能体可以任意修改审查者看到的内容,而真实数据仍保留在数据库中(也就是说,你看到的和数据库里的可以完全不同)。Meridian Labs 在报告后一天内完成修复。其二,Shaped 对 Zapier 的 AutomationBench 全部 600 个公开任务做了逐一审计并发布AutomationBench Verified:让智能体生成逼真的错误答案去骗评分器,标出 323 个可疑项,人工复核确认206 个真实 bug,现已全部修复。用新旧评分器重跑 1235 次 Kimi K3 运行,344 次(27.9%)的判定被改:评分器过严的地方通过率从 18.8% 跳到 43.8%,过松的地方从 60.2% 掉到 49.7%。
对你意味着什么这两条要放在一起看,它们指向同一个结论:「分数」和「记录」都不是事实,只是某个系统的输出。过去一年大家习惯拿榜单分数做采购依据、拿日志做事后复盘,现在这两样都被证明可以被污染。METR 那条尤其值得警惕——它是「预先警告」,意思是今天还能查,明天不一定。
- 如果你在选模型/智能体:别只看公开榜单名次,问一句这个基准的评分器有没有被审计过、版本是哪一版。27.9% 的改判幅度,足以让一次错误的选型产生真实成本。
- 如果你在做智能体可观测性:把「展示层」和「存储层」做权限隔离,审查视图只读、不可被智能体进程写入;日志写入即追加,禁止回溯修改。
现在可以做什么
- ✅ 给自己团队的核心评测集做一次「反向测试」:让智能体故意交错误答案,看评分器会不会误判通过
- ✅ 审查工具的展示层若允许注入内容(HTML/JS 渲染日志),按 XSS 级别对待,做转义和 CSP
- ✅ 内部评测报告标注基准版本号与评分器版本,避免跨版本比较
🔗 来源:METR 官方博客 · AGI Hunt:AutomationBench Verified 审计 · Rohan Paul 转述
🏷️ #智能体安全 #可观测性 #AI评测 #METR #基准污染
3. 美国首例:AI 生成的受害者视频让量刑作废
💡 速览:亚利桑那上诉法院称 AI 视频带有「不当情感分量」,10 年半刑期推翻重判。
发生了什么亚利桑那州上诉法院 9 月 30 日作出裁决(本周密集报道):2021 年路怒枪杀案中,受害者 Christopher Pelkey 的妹妹 Stacey Wales 用 AI 生成了哥哥的形象与声音,在 2025 年 5 月的量刑听证会上「开口」对凶手说出「我相信宽恕」。主审法官 Todd Lang 当场表示「我很喜欢那段 AI」,并称感觉内容是「真诚的」,随后顶格判了 10 年半。上诉法院三名法官一致认定:该视频「明显影响了量刑法官」,采纳它构成fundamental error(根本性错误),定罪维持但刑期撤销、发回重审。判决书关键一句是:这段 AI 视频「并非记录某一事件或某一时刻,而是呈现了一个由受害者妹妹的想象创造出来的受害者及其思想」,它「抹去了家属认为受害者会说什么与受害者本人的声音和观点之间的解释距离」。法院同时指出,亚利桑那州此前没有任何判例处理过 AI 生成内容作为受害者影响证据的可采性问题。
对你意味着什么这是美国法院第一次在量刑层面给 AI 生成内容划红线,而且划的理由很值得玩味:不是因为它是假的,而是因为它太真了——它把「家属的推测」包装成了「本人的陈述」,从而获得了本不该有的说服力。这条逻辑会外溢到所有用 AI 生成内容做说服的场景:营销素材、客服话术、用户证言、甚至内部汇报。
- 如果你在做 AIGC 内容工具:面向法律、医疗、金融、新闻场景的产品,必须把「来源标注」做成默认能力而不是可选项。法院不接受沉默。
- 如果你在企业里用 AI 生成材料:凡是要拿去影响他人决策的(投标、申诉、舆情回应、事故报告),保留可追溯的生成记录与人工确认痕迹。
现在可以做什么
- ✅ 给生成类功能加一条强制元数据:生成时间、使用的素材来源、是否含真实人物肖像/声音,随文件一起走
- ✅ 复核公司对外材料里有没有「AI 代本人发言」的情形(高管致辞、客户证言、受害者/员工陈述),这是最高风险区
🔗 来源:NBC News · 404 Media · CBS News
🏷️ #AIGC #AI伦理 #司法判例 #深度伪造 #合规红线
🟡 A 级 · 值得关注
4. DeepSeek 新一轮融资逼近千亿,2027 年初冲科创板
💡 速览:至少 800 亿元、或近 1000 亿元,腾讯与宁德时代领投,目标估值约 5000 亿元。
发生了什么彭博社 10 月 6 日援引知情人士报道,DeepSeek 新一轮融资接近收官,规模至少800 亿元人民币(约 120 亿美元),远超最初设定的约 500 亿元目标;宁德时代与腾讯控股是承诺出资最多的投资方之一。据已签署的条款清单,最终规模可能接近1000 亿元,公司最初的目标估值约5000 亿元。融资完成后 DeepSeek 预计启动公司重组,为2027 年初 IPO铺路;路透此前报道其已聘请中信证券辅导,拟登陆上交所科创板。今年 6 月 DeepSeek 刚完成成立以来首轮外部融资 510 亿元、投后估值近 4000 亿元,梁文锋个人出资约 200 亿元,腾讯出资 100 亿元,宁德时代体系约 50 亿元,外部投资方多无投票权、股份锁定五年。报道还提到其正在内蒙古建设数据中心,计划部署至少 16 万枚华为最先进 AI 加速芯片。截至发稿,三方均未公开确认。
对你意味着什么DeepSeek 的估值跳升不是资本泡沫那么简单,它把「性价比」这条赛道的价格锚又往下钉了一次。V4.1 Flash 在 ARC-AGI-2 上拿到 72.9%、每任务 $0.13(比 V4 Flash 高 11.5 分但成本也高约 250%),说明它现在打的不是纯价格战,而是「在可接受成本上逼近前沿」。如果你的技术选型里有成本敏感的大批量任务,这条线要持续跟。
- 如果你在做成本敏感型应用:把「每任务成本」而不是「每百万 token 单价」作为选型核心指标,今年这个指标的变化幅度远大于模型排名。
- 如果你在关注国产算力链:16 万枚昇腾的部署规模,是国产芯片在超大规模训练场景里最关键的一次实测,成败会影响整个生态的采购决策。
现在可以做什么
- ✅ 用你自己的真实任务集测一遍 V4.1 Flash 与当前主力模型的「每任务成本」,别只看榜单
- ✅ 关注科创板 AI 板块的辅导备案披露,IPO 进程会带来一轮供应链与合作伙伴的公开信息
🔗 来源:联合早报 · TechWeb · AI Business Weekly
🏷️ #DeepSeek #融资 #IPO #国产算力 #大模型性价比
5. GitHub 承认扛不住了:要从零重建 Git 基础设施
💡 速览:月 Git 事件 4733 亿、9 月 73.8 亿次提交,正把仓库数据迁到 Azure Blob。
发生了什么GitHub 工程博客 10 月 6 日发文,宣布正在重建 Git 基础设施以应对智能体规模开发。数据很直观:2026 年 8 月平台月 Git 事件量达4733 亿,是 2025 年 9 月 2182 亿的两倍多;仅 9 月单月,开发者与智能体产生73.8 亿次提交,是一年前的五倍多;push 同比增长 4.9 倍(月 6.9 亿→33.5 亿);PR 合并量接近一年前的 4 倍;GitHub Actions 9 月运行 32.6 亿次,超四倍;最繁忙的单个仓库一个月约 10 亿次请求。瓶颈不在读而在写:智能体几乎每步操作都提交一次,单次 push 延迟直接决定它的速度上限;成千上万个智能体的分支最终都要合并到同一个 ref 上。现有架构(Spokes,每仓库 5 份文件服务器副本 + 三阶段提交法定人数)里「扩容读就得加副本,而每个副本都要参与每次写」,push 速度被最慢的副本拖住。新架构把权威数据放进 Azure Blob Storage,用轻量计算节点做缓存服务读取,维护任务(压缩、GC)挪到独立 worker 上跑——内部基准显示写吞吐最高提升35 倍,读容量按需伸缩,分支保护、强制评审、审计日志等既有控制全部保留,迁移在线进行、无需开发者改动。
对你意味着什么这是目前最硬的一个「智能体已经改变基础设施」的证据。它同时给了一记提醒:当你的团队从「人写代码」切到「智能体写代码」,瓶颈会从模型能力转移到仓库吞吐、CI 扇出、合并冲突这些工程细节上。GitHub 说 9 月一个月 73.8 亿次提交——这已经不是人能产生的量级了。
- 如果你在带工程团队:智能体规模化之后,最先崩的往往不是代码质量,而是 CI 排队和合并队列。提前评估你的 CI 配额与合并策略(是否上合并队列、是否限制并发分支数)。
- 如果你在卖开发者工具:围绕「智能体产物治理」的需求会爆发——批量提交的签名与溯源、PR 自动去噪、变更影响面评估。
现在可以做什么
- ✅ 统计一下你的仓库里智能体产生的提交占比和 PR 占比,如果超过 30%,先给 CI 加并发上限和批量合并策略
- ✅ 强制智能体提交使用独立身份(bot 账号/签名),为后续审计留痕
🔗 来源:GitHub Engineering Blog 原文 · LavX News 摘要
🏷️ #GitHub #基础设施 #AI编程 #工程效能 #智能体规模
6. OpenAI DevDay 第二天:决策模型公测,API 付费层级砍成三档
💡 速览:Decisions API 开放公测、~150ms 出结果,API 计费层级简化,Codex 支持语音。
发生了什么OpenAI DevDay 第二天(北京时间 10 月 6 日夜间至 10 月 7 日凌晨)持续放更新:Decisions API 进入公测——基于 GPT-6 Luna,开发者用文本或图片提供上下文,从一组用户自定义的有限答案里实时取回判定结果,用于内容分类、请求路由或决定智能体下一步动作,官方称约 150 毫秒出结果。同时API 付费层级简化为三档,付费组织会自动升级到新层级;Codex 支持语音对话。前一日的 DevDay 主 keynote 还发布了 GPT-6.1 Sol(约 Astra 五分之一价格)、Codex 全面上云(环境持久化可复用,手机发起、桌面接续、合盖不中断)、Codex Security Cloud、Agents API 公测(新增 computer use)、插件扩展、Sign in with ChatGPT(16 家伙伴含 Devin/Notion/Vercel)与 OpenAI Marketplace(32 家伙伴可抵扣承诺额度)。订阅侧:Pro 500($500/月、25 倍 Plus 用量)上线,Pro 200 从 10 月 30 日起额度减半至 10 倍,存量用户的双倍额度 10 月 29 日到期。
对你意味着什么Decisions API 是这一轮「决策模型」军备竞赛的官方入场券——这条赛道由 9 月 Typesafe AI 的 Jev 点燃,现在 OpenAI、AWS、Perplexity、Liquid AI 都在上面,Perplexity 昨天把 Decision API 价格直接砍半到每百万输入 token 2 美分。它的意义是:把「要不要调用大模型」这件事本身,变成一个廉价的前置判断。对做智能体编排的人,这是成本结构的实质性变化。另外,付费层级简化+额度调整同时出现,老用户最好核对一下自己被归到哪一档。
- 如果你在做智能体编排:在链路入口加一层决策模型做路由/意图判定,把 80% 的简单分流从前沿模型上摘下来,成本下降会是数量级的。
- 如果你是 OpenAI 付费用户:Pro 200 的额度减半是真实影响,10 月 29 日前评估是否需要调整档位或改用 API 直付。
现在可以做什么
- ✅ 挑一个高频且答案有限的判断场景(工单分类、路由、合规初筛)做 Decisions API 试点,对比现有方案的成本与延迟
- ✅ 登录 OpenAI 组织后台确认新层级归属,检查 10/29-10/30 的额度变化是否影响生产用量
🔗 来源:Tibo(OpenAI)转述 · OpenAI Developers:Codex 语音 · DevDay 完整回顾 · 中文汇总
🏷️ #OpenAI #DevDay #DecisionsAPI #决策模型 #Codex
7. Mistral Large 4 来了:1 万亿参数,AI 指数 38,10 月底放权重
💡 速览:欧洲最强开放权重模型,现价对折
0.68/2.09,主打网络安全与数据主权。
发生了什么Mistral 于 10 月 6 日发布Mistral Large 4(内部代号 Le Chonk)公开预览:1.05 万亿总参数、49B 激活的稀疏 MoE(另有 1.6B 视觉编码器),原生多模态(文本+图像进、文本出),在自家欧洲数据中心用 3800 张 NVIDIA Grace Blackwell 从零训练,覆盖 160+ 语言。Artificial Analysis 智能指数给到38 分(上一代 Mistral Large 3 只有 9 分,Medium 3.5 是 14 分),在 225 个模型中排第 64,落后 Claude Opus 5.5 约 20 分,但明显领先美国其他开放权重模型(Nemotron 3 Ultra 23 分)。定价上,目录价 $1.36 输入 / $4.18 输出,当前实际按$0.68 / $2.09(缓存 $0.07)执行,OpenRouter 同步该价且前两周再五折,但未说明折扣期限。上下文官方标 1M token、OpenRouter 标 512K。Mistral 主打网络安全:在「复现并修补真实开源漏洞」测试中达 82%,并称 Claude Opus 5.5 和 GPT-6 Astra 在此项接近 0 分——因为它们拒绝执行该任务。权重承诺 10 月底发布(有报道称 10 月 27 日),许可证未公布。
对你意味着什么Mistral 这次的差异化很聪明:不打全能,打「别人不敢干」和「数据主权」。对欧洲客户、对安全研究团队、对需要私有化部署的行业,这是个真实可选项。但要清醒:38 分距离前沿仍有 20 分差距,且权重和许可证都还没落地——在看到许可证之前,不建议把它写进长期架构。
- 如果你在做安全/红队/漏洞研究:这是目前少有的「愿意配合复现漏洞」的商业模型,值得纳入工具箱,但要配自己的护栏。
- 如果你有欧洲业务或数据驻留要求:1T 参数 + 欧洲自训 + 可私有化,是目前合规叙事最完整的一个组合,可以先做 PoC。
现在可以做什么
- ✅ 用你的真实任务跑一遍 Mistral Large 4,同时记录折扣价与目录价的差额,评估长期成本
- ✅ 等权重和许可证公布(10 月底)再决定是否进入生产依赖,许可证条款会决定能不能商用
🔗 来源:Artificial Analysis 评测 · The Decoder · 规格与价格汇总
🏷️ #Mistral #开源权重 #网络安全 #数据主权 #欧洲AI
8. 券商集体「搬进」第三方 AI 平台,金融机构打响 Agent 卡位战
💡 速览:超 10 家券商接入 Kimi、WorkBuddy、千问、火山引擎,从自研转向借生态获客。
发生了什么据中国基金报 10 月 6 日报道(证券时报网转载),已有超过 10 家券商接入第三方 AI 平台,覆盖 Kimi、WorkBuddy、千问、火山引擎等;中信证券、广发证券、中信建投、国泰海通等大型券商不是二选一,而是同时接入多个平台。具体动作包括:9 月初腾讯 WorkBuddy 开放平台上线,广发证券成为首家入驻的券商,联合发布应用专区并首批上线 12 项自研 Skills 与 9 项专家能力;9 月下旬中信建投自研的「蜻蜓」Skill 六大 AI 技能上线 WorkBuddy 技能广场;9 月 7 日阿里千问开放平台上线的十余款金融智能体中,国泰海通「灵犀」、兴业证券智能投资助手、东吴「秀财」、中金财富等 4 款券商智能体首批入驻;月之暗面亦发布 Kimi 金融行业解决方案,中信建投、中金公司等已在业务中落地或共建。业内人士称,首要考量是拓展新用户触点——通过 Skills 或智能体输出投研、行情能力触达更多潜在客户。
对你意味着什么这是一个很典型的中国式智能体落地路径:不做通用平台,做「能力上架」。一年前金融机构还在比拼自研大模型,现在集体转向「把专业能 力包装成 Skill/智能体,寄居在别人的流量入口里」。对做 B 端 AI 的团队,这个转变意味着两件事:一是「接入哪个生态」变成了渠道策略;二是 Skill/插件这种轻量级交付形态,比完整 SaaS 更容易被大型机构接受。
- 如果你在做 To B AI 产品:评估 Skills/智能体市场上架这条路,它的销售周期远短于传统采购,但也要接受平台抽成与规则约束。
- 如果你在金融机构:多平台并行接入会带来能力分散与合规口径不一致的问题,建议提前定好「同一答案在不同平台必须一致」的校验机制。
现在可以做什么
- ✅ 盘点自家可对外输出的专业能力,挑 2-3 个做成标准 Skill/智能体,先在一家平台上架试水
- ✅ 建立跨平台回答一致性测试集,避免同一问题在不同生态给出不同结论(金融场景这是合规风险)
🔗 来源:中国基金报(网易转载) · 证券时报网/新浪财经
🏷️ #智能体落地 #金融AI #券商 #Skills生态 #国内动态
🟢 B 级 · 补充阅读
9. a16z 第七版榜单:近一半美国人用过 AI,只有 4.5% 在掏钱
💡 速览:头部 1% 付费用户月均 903 美元、贡献 19.5% 消费;29 家支出前 50 不在任何流量榜。
发生了什么a16z 发布第七版《Top 100 消费级 AI 应用》及《市场状况 II》报告。本期首次引入 YipitData 基于美国消费者银行卡/信用卡面板的支出维度,与 Similarweb 网页访问、Sensor Tower 移动月活并列。核心数据:近一半美国消费者称在使用 AI,但只有25% 达到日常使用频率;截至今年 8 月,仅4.5%的美国消费者持有 ChatGPT、Gemini 或 Claude 中至少一个活跃个人付费订阅;付费呈极端幂律——前 1% 付费用户贡献 19.5% 的可观察消费,高于底部 50% 用户合计的 16.6%,这批重度用户月均花费903 美元,主要买编程、效率与创作工具;前 10% 付费者约占全部消费的一半。同时进入网页、移动、支出三张榜的公司只有 7 家(ChatGPT、Claude、Suno、Perplexity、Photoroom、Canva、Notion),而有 29 家支出排名前 50 的厂商根本不在任何流量榜上。本期新增首次上榜产品仅 11 个,为七期以来最少。a16z 分析师 Olivia Moore 总结:「消费者 AI 使用很广,但对几乎所有人来说都不深。」
对你意味着什么「流量 ≠ 收入」这件事第一次被量化到了这么清晰。29 家不出流量榜的高支出厂商说明:存在一整类不需要大众流量也能活得好、且活得很好的 AI 生意。这对小团队是好消息——你不必冲榜,只要牢牢抓住那群愿意每月花几百美元的人。反面是,如果你的产品靠订阅制覆盖模型成本,天花板可能比你想象的更早到来。
- 如果你在做消费级 AI 产品:重新审视定价模型。订阅制早期能覆盖成本,但 a16z 明确指出它在压低普及天花板,个人智能体、广告、交易抽佣等新模式正在浮出。
- 如果你在做 B 端:那 29 家「隐形高收入」厂商值得逐个研究,它们大概率是工具型、垂直型、被少数人重度依赖的产品。
现在可以做什么
- ✅ 算一下你产品里前 1% 用户贡献了多少收入,如果结构类似,考虑为他们设计独立的重度档位而非拉新
- ✅ 别把「月活」当北极星指标,改用「高频付费用户的周留存」
🔗 来源:华尔街见闻(网易转载) · 卡兹克解读 · Moneycontrol 汇总
🏷️ #a16z #消费级AI #付费转化 #商业模式 #用户留存
10. Anthropic 5180 亿算力承诺里,4137 亿是不管用不用都得付的
💡 速览:五年算力支出中约八成为不可撤销承诺,平均每年约 410 亿美元。
发生了什么据 10 月 6 日流传的测算,Anthropic 计划未来数年在云计算与算力上支出5180 亿美元,其中约4137 亿美元为不可撤销承诺——即使容量闲置也必须支付,平均每年约 410 亿美元。这一数字与其招股书披露的信息方向一致:Anthropic 2025 年收入接近 46 亿美元,经营亏损超过 80 亿美元,总义务规模达 5180 亿美元,并在招股书中自陈「存在性风险」。此前另有报道称博通最多借给 Anthropic 420 亿美元用于租用自己的 TPU(约占五年 1252 亿租金的三分之一),Anthropic 自己在招股书里把它标注为「潜在利益冲突」。
对你意味着什么这条不该只当财经新闻看。当供应商的收入里有八成是「不管客户用不用都收」的刚性承诺,它的定价行为会变得很激进——它必须让客户把额度用掉,于是会出现更多「套餐捆绑、额度赠送、限时折扣」。这解释了 SemiAnalysis 近期测算的「Anthropic 订阅的 API 等价价值约为 OpenAI 的 5 倍以上」,也解释了为什么 Anthropic 近期在折扣政策上反复调整。对采购方来说,这是可以谈价的窗口期。
- 如果你在批量采购模型服务:供应商的刚性成本压力是可以利用的谈判筹码,年度承诺换折扣的空间今年比往年大。
- 如果你在评估供应商稳定性:高刚性承诺 + 高经营亏损的组合,意味着它对续约率极度敏感,长期合同要写清价格保护条款。
现在可以做什么
- ✅ 核对你的年度承诺额度使用率,用不完的部分主动去谈展期或折扣,别让它过期
- ✅ 在长期合同里加入价格重议条款与退出条款,规避供应商被动调整套餐的风险
🔗 来源:Rohan Paul 转述测算 · SemiAnalysis:订阅价值对比
🏷️ #Anthropic #算力成本 #采购谈判 #AI基础设施 #财务风险
11. Claude 全家搬上云:Code 云端会话、Cowork 迁云、Workspace 打通
💡 速览:每个任务独占一台 VM、合盖不中断;Cowork 的 VM 也从本地移到云端。
发生了什么Anthropic 近日密集把运行环境往云端搬。Claude Code 推出云端会话:每个任务跑在独立 VM 上、仓库克隆到新分支,可从 claude.ai/code、手机、桌面端、终端和 Slack 启动并跟踪,完成后产出可直接转 PR 的分支,Pro/Max/Team/Enterprise 计划不额外收费。同时 Claude Code v2.1.292 发布,新增claude plugin install --marketplace(在同一策略校验下自动添加市场并安装插件)与 Agent 的effort参数(可指定子智能体的努力度等级),并修复了沙箱命令读取暂存文件、UNC 路径绕过文件读取权限提示等多项安全与稳定性问题。Cowork 架构也改了:Anthropic 工程师 Felix Rieseberg 说明,旧版是云端推理 + 用户电脑上运行本地 VM,磁盘、电池和性能开销大,合上笔记本工作就停;新版把模型推理和 VM 都移到云端,每会话独立沙箱,桌面应用只负责文件访问等需要本机设备的工具调用。此外,Claude for Google Workspace 开启 beta,一次安装即可在 Google Docs、Sheets、Slides 中直接编辑。
对你意味着什么三家(OpenAI Codex、Anthropic Claude Code、Cowork)在同一周把「本地运行」改成「云端常驻」,这不是巧合——智能体的工作时长正在超过人的在线时长,本地设备成了瓶颈。对你的直接影响是:任务可以真正在后台跑完,但同时也意味着你的代码和数据要放进别人的 VM。用之前想清楚边界。
- 如果你在做长周期任务(大规模重构、批量迁移、长时间研究):云端会话能解决「合盖就断」的老问题,值得切换。
- 如果你有数据合规要求:云端 VM 意味着代码会短暂驻留在供应商环境,敏感仓库先确认是否有私有云/自托管选项(IBM Bob 等已提供自托管路线)。
现在可以做什么
- ✅ 用
effort参数给不同子任务分级配算力,简单任务调低一档,能省不少
- ✅ 给云端会话设仓库白名单,禁止把含凭据或客户数据的仓库交给云端 VM
🔗 来源:Claude Code 云端会话 · Simon Willison:Cowork 架构变更 · Claude for Google Workspace · v2.1.292 Release
🏷️ #ClaudeCode #Cowork #云端智能体 #工程效能 #Claude
12. Nano Banana 2.1 上线:图像价格砍半,旧版 10 月 29 日停服
💡 速览:1K 图从 6.70 美分降到 3.36 美分,支持最多 14 张参考图与 4K 全景。
发生了什么Google 于 10 月 6 日发布图像生成与对话式编辑模型Nano Banana 2.1(gemini-nano-banana-2.1),接替 2026 年 2 月发布的 Nano Banana 2(gemini-3.1-flash-image)。官方更新日志显示,gemini-3.1-flash-image 将于 2026 年 10 月 29 日停用。价格约降一半:1K 图像从 6.70 美分降至3.36 美分,4K 从 15.10 美分降至7.56 美分。能力上支持最多 14 张参考图与 4K 全景输出,已同步上线 fal、OpenRouter 与 Arena 的三个图像榜单(多图编辑榜暂列第 4)。
对你意味着什么图像生成的价格今年已经跌到「按分计」的量级,竞争焦点从「能不能生成」转到「能不能稳定编辑」。对做电商素材、内容批量生产的团队,价格腰斩意味着可以放开跑 A/B 和多版本;但 10 月 29 日的停服日期是个硬截止,还在用旧版 ID 的业务要尽快迁。
- 如果你在批量生成商品图/素材:成本降到一半,可以把「多版本生成 + 人工挑选」从奢侈品变成常规流程。
- 如果你用 API 在跑生产:10 月 29 日前必须完成模型 ID 迁移,这类硬停服通常不给缓冲。
现在可以做什么
- ✅ 立刻检索代码里所有
gemini-3.1-flash-image的调用点,排期在 10/29 前切到 2.1
- ✅ 用 14 张参考图的能力重做一遍你的「保持角色/商品一致性」流程,多参考图是当前成本收益比最高的玩法
🔗 来源:Gemini API 更新日志 · The Decoder
🏷️ #NanoBanana #图像生成 #Gemini #API迁移 #成本下降
✍️ 编辑点评
今天读下来最强烈的感觉是:智能体正在从「能不能做到」进入「允不允许做」的阶段。网站在问它是谁,法院在问它说的话算不算数,METR 在问我们还能不能相信日志。这些都不是坏消息——一个东西开始被追问身份,说明它真的进了场。倒是我们自己得跟上:别再把「跑通了」当成「可以上线了」。明天开始,多问一句「如果它骗我,我怎么知道」。