Claude Opus 5.5 发布:更强且价降 40%
2026年9月22日,Anthropic 发布 Claude Opus 5.5,这是 Claude 5.5 家族的第一个成员。它把上一代 Opus 5 的 token 单价下调约 20%、缓存读取砍掉 60%,典型任务总成本反而比 Opus 5 低约 40%,同时在 Terminal-Bench 4.0 等智能体编码基准上刷新了同档纪录。对每天跑 Agent、做长链路重构的开发者,这件事的意义不是「又强了一点」,而是「强的同时更便宜」——成本曲线第一次往右下走。
目录
- 一、先说清楚:它是新家族的开端,不是 Opus 5 的小修
- 二、价格到底怎么降的:单价、缓存、总成本三条线
- 三、编码能力:基准数字与独立实测的落差
- 四、Opus 家族两年演进:5.5 站在哪里
- 五、怎么用:官方 API 与免费入口两条路
- 六、三个要冷静看的地方
- 总结
一、先说清楚:它是新家族的开端,不是 Opus 5 的小修
很多人看到「Opus 5.5」会默认它是 Opus 5 的修补版——版本号只加了 0.5,能力应该差不多。这个直觉是错的。Opus 5.5 是 Anthropic 新一条「Claude 5.5 家族」的第一个成员,定位是奥普斯档里的主力工作模型,而不是 Fable 5.1 的替代品。
要区分两类模型。Fable 系列是 Anthropic 当前的能力天花板,负责写作、知识准确度、复杂推理这些最吃智能的活;Opus 系列是能长时间自主跑、成本可控的主力,负责编码、Agent、企业流程。Opus 5.5 官方给出的说法是「在绝大多数任务上达到 Fable 5.1 的水平」,但 Fable 5.1 在写作与事实准确度上仍然领先——第三方机构 Artificial Analysis 测到的知识准确度是 67%,Opus 5.5 是 66%。
所以这张牌的打法很清楚:用接近旗舰的智能,换更低的单价和更稳的成本曲线。它要抢的不是 Fable 的用户,而是那些每天让 Agent 跑几小时、被 token 账单压得喘不过气的工程团队。
换个说法,这次升级的重心不在「模型更聪明」,而在「同样聪明的前提下更便宜、更耐跑」。如果你期待的是推理能力上的代际飞跃,这一代会让你失望;如果你在意的是把 Agent 跑一整天的成本,这一代才是你要看的。
把发布时间放进竞争坐标系里看会更清楚。就在 Opus 5.5 前后几天,赛道相当拥挤:OpenAI 的 GPT-6 Astra 在 9 月 3 日率先发布并拿走编码王冠,xAI 的 Grok 4.7 在 9 月 21 日跟上,OpenAI 又在 9 月 23 日补了 GPT-6 Sol 与 Luna 两款更便宜的型号。Anthropic 这一发,目标显然不只是追上 Astra,而是用「同档能力 + 更低价格」直接打性价比。这也是为什么「降价」被放在和「能力」同等的位置来讲——它不是顺带的,是这一代的主打。
那它凭什么敢把价格往下砍?答案在下一节——降价不是单一动作,而是单价、缓存、用量三条线一起动,且每次任务消耗的 token 本身也变少了。
二、价格到底怎么降的:单价、缓存、总成本三条线
Opus 5.5 的降价不是把单价打下来这么简单,而是三条线同时动。下面这张表把 Opus 5 和 5.5 放在同一档位对比。
(图二:Opus 5 与 Opus 5.5 的价格档位对比,输入、输出、缓存读取、缓存写入、Fast 模式五项全线下调,其中缓存读取降幅最大)
逐条看:
- 输入单价:每百万 token 从 5 美元降到 4 美元,下调 20%。
- 输出单价:从 25 美元降到 20 美元,同样下调 20%。输出是生成成本的大头,这一项直接决定每次任务的账单厚度。
- 缓存读取:从 0.50 美元降到 0.20 美元,下调 60%。这是 Agent 类工作的隐性成本核心——长对话、长上下文反复读取历史,缓存读取的占比往往比单次输入还高。
- 缓存写入:5 分钟档从 6.25 降到 5 美元,1 小时档为 8 美元。
- Fast 模式:输入 8 美元、输出 40 美元,速度最高提升到 2.5 倍,是默认价的翻倍。
举个直观的例子:一次需要反复读取长上下文的 Agent 长任务,Opus 5 可能因为缓存读取单价高、且每次任务 token 偏多,账单里缓存和输出两项都重;换成 5.5 后,缓存读取单价直接砍掉六成,加上默认中等档位更省 token,同样的工作流单次成本会明显变薄。Anthropic 给过的一个实测是:对一套约 20 万行代码的审计与修复,Opus 5 用了 20 小时以上、消耗 2.5 倍 token,Opus 5.5 不到 3 小时完成。
把这几项合起来算:单价降 20%,但 5.5 每次任务消耗的 token 也更少——自适应思考默认中等档位、输出更省。Anthropic 自己给出的结论是「典型工作负载比 Opus 5 便宜约 40%」。这不是把单价打下来的假便宜,而是单价和用量双双下降带来的真便宜。
为什么缓存读取这一项值得单拎出来说?Agent 跑长任务时,系统提示、检索召回的文档、历史对话会被反复读回。这些上下文动辄几万 token,每次读取都按缓存读取单价计费。把这项单价砍六成,等于直接削掉了长任务账单里最顽固的一块。很多团队以为省钱要靠压输出,其实对 Agent 来说,缓存读取才是大头。
三、编码能力:基准数字与独立实测的落差
这部分最容易踩坑:厂商公布的基准是一回事,第三方独立跑出来的是另一回事。我把两者分开列,避免把推断当成事实。
先说三个基准各自测什么。Terminal-Bench 4.0让模型在真实命令行里完成多步软件、运维、数据任务,从开做到收尾;FrontierCode v1.1测的是智能体改的代码能不能被合并,贴近真实软件工程;CursorBench 4.0来自 Cursor IDE 里的真实多文件会话,任务含糊、跨文件,最像日常编码。
对开发者来说,这三个基准刚好覆盖了最花钱的三类活:终端里的多步运维与排障、改出来的代码能不能过评审被合并、以及日常在编辑器里跨文件改功能。如果你的工作主要落在这三类,Opus 5.5 的领先和你体感的相关性就比较高;如果你的活更多是单轮问答或纯文档处理,那这些高分和你关系不大,选型时不必为它们买单。
已确认的事实(厂商公布):三项上 Opus 5.5 都领先同档。Terminal-Bench 4.0 拿到 66.4%,高于 Fable 5.1 的 55.8%、GPT-6 Astra 的 57.9%;FrontierCode v1.1 是 54.4%,略高于 Astra 的 53.3%;CursorBench 4.0 是 57.8%,比 Fable 5.1 的 51.8% 高约 6 个点。
(图一:智能体编码三大基准横向对比,Opus 5.5 在三项上均领先同档;最下方独立实测的 Terminal-Bench 分数明显低于厂商公布值)
我的推断:基准的领先幅度比真实体感差距要大。两个信号支持这个判断。第一,Anthropic 自己在发布材料里写了「基准分差已经越来越不能代表真实世界差异」,并承认 5.5 在绝大多数任务上达到 Fable 5.1 水平——等于自己给高分打了折扣。第二,独立机构 Artificial Analysis 用自家环境重跑 Terminal-Bench 4.0,Opus 5.5 只拿到 59.6%,和 GPT-6 Astra 的顶部成绩基本持平,远不是厂商标称那种压倒性领先。
还有一个容易被忽略的精度问题:Anthropic 自己给 Terminal-Bench 4.0 标了 ±2.6 个点的标准误。照这个数,5.5 对 Astra 8.5 个点的领先确实在噪声之外、值得信;但 FrontierCode 上 1.1 个点的微弱领先,其实落在这类基准的正常波动里,不能当成明显更强。看榜时要按误差区间去读,而不是只看小数点。
目前未知:独立评测目前只覆盖了编码的部分基准。长链路真实重构、跨仓库协调、长会话稳定性这些最贵的场景,还没有足够多的公开实测。而且 Opus 5.5 不是全胜——AutomationBench(企业流程自动化)40.0% 低于 Astra 的 41.4%,Terminal-Bench-Science 0.1(科研任务)58.7% 也低于 Astra 的 64.6%。它赢在了开发者最在意的编码档位,不是赢在了所有档位。
真实工程里的表现(已确认事实):基准之外,几个长链路案例更能说明它要打的场景。一个早期测试者用它在不到一天内完成一次 68 万行代码的整体迁移,这类工作按人工排期通常要一个工程团队做数周。在前面提到的 20 万行代码审计里,它不到 3 小时交活,而 Opus 5 要 20 小时以上。内部另一个对照是把 HAProxy(一套用 C 写的高流量负载均衡软件)翻译成 Rust:Opus 5.5 用 9.5 小时、比 Fable 5.1 的 12 小时更快,且成本低 51%,两者都几乎跑通了 HAProxy 自己的回归测试。还有一个 40 个页面的前端加载提速测试,它在 39 次里成功且不改变应用行为。这些数字指向同一件事:它最擅长的是「又长又乱、跨文件、要一口气跑完」的活,而不是单点问答。
把 Opus 5.5 放进当前旗舰格局看:它在智能体编码这一档领先 GPT-6 Astra 与 Fable 5.1,但 Astra 在投票类榜单、科研类基准上仍占优,OpenAI 新发的 GPT-6 Sol 把价格压得更低(输入 2 美元、输出 10 美元)。也就是说,Opus 5.5 抢的是「编码主力 + 成本可控」这个交集,而不是「最便宜」或「最会写」这两个极端。对多数工程团队,这个交集恰好是最常用的那块。
四、Opus 家族两年演进:5.5 站在哪里
把镜头拉远,Opus 这条线两年走了六步。下面这张时间线能看清演进节奏。
(图三:从 Opus 4.5 到 5.5 的六次发布,节奏从半年一更加速到两月一更)
- 2025-11-24 Opus 4.5:编程能力上调,在 SWE-bench 类编程基准中测试。
- 2026-02-05 Opus 4.6:引入自适应思考机制、智能体团队协作功能,扩展上下文窗口。
- 2026-04-16 Opus 4.7:软件工程能力与图像识别分辨率提升,内置网络安全风险检测。
- 2026-05-28 Opus 4.8:编码与智能体基准再提升,加入投入控制、动态工作流。
- 2026-07-24 Opus 5:性能接近同系更强的 Fable 5,但价格只有其一半,成为日常编码主力。
- 2026-09-22 Opus 5.5:Claude 5.5 家族首款,能力对标 Fable 5.1,成本比 Opus 5 低约 40%。
一个明显趋势:发布节奏从半年一更加速到两月一更。5 到 5.5 只隔了 60 天,比典型的 Opus 节奏更快。对开发者来说,这意味着选型时要假设半年内可能又有新一代,把模型调用层做成可切换的,会比死绑一个版本更稳。
对成本规划也是一个提醒:当发布节奏压缩到两月一更,做年度预算时不能把「当前主力模型价格」当成常数。更稳的做法是预留模型切换的工程量,并把成本按「每任务」而不是「每 token」来核算——因为同档模型降价时,往往是单价和用量一起动,只看单价会低估省下来的部分。
顺带一提,Anthropic 已经预告 Sonnet 5.5 与 Haiku 5.5 会在未来几周内跟进。按以往节奏,这两款更便宜的型号通常会把 5.5 家族的能力下放到中低端档位。如果你现在的主力场景对延迟和单价特别敏感,值得等这两款补位后再做最终选型——很可能用三分之一的价格,拿到接近本次旗舰八成的编码表现。
五、怎么用:官方 API 与免费入口两条路
Opus 5.5 已经全量可用,模型名claude-opus-5-5,覆盖 Claude Platform、AWS、Google Cloud、Microsoft Azure。下面给两条能立刻走的路径。
路径一:官方 API(适合开发者接入自己的系统)
环境要求:Python 3.8+,安装官方 SDKanthropic。最小可运行片段:
importanthropic client=anthropic.Anthropic()# 从环境变量 ANTHROPIC_API_KEY 读取密钥resp=client.messages.create(model="claude-opus-5-5",max_tokens=4096,# 单次最大输出 128K,这里先取小值试跑messages=[{"role":"user","content":"把这段 Python 同步代码改成 asyncio 异步版本,并说明改动点"}],)print(resp.content[0].text)注意一处破坏性变更:5.5 不再允许关闭 thinking(自适应思考常开),并且强制工具调用(forced tool use)在 API 上会被拒、返回 400。从 Opus 5 迁移时,先把 thinking 的关闭分支和强制工具调用逻辑摘掉,否则现有集成会直接报错。
另外几个开发者要记下的硬参数:上下文窗口 100 万 token,单次最大输出 128K(批量模式有 300K 测试档),可靠知识截止 2026 年 6 月,自适应思考默认常开、默认努力档是中等。也就是说,模型默认就会多想一层;想把推理压到最低档省 token,得显式调 effort,而不是关掉思考。
路径二:Claude.ai 免费入口(适合先试水温、不想开账单)
不想开账单,能不能先试试?对个人开发者,Claude 的 Free、Pro、Max、Team、Enterprise 全部接入了 5.5。可以直接在 Claude.ai 网页里选 Opus 5.5 跑一个小任务,零成本验证它能不能接住真实需求,再决定是否接入系统。想先看它写代码稳不稳,这条路径比直接开 API 更省事。
补充一句可用性:除了 Claude Platform 原生 API,5.5 也已经上架 AWS、Google Cloud 与 Microsoft Azure(模型名claude-opus-5-5),多云部署的团队可以直接在熟悉的云控制台里切到这一代。订阅侧,Pro、Max、Team 以及按席位计费的 Enterprise 把五小时额度上调,并给了一次可囤、可自选时机使用的额度重置,长会话跑批更不容易被限流打断。
六、三个要冷静看的地方
第一,高分不等于全胜。独立实测的 Terminal-Bench 4.0 只有 59.6%,与 Astra 持平;AutomationBench、科研类基准还略输。如果你的核心场景是企业流程自动化或科研 coding,先别急着换,等针对性实测。
第二,「便宜 40%」有前提。这个数字是典型工作负载下的结论,依赖默认中等努力档位和更低的 token 消耗。如果习惯把努力档拉到 high 或 xhigh,输出 token 会明显变多——Anthropic 在默认中等档位下 FrontierCode 甚至比最高档还高一点,成本优势会被摊薄。那 40% 的便宜,所有人都能吃到吗?对长链路、默认档的编码任务最明显,对高频拉满档的任务则要打个折。
第三,迁移有隐藏成本。四个破坏性 API 变更里,thinking 不可关闭和强制工具调用被拒最容易被忽略。已经在跑 Opus 5 的团队,升级前务必过一遍调用层,别等线上返回 400 才发现。
第四,安全护栏会悄悄切换模型。因为 5.5 在生物学和网络安全上的能力接近 Fable 5.1,它套用了同级别防护:触发安全机制时,网络安全任务会转交给 Opus 4.8 接手,生物与前沿大模型开发任务转交给 Opus 5。这意味着同一会话里你拿到的可能不是同一个模型,涉及这类任务的输出要做兼容处理。
第五,知识截止有边界。可靠知识停在 2026 年 6 月,对需要最新框架版本、近期文档、当月事件的任务,它不会比这个时间点更懂。涉及快速变动的技术栈,仍然要给它喂最新资料,别假设它知道上个月刚发布的库。
总结
Claude Opus 5.5 的核心价值不是又强了一点,而是:在编码这一档,能力上探到接近旗舰 Fable 5.1,成本却比上一代 Opus 5 低约 40%。对每天跑 Agent、做长链路重构的团队,这是成本曲线第一次明显往右下走。
值得关注三类人:被 token 账单压着的工程团队、需要长时间自主 Agent 的企业、想用接近旗舰智能但不想付旗舰价格的个人开发者。下一步建议盯两个信号——Sonnet 5.5 与 Haiku 5.5 几周内跟进后,中低端档位会不会同样降价;以及独立机构能不能补上长链路真实任务的实测空白。Opus 5.5 适合你现在手上的项目吗?看你的主场景是不是编码和长链路 Agent,如果是,它大概率比上一代更值得接。
最后给一个落地建议:先拿一次真实的、你自己的长链路重构任务去跑它,而不是只看基准。基准告诉你它「能」,只有你自己的任务能告诉你「值不值」——尤其要盯着那 40% 的成本下降,在你的真实调用模式里到底落没落下来。