Opus 5性能更强但使用体验不如Opus 4.7、4.8和Fable,原因何在?
2026/9/8 4:44:43 网站建设 项目流程

为什么使用Opus 5的体验更差?

发布于2026年8月14日。在我和交流过的同事看来,与Opus 4.7、Opus 4.8以及Fable相比,使用Opus 5的体验似乎变差了。虽说它的性能并未退步,实际上,Opus 5比Opus 4.7和Opus 4.8更强大,在基准测试中甚至能和Fable抗衡。然而,使用其他这些模型的体验却更好。我觉得这是因为它们具备以下优点:当我的意图不明确时,会停下来询问;不会在未核实的情况下做出假设;不会在未征求意见的情况下重新解读或更改我的计划。所以,使用它们时不用像使用Opus 5那样小心翼翼地监督。

无端猜测

我怀疑这是Anthropic以及当前前沿实验室普遍存在的两种因素共同作用的结果。其一,人们渴望创建一个能够自我改进的AI,使其能够通过递归方式不断提升,最终达到通用人工智能(AGI)或超级人工智能(ASI)的水平。其二,存在在基准测试中取得高分的压力。尽管很多人都清楚,许多基准测试任务定义不明确、不公平、可被破解或存在其他问题,但一个好的基准测试任务是自包含的,它是可以解决的,不需要提示、揣测任务设计者的意图或借助外部信息就能完成。这并非意味着一个好的任务只能有一个正确答案,而是应该对所有明确正确的答案给予同等的评分。选择在基准测试中表现出色的模型(实际上,针对基准测试进行训练或进行基于奖励的强化学习(RLVR)任务训练),本质上就是在选择那些在面对模糊情况时敢于大胆做出通常正确假设的模型,而会惩罚那些倾向于停下来寻求澄清或指导的模型。可惜的是,这恰恰是我们大多数人对代码编写助手的期望。无论你多么努力,几乎不可能将所有的背景信息、意图、业务影响、预算限制等内容都记录下来并让代码编写助手获取。不可避免地会存在模糊性和需要做出的选择,而知道助手在需要时会停下来询问,这是非常好的。现实生活并非基准测试,并非每个问题都有确定的正确答案,甚至可能没有一组正确答案。考虑到现实生活中的后果,我可不想让助手仅凭猜测行事!

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询