
Opus 5 明明更强,为什么用起来反而更差?
一个让很多 AI 开发者共鸣的困惑:能力更强的模型,用起来却更累。作者推测基准测试训练正在系统性淘汰'会停下来问问题'的模型,而这恰恰是真实场景里我们最需要的品质。
原文来源:Why does Opus 5 feel worse to work with? — 一个困惑:Opus 5 能力更强、基准更高,但和 4.7、4.8 相比,用起来反而像降级——因为它不再停下来确认,而是自作主张。
先说结论:这不是一篇"新模型不如旧模型"的抱怨文。作者明确表示,Opus 5 确实比 Opus 4.7、4.8 更强,基准上甚至能对标 Fable——问题恰恰出在它太能"干"了。
他和同事们的体感是一致的:Opus 5 用起来像降级。不是因为能力倒退,而是因为它的行为方式变了:
- 意图不明确时,它不再停下来问问题;
- 它不再对自己的假设做确认;
- 它会不打招呼就重新解读、修改你的计划。
结果是,用它干活需要"细心照看"(careful babysitting)——你以为它理解你的意思了,结果它按自己的理解跑偏了。
为什么模型会变成这样
作者的推测是两股力量叠加的结果:Anthropic 内部对"自我改进型 AI"的追求,以及整个前沿实验室对基准分数的压力。
基准测试的潜规则是公开的秘密:很多任务定义不清、不公平、可被 hack。但一个"好"的基准任务有一个共同特征——自包含、可解。它不要求模型读任务创建者的心思,不需要外部信息,拿到手就能做对。它可能不止一个正确答案,但所有明确正确的答案都会被公平计分。
问题就在这里:为基准而生(或在 RLVR 任务上训练)的模型,天然被选择成"面对歧义时大胆做假设"的类型。一个倾向于停下来问"你这里到底什么意思"的模型,在基准上是要被扣分的——因为基准里不存在"提问"这个动作,停下来问 = 输出无效 = 分数更低。训练过程惩罚提问,奖励果断。
而"果断"在真实世界是什么样?是在信息不全时替你做决定,是把你没说出口的约束当作不存在,是改你的计划不打招呼。
—— 广告 ——
真实世界不是基准
这是全文最核心的一句:真实生活不是基准测试。
基准里每个问题都有保证存在的正确答案(或正确集),模型要做的只是找到它。但真实项目里,没有一个测试集能装下所有上下文:业务含义、预算约束、历史决策、利益相关者的隐性偏好、团队的技术债……你几乎不可能把所有这些写清楚交给一个编码 agent。
这种不确定性的存在,意味着一个负责任的 agent 应该在必要时停下来问。作者的原话是:真实后果摆在面前时,"我不想要一个 agent 自作主张"。
想想你被 AI 助手坑过的场景:它"帮"你重构了一个函数,删掉了你以为它不会碰的代码;它"优化"了你的查询,改变了语义;它"顺手"升级了依赖,引入了破坏性变更。这些事它做得越流畅、越不吭声,你事后发现时的代价越大。能力越强,跑偏的杀伤力越大——这大概就是"感觉更差"的数学本质。
这背后是整个行业的激励错位
把镜头拉远,这不是 Opus 5 一个模型的问题,而是行业性的:
- 基准分数驱动营销。各家发布会上的对比表格,决定了一个模型在用户心智里的位置。而基准偏爱"敢猜"的模型。
- RLVR(可验证奖励强化学习)的普及。数学、代码这类有确定答案的领域,验证器可以自动判分,训练可以完全自动化。但自动判分天然奖励"直接给答案",无法奖励"确认意图"这种需要交互的行为。
- "自主性"被当作卖点。agent 越"自主",演示越震撼——但用户要的自主性,通常是在自己的规则框架内自主,而不是自主地重新发明规则。
这也是为什么很多开发者会囤着旧版本模型:新模型基准更高,但旧模型的"会问问题"恰恰是协作里最值钱的部分。
一个不容易的平衡
我无意主张"模型应该永远停下来问"——那样会烦死人,一个每步都要确认的 agent 没人愿意用。问题在于当前训练信号把模型推向了完全不问的另一端。
理想的行为是分层的:低风险、高确定性的事,放手做;高风险、意图模糊的事,停下来确认。这需要模型对"自己是否真的理解"有可靠的判断——一种校准能力。可惜基准测试恰好测不出这种能力:判断什么时候该问,本质上是个元认知问题,而元认知问题几乎不可能被自动判分。
另一个可行的方向是给用户控制权:明确提供"谨慎模式",让模型倾向提问而不是假设。某些产品已经在做类似的事(reasoning effort、plan mode),但粒度还远远不够——用户需要的不是"更多思考",而是"更多确认"。
对使用者的实用建议
在模型行为改变之前,有几件事现在就能做:
- 把关键约束写进上下文。既然模型默认做大胆假设,那就别给它假设的空间——budget、范围、禁忌事项,显式写清楚。
- 要求它先复述计划再执行。在计划阶段就让它输出理解和执行方案,你确认后再放行,而不是让它在执行中自作主张。
- 对高风险操作使用更保守的模型或模式。日常 boilerplate 用新模型提速,涉及生产代码、数据迁移的场景,用行为更可预测的配置。
- 留意模型的"自信度"。跑偏的模型在撞墙前往往非常自信。碰到"它怎么不问就干了"的情况,先检查它理解的目标和你的是不是同一个。
技术文章总爱写"新模型更强了",但这篇提醒我们另一件事:强和好用是两回事。一个能力更强但不听你话的同事,和一个小一号但凡事对齐的同事,你选哪个?在编码 agent 变得真正可信之前,这个问题的答案可能决定了你用哪一代模型干活。
© 2026 四月
原文链接:https://www.aprilzz.com/ramble/opus5-feels-worse-to-work-with
相关文章
当 Claude 开始破解密码学:Anthropic 新发现意味着什么
Anthropic 发布 Claude Mythos 在密码学分析上的两项突破:对 HAWK 签名方案的攻击和对简化版 AES 的攻击。密码学教授 Matthew Green 深入解读了这些结果的意义和局限
Anthropic 发布 Claude Opus 5:近 Fable 级别的智能,一半的价格
Anthropic 于 2026 年 7 月 24 日发布 Claude Opus 5,全新旗舰模型在编码、科学研究和知识工作等多项基准上超越前代 Opus 4.8 近两倍性能,定价仅为 Fable 5 的一半
你没法用单元测试来测品味
一位独立开发者用 LLM 为跑步 App 处理 72 万个兴趣点的故事,揭示了 AI 的核心悖论:它说谎,但它有品味。