Claude Opus 5 把前沿能力拉进了默认档
Site Owner
Published on 2026-07-26
Claude Opus 5 正在把前沿模型从高价专家变成日常默认档,关键变化不只在半价,而在 Token 效率、调用频率与真实任务成本。
Loading...
Site Owner
Published on 2026-07-26
Claude Opus 5 正在把前沿模型从高价专家变成日常默认档,关键变化不只在半价,而在 Token 效率、调用频率与真实任务成本。

如果你只盯着榜单看模型发布,Opus 5 这轮最重要的变化会被你漏掉。
Anthropic 7月24号发布了 Claude Opus 5。官方定价是每百万输入 token 5 美元、输出 25 美元——大概是 Fable 5 的一半(来源:Anthropic,https://www.anthropic.com/news/claude-opus-5)。乍一看,这是“次旗舰卖半价”的老套路。评测数据却指向了另一件事。
Opus 5 的价值不只是便宜,它把前沿能力从“请专家”拉到了“雇同事”的位置。
区别在哪?请专家得算日子、算预算、算这次值不值得惊动他。雇同事就简单多了,需求来了直接丢过去。
先看硬数据。
CursorBench 3.2 最大工作量设置下,Opus 5 和 Fable 5 的峰值成绩差距不到 0.5%(来源:InfoQ 对 Anthropic 数据的整理,https://mp.weixin.qq.com/s?__biz=MjM5MDE0Mjc4MA==&mid=2651289450&idx=1&sn=8613b20d12dd0e621d4512e6a67efdf1)。Epoch AI Research 的 ECI 数据里,Opus 5 得分 159,Fable 5 是 161;软件工程专项 SWE-ECI 中,Opus 5 为 161,与 Fable 5 持平(来源:Latent Space AINews,https://www.latent.space/p/ainews-claude-opus-5-fable-level)。

这已经不是“次旗舰勉强跟上”,而是日常任务里很难只凭价格判断谁更值。
Anthropic 自己公布的 Frontier-Bench 里,Opus 5 甚至反超了 Fable 5;ARC-AGI 3 得分约为次优模型的 3 倍(来源:Anthropic 官方发布页,https://www.anthropic.com/news/claude-opus-5;该结果属于厂商自测)。厂商 benchmark 得打个折看,像车企宣传续航,更多代表理想工况。独立数据的结论更克制:Opus 5 整体 ECI 略低于 Fable 5,但软件工程能力持平。
这意味着 Opus 5 更像“足够接近前沿的高性价比模型”,还不能写成所有维度全面碾压。
当模型能力接近时,成本差会在高频调用里反复出现。模型选型看的不只是单轮能力,还要看它能不能承担整条任务链的调用。
价格砍半只是表面。更关键的变量藏在 token 效率里。
Harvey 的应用研究团队报告称,在相近表现下,Opus 5 平均生成 token 比上一代 Opus 4.8 少了 26%(来源:InfoQ,https://mp.weixin.qq.com/s?__biz=MjM5MDE0Mjc4MA==&mid=2651289450&idx=1&sn=8613b20d12dd0e621d4512e6a67efdf1)。同样的任务,新模型的单价和 token 用量都有下降空间。两项变化叠加后,任务总成本可能比只看报价更低。
Anthropic 工程师 Thariq Shihipar 披露,Claude Code 的系统提示里,大约 80% 的内容已经被移除,编码评估没有出现明显受损(来源:InfoQ;AI 沃茨的实测整理,https://mp.weixin.qq.com/s?__biz=Mzg3MTk3NzYzNw==&mid=2247508794&idx=1&sn=12d7cfa252e99d6e57f1d9d126227a59)。
这说明模型对冗余提示的依赖可能在下降。提示变短,会减少输入 token,也可能降低响应链路的负担;具体收益仍要看任务和系统实现。
这轮竞争的战场,已经从“谁能跑出最高分”转向了“谁能用更少的 token 交出够用的结果”。Token 效率才是工程师切换默认模型的真实理由。
实际工作流很少只调用一次模型。Coding agent 会在规划、执行、检查和修复环节反复请求模型;每次少用一些 token,累计效果就会落到账单上。
“删了 80% 系统提示还能保持性能”放大来看,是一个工程信号:模型开始承担更多原本由系统提示负责的解释工作。
过去使用前沿模型,开发者常在 prompt 里交代背景、边界和偏好,像项目经理给新同事写两页交接邮件。Opus 5 的工程师披露说明,模型可以承担更多这类上下文处理。
这对 Agent 场景很关键。每一步都会产生新的上下文和 token 消耗。如果每一步都少带一大段系统提示,长任务链会累计节省输入 token。至于最终节省多少,要看提示长度、调用次数和缓存策略,不能直接套用 80% 这个数字。

80% 这个数字来自工程师团队披露,目前看到的实测样本有限,不能直接推广成“所有人删掉 80% prompt 都没事”。 更稳妥的做法是删除重复说明,保留权限边界、失败处理、输出格式和测试要求。
模型越强,脚手架越应该短;高风险动作的护栏却不能跟着一起消失。少写废话,和少做工程治理,是两回事。
技术产品最后比拼的,往往是默认选项能否被持续沿用。
模型层的默认档通常落在“够强、够快、够便宜”的区间。它们未必拿到最高分,却能让开发者少做一次成本决策。
Fable 5 再强,只要开发者每次调用前都要算一遍成本,它就更像“特种部队”,很难成为“常规军”。
Opus 5 的逻辑相反。日常 coding、文档生成、数据分析,可以优先走它;长时间自主运行、高风险安全任务,再让更强模型负责规划和复核。半价和更好的 token 效率,会把犹豫成本压低。
这才是前沿能力进入默认档的路径:性能差距缩小,心理摩擦也跟着变小。
用一个简单的比喻就能理解:Fable 5 像只在关键战役才请得起的专家,Opus 5 像能放进日常工位的高级同事。从请专家到雇同事,不是降级,是扩编。
模型竞争正在从单次能力比较,转向部署密度和调用频率。榜单第一是广告牌,能被高频调用才是产品地位。
谁的模型被集成到更多场景、被调用更多次,谁就更容易积累产品反馈和用户习惯。单次任务便宜 50%、token 消耗少 26%,都是部署密度竞争的弹药。
Opus 5 这轮发布,传递了一个清晰的产品信号:Anthropic 不再满足于“最强模型”这个标签,它在抢工作台。它要抢的不是媒体头条,而是终端默认。
开发者可以重新评估自己的默认模型:用近两周的真实任务统计成功率、延迟、重试次数和总 token,再决定谁应该留在默认档。只看榜单,容易把宣传指标当成采购结论。
模型不是越强越好,是在预算里能稳定调用、还能完成任务的那个最好。
Opus 5 值得进入新的默认档候选名单,但最终还要用自己的任务数据验证。
注:文中厂商 benchmark 与个人体验均按来源归属表述,不代表独立结论。