Claude Opus 5 把前沿能力拉进了默认档
Published on 2026-07-26
Claude Opus 5 正在把前沿模型从高价专家变成日常默认档,关键变化不只在半价,而在 Token 效率、调用频率与真实任务成本。

Claude Opus 5 把前沿能力拉进了默认档
如果你只盯着榜单看模型发布,Opus 5 这轮最重要的变化会被你漏掉。
Anthropic 7月24号发布了 Claude Opus 5。官方定价是每百万输入 token 5 美元、输出 25 美元——大概是 Fable 5 的一半(来源:Anthropic,https://www.anthropic.com/news/claude-opus-5)。乍一看,这是“次旗舰卖半价”的老套路。评测数据却指向了另一件事。
Opus 5 的价值不只是便宜,它把前沿能力从“请专家”拉到了“雇同事”的位置。
区别在哪?请专家得算日子、算预算、算这次值不值得惊动他。雇同事就简单多了,需求来了直接丢过去。
差距小到值得重新算账
先看硬数据。
CursorBench 3.2 最大工作量设置下,Opus 5 和 Fable 5 的峰值成绩差距不到 0.5%(来源:InfoQ 对 Anthropic 数据的整理,https://mp.weixin.qq.com/s?__biz=MjM5MDE0Mjc4MA==&mid=2651289450&idx=1&sn=8613b20d12dd0e621d4512e6a67efdf1)。Epoch AI Research 的 ECI 数据里,Opus 5 得分 159,Fable 5 是 161;软件工程专项 SWE-ECI 中,Opus 5 为 161,与 Fable 5 持平(来源:Latent Space AINews,https://www.latent.space/p/ainews-claude-opus-5-fable-level)。

这已经不是“次旗舰勉强跟上”,而是日常任务里很难只凭价格判断谁更值。
Anthropic 自己公布的 Frontier-Bench 里,Opus 5 甚至反超了 Fable 5;ARC-AGI 3 得分约为次优模型的 3 倍(来源:Anthropic 官方发布页,https://www.anthropic.com/news/claude-opus-5;该结果属于厂商自测)。厂商 benchmark 得打个折看,像车企宣传续航,更多代表理想工况。独立数据的结论更克制:Opus 5 整体 ECI 略低于 Fable 5,但软件工程能力持平。
这意味着 Opus 5 更像“足够接近前沿的高性价比模型”,还不能写成所有维度全面碾压。
当模型能力接近时,成本差会在高频调用里反复出现。模型选型看的不只是单轮能力,还要看它能不能承担整条任务链的调用。
真正要重新计算的,是 Token 效率
价格砍半只是表面。更关键的变量藏在 token 效率里。
Harvey 的应用研究团队报告称,在相近表现下,Opus 5 平均生成 token 比上一代 Opus 4.8 少了 26%(来源:InfoQ,https://mp.weixin.qq.com/s?__biz=MjM5MDE0Mjc4MA==&mid=2651289450&idx=1&sn=8613b20d12dd0e621d4512e6a67efdf1)。同样的任务,新模型的单价和 token 用量都有下降空间。两项变化叠加后,任务总成本可能比只看报价更低。
