Claude Opus 5 发布:接近 Fable 5 的智能,一半的价格

Anthropic 在 2026 年 7 月 24 日发布了 Claude Opus 5,官方的说法很直接:拿到接近旗舰 Fable 5 的智能水平,但价格只有一半。

一句话总结

  • 价格 $5 / 百万输入 token,$25 / 百万输出 token,和上一代 Opus 4.8 完全一样没涨价;对比 Fable 5 的 $10 / $50 正好砍半
  • API 模型名:claude-opus-5
  • Claude Max 的默认模型已经换成它,Pro 用户能用到的最强模型也是它
  • Claude.ai / Claude Code / Cowork / API 全平台同步上线

跑分

Frontier-Bench v0.1:超过所有其他模型,分数是 Opus 4.8 的两倍多,而单任务成本反而更低。

CursorBench 3.2:和 Fable 5 的差距在 0.5% 以内,但只要一半的钱。这条大概是对日常写代码的人最有参考价值的。

ARC-AGI 3:30.2%,是第二名的三倍。这个榜一直是各家模型的滑铁卢,提升幅度有点夸张。

其他:

  • GDPval-AA v2(知识工作)SOTA
  • OSWorld 2.0(电脑操作)超过 Fable 5 的最好成绩,成本只要三分之一多一点
  • Zapier AutomationBench:同等单任务成本下,通过率约为次优模型的 1.5 倍
  • 科研方向:有机化学比 Opus 4.8 高 10.2 个百分点,蛋白质预测高 7.7 个百分点

两个用起来能感知到的东西

effort 档位。可以按请求指定思考强度(low 到 max),用成本换智能。简单的批量活儿压到低档省钱,硬题目开 xhigh / max,不用再靠换模型来调这个平衡。

fast mode。2 倍价格换约 2.5 倍速度,交互式场景(Claude Code 里等结果的时候)值得考虑。

另外两个 beta 特性对写 agent 的人比较实用:会话中途更换工具定义不再让 prompt cache 全部失效;被安全策略拦下的请求会自动回落路由,而不是直接失败。

也有短板

官方自己写明了:在攻击性网络安全和生物研究方向,Opus 5 仍然落后于 Mythos 5。不过网安分类器比 Fable 5 放松了约 85%,现在允许对源码做漏洞识别,只是仍然拦截二进制扫描和 exploit 生成。

对齐方面倒是这批模型里最好的一个:行为审计的错位行为得分 2.3,是最低的,欺骗性行为比例和对抗提示的易感度也都是最低。

我的看法

这次没有走"更强更贵"的路线,而是把上一代旗舰的能力压到了一半价格,还保持 Opus 档位定价不变。对个人开发者来说,实际意义比跑分更大——原来要开 Fable 5 才敢干的活儿,现在 Opus 5 就能顶,预算直接对折。

Claude Code 用户基本不用做什么,直接就是新的默认。

官方公告:Introducing Claude Opus 5 \ Anthropic