Anthropic 在 2026 年 7 月 24 日发布了 Claude Opus 5,官方的说法很直接:拿到接近旗舰 Fable 5 的智能水平,但价格只有一半。
一句话总结
- 价格 $5 / 百万输入 token,$25 / 百万输出 token,和上一代 Opus 4.8 完全一样没涨价;对比 Fable 5 的 $10 / $50 正好砍半
- API 模型名:
claude-opus-5 - Claude Max 的默认模型已经换成它,Pro 用户能用到的最强模型也是它
- Claude.ai / Claude Code / Cowork / API 全平台同步上线
跑分
Frontier-Bench v0.1:超过所有其他模型,分数是 Opus 4.8 的两倍多,而单任务成本反而更低。
CursorBench 3.2:和 Fable 5 的差距在 0.5% 以内,但只要一半的钱。这条大概是对日常写代码的人最有参考价值的。
ARC-AGI 3:30.2%,是第二名的三倍。这个榜一直是各家模型的滑铁卢,提升幅度有点夸张。
其他:
- GDPval-AA v2(知识工作)SOTA
- OSWorld 2.0(电脑操作)超过 Fable 5 的最好成绩,成本只要三分之一多一点
- Zapier AutomationBench:同等单任务成本下,通过率约为次优模型的 1.5 倍
- 科研方向:有机化学比 Opus 4.8 高 10.2 个百分点,蛋白质预测高 7.7 个百分点
两个用起来能感知到的东西
effort 档位。可以按请求指定思考强度(low 到 max),用成本换智能。简单的批量活儿压到低档省钱,硬题目开 xhigh / max,不用再靠换模型来调这个平衡。
fast mode。2 倍价格换约 2.5 倍速度,交互式场景(Claude Code 里等结果的时候)值得考虑。
另外两个 beta 特性对写 agent 的人比较实用:会话中途更换工具定义不再让 prompt cache 全部失效;被安全策略拦下的请求会自动回落路由,而不是直接失败。
也有短板
官方自己写明了:在攻击性网络安全和生物研究方向,Opus 5 仍然落后于 Mythos 5。不过网安分类器比 Fable 5 放松了约 85%,现在允许对源码做漏洞识别,只是仍然拦截二进制扫描和 exploit 生成。
对齐方面倒是这批模型里最好的一个:行为审计的错位行为得分 2.3,是最低的,欺骗性行为比例和对抗提示的易感度也都是最低。
我的看法
这次没有走"更强更贵"的路线,而是把上一代旗舰的能力压到了一半价格,还保持 Opus 档位定价不变。对个人开发者来说,实际意义比跑分更大——原来要开 Fable 5 才敢干的活儿,现在 Opus 5 就能顶,预算直接对折。
Claude Code 用户基本不用做什么,直接就是新的默认。





