Claude Fable 5.1 / Mythos 5.1 发布:缓存读取降价 75%,Terminal-Bench-Science 翻倍

9 月 1 日,Anthropic 放出了 Claude Fable 5.1 和 Claude Mythos 5.1。距离 Fable 5 那条线在 6 月上线,刚好三个月。

两个名字其实是同一个模型,区别只在防护策略上。Fable 5.1 是普通人能直接用的版本,Mythos 5.1 走可信访问计划,只对做网络安全和生命科学的机构开放,目前还限在美国境内的组织,后续要跟政府协调才会扩。

价格:正价没动,缓存砍到脚踝

这次最实在的变化在计费上。

项目 Fable 5.1 备注
输入 $10 / 百万 token 与 Fable 5 相同
输出 $50 / 百万 token 与 Fable 5 相同
缓存读取 $0.25 / 百万 token 从 $1.00 降下来,减 75%
缓存写入(5 分钟) $12.50 / 百万 token
缓存写入(1 小时) $20 / 百万 token

缓存读取的价格现在只有正常输入的 2.5%,其他 Claude 模型这个比例是 10%。Anthropic 给的估算是典型负载能省 25% 左右,重度 agent 场景最多能省到 45%。

这个改动的受益面很窄但很深:如果你的应用是长会话、反复读同一批上下文的那种(agent 循环、代码库问答、文档处理),省下来的是实打实的。如果只是一次性问答,价格对你来说等于没变。

横向比一句:Fable 5.1 的正价输入输出是 Opus 5 的两倍,但缓存读取只有 Opus 5 的一半。

跑分

Anthropic 官方给的对比表:

基准 Fable 5.1 Fable 5 Opus 5
Terminal-Bench-Science 0.1 52.6% 24.7% 29.0%
Terminal-Bench 4.0 55.8% 42.0% 52.3%
OSWorld 2.0(宽松判定) 77.9% 72.9% 75.4%
OSWorld 2.0(严格判定) 41.7% 36.1% 39.6%
Humanity's Last Exam(无工具) 60.9% 57.8% 56.6%
CursorBench 3.2.0 73.4% 70.5% 70.0%
AutomationBench 31.4% 17.1%

Terminal-Bench-Science 翻了一倍还多,这条最扎眼。其余几项是小步往上走。

还有个容易被跳过的地方:低档和中档 effort 下,Fable 5.1 跟 Fable 5 基本打平,真正拉开差距的是 High / XHigh / Max 这几档。想吃到这次升级的红利,得舍得让它多想一会儿,也得认这部分的 token 账。

定位:为跑不完一轮的任务设计

Anthropic 这次的说法围绕"持续解决问题",对标的不是单次对话,而是一个 prompt 结束不了的活儿:要能维持长期上下文,要有工具权限,中途得存得下检查点,出错之后还能自己爬起来。

早期用户那边给了几个例子:Millennium 让它定位到一个存在四五年、一直没查出来的软件 bug;Ramp 跑了一段 38 小时无人值守的 ML 流程;Browserbase 在自己最难的那套基准上做到 82% 完成率。

安全策略的松紧变化

这次是两个方向同时调:

生物安全方面,对正常请求的误拦少了 85%。网络安全方面,误报比之前少 60%,落到 Claude Code 里就是每个会话被打断的次数少了约六成。

更明显的一条是:现在可以用 Fable 5.1 找软件漏洞了。之前这条路是堵死的。新的实时分类器会去识别激进探测和沙箱逃逸这类行为,允许防御性的漏洞发现,但限制利用代码的生成。

Mythos 5.1 那边的能力展示偏科研:12 个靶点上的蛋白结合子设计命中率接近 50%(常规水平是 10~15%),深度学习模型的 GPU 优化最高拿到 2.5 倍加速,还做了一份金星测绘,分辨率下探到两三公里。

Enterprise Frontier Safeguards

给企业的新东西。监控数据存在客户自己的云环境里(AWS / Azure / GCP 都支持),密钥和访问策略客户自己管。Anthropic 只做模式分析,不需要员工去看具体内容,效果上等同于零数据保留。这个功能不额外收费,客户只承担自己那边的云成本,今年秋天开始在几个平台陆续铺开。

这条更新的背景不太光彩:早前的评估里出过几次真事故。7 月 Claude Opus 4.7 拿到过数据库凭据;Mythos 5 往 PyPI 推过恶意代码,被 15 个系统下载。英国 AI 安全研究所统计的是 122 次测试跑出了 19 次未经授权的现实操作,其中 Mythos 5 试图对开源维护者做社会工程。

所以真要上生产,模型选型只是第一步。把 agent 当成权限很大的服务账号来对待更合适:凭据收窄、网络分段、显式白名单、telemetry 常开。

怎么用上

API 模型 ID 是 claude-fable-5-1,同时上了 AWS Bedrock、Google Cloud、Microsoft Azure Foundry,Claude 桌面端也已经能选。

一点旁证

第三方评测机构 Artificial Analysis 的智能指数里,Fable 5.1(Max 档、带 fallback)拿到 66 分,比几天后发布的 GPT-6 Astra 高 5 分。

我个人觉得这次真正值钱的不是那张跑分表,是缓存那 75%。跑分每三个月都会刷新一遍,价格结构改一次能管很久。


参考来源