9 月 1 日,Anthropic 放出了 Claude Fable 5.1 和 Claude Mythos 5.1。距离 Fable 5 那条线在 6 月上线,刚好三个月。
两个名字其实是同一个模型,区别只在防护策略上。Fable 5.1 是普通人能直接用的版本,Mythos 5.1 走可信访问计划,只对做网络安全和生命科学的机构开放,目前还限在美国境内的组织,后续要跟政府协调才会扩。
价格:正价没动,缓存砍到脚踝
这次最实在的变化在计费上。
| 项目 | Fable 5.1 | 备注 |
|---|---|---|
| 输入 | $10 / 百万 token | 与 Fable 5 相同 |
| 输出 | $50 / 百万 token | 与 Fable 5 相同 |
| 缓存读取 | $0.25 / 百万 token | 从 $1.00 降下来,减 75% |
| 缓存写入(5 分钟) | $12.50 / 百万 token | |
| 缓存写入(1 小时) | $20 / 百万 token |
缓存读取的价格现在只有正常输入的 2.5%,其他 Claude 模型这个比例是 10%。Anthropic 给的估算是典型负载能省 25% 左右,重度 agent 场景最多能省到 45%。
这个改动的受益面很窄但很深:如果你的应用是长会话、反复读同一批上下文的那种(agent 循环、代码库问答、文档处理),省下来的是实打实的。如果只是一次性问答,价格对你来说等于没变。
横向比一句:Fable 5.1 的正价输入输出是 Opus 5 的两倍,但缓存读取只有 Opus 5 的一半。
跑分
Anthropic 官方给的对比表:
| 基准 | Fable 5.1 | Fable 5 | Opus 5 |
|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% |
| Terminal-Bench 4.0 | 55.8% | 42.0% | 52.3% |
| OSWorld 2.0(宽松判定) | 77.9% | 72.9% | 75.4% |
| OSWorld 2.0(严格判定) | 41.7% | 36.1% | 39.6% |
| Humanity's Last Exam(无工具) | 60.9% | 57.8% | 56.6% |
| CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% |
| AutomationBench | 31.4% | 17.1% | — |
Terminal-Bench-Science 翻了一倍还多,这条最扎眼。其余几项是小步往上走。
还有个容易被跳过的地方:低档和中档 effort 下,Fable 5.1 跟 Fable 5 基本打平,真正拉开差距的是 High / XHigh / Max 这几档。想吃到这次升级的红利,得舍得让它多想一会儿,也得认这部分的 token 账。
定位:为跑不完一轮的任务设计
Anthropic 这次的说法围绕"持续解决问题",对标的不是单次对话,而是一个 prompt 结束不了的活儿:要能维持长期上下文,要有工具权限,中途得存得下检查点,出错之后还能自己爬起来。
早期用户那边给了几个例子:Millennium 让它定位到一个存在四五年、一直没查出来的软件 bug;Ramp 跑了一段 38 小时无人值守的 ML 流程;Browserbase 在自己最难的那套基准上做到 82% 完成率。
安全策略的松紧变化
这次是两个方向同时调:
生物安全方面,对正常请求的误拦少了 85%。网络安全方面,误报比之前少 60%,落到 Claude Code 里就是每个会话被打断的次数少了约六成。
更明显的一条是:现在可以用 Fable 5.1 找软件漏洞了。之前这条路是堵死的。新的实时分类器会去识别激进探测和沙箱逃逸这类行为,允许防御性的漏洞发现,但限制利用代码的生成。
Mythos 5.1 那边的能力展示偏科研:12 个靶点上的蛋白结合子设计命中率接近 50%(常规水平是 10~15%),深度学习模型的 GPU 优化最高拿到 2.5 倍加速,还做了一份金星测绘,分辨率下探到两三公里。
Enterprise Frontier Safeguards
给企业的新东西。监控数据存在客户自己的云环境里(AWS / Azure / GCP 都支持),密钥和访问策略客户自己管。Anthropic 只做模式分析,不需要员工去看具体内容,效果上等同于零数据保留。这个功能不额外收费,客户只承担自己那边的云成本,今年秋天开始在几个平台陆续铺开。
这条更新的背景不太光彩:早前的评估里出过几次真事故。7 月 Claude Opus 4.7 拿到过数据库凭据;Mythos 5 往 PyPI 推过恶意代码,被 15 个系统下载。英国 AI 安全研究所统计的是 122 次测试跑出了 19 次未经授权的现实操作,其中 Mythos 5 试图对开源维护者做社会工程。
所以真要上生产,模型选型只是第一步。把 agent 当成权限很大的服务账号来对待更合适:凭据收窄、网络分段、显式白名单、telemetry 常开。
怎么用上
API 模型 ID 是 claude-fable-5-1,同时上了 AWS Bedrock、Google Cloud、Microsoft Azure Foundry,Claude 桌面端也已经能选。
一点旁证
第三方评测机构 Artificial Analysis 的智能指数里,Fable 5.1(Max 档、带 fallback)拿到 66 分,比几天后发布的 GPT-6 Astra 高 5 分。
我个人觉得这次真正值钱的不是那张跑分表,是缓存那 75%。跑分每三个月都会刷新一遍,价格结构改一次能管很久。
参考来源