概述
6 月 9 日,Anthropic 正式发布 Claude Fable 5 和 Claude Mythos 5,这是第五代 Claude 模型的双子星发布。Fable 5 是 Anthropic 迄今为止面向公众开放的最强模型,具备 Mythos 级能力,同时加入了安全护栏;Mythos 5 则是同一底层模型的无限制版本,仅通过 Project Glasswing 向经审核的网络安全防御者和关键基础设施提供商开放。
核心能力
软件工程
- SWE-Bench Pro:80.3%(Opus 4.8 为 69.2%,GPT 5.5 为 58.6%)
- FrontierCode:29.3%(Opus 4.8 为 13.4%,GPT 5.5 为 5.7%)
- Stripe 反馈:Fable 5 将 5 个月的工程工作压缩到数天,在 5000 万行 Ruby 代码库中一天完成了原本需要一个团队两个月的手动迁移
- 比早期 Claude 模型更省 token,在中等努力水平下即为 FrontierCode 所有前沿模型中得分最高
知识工作
- 在 Hebbia 金融基准测试中取得所有模型最高分,涵盖文档推理、图表解读和问题求解
- IMC 交易公司称 Fable 5 几乎通过了他们所有的交易分析评估
- Hex 分析平台:首个在复杂长周期分析任务基准上突破 90% 的模型
视觉能力
- 新一代视觉 SOTA 模型
- 能从复杂科学图表中提取精确数据
- 能仅凭截图重建 Web 应用源码
- 仅用游戏截图通关了 Pokémon FireRed(早期模型需要复杂的辅助工具框架)
记忆与长上下文
- 在百万级 token 的长任务中保持专注
- 通过自建笔记提升输出质量
- 在 Slay the Spire 卡牌游戏中,持久化文件记忆对 Fable 5 性能的提升是 Opus 4.8 的 3 倍
科学研究突破(Mythos 5)
药物设计
- 内部蛋白质设计专家使用 Mythos 5 将药物设计流程加速约 10 倍
- 模型独立完成全流程:选择结合位点、运行蛋白质设计工具、自动纠错
- 14 个蛋白质靶点中有 9 个产生了强候选药物
分子生物学新假说
- 首个能持续产出新颖且令人信服的科学假说的模型
- 盲测中,科学家约 80% 的情况下偏好 Mythos 的分子生物学假说而非 Opus 级模型
- 一个关于大肠杆菌蛋白质新机制的假说已被独立实验室研究证实
基因组学自主研究
- Mythos 5 进行了超过一周的自主基因组学研究
- 整合了 138 个动物物种的数百万单细胞数据
- 设计并训练了一个自定义 ML 模型,性能超越了发表在 Science 期刊上的模型,且体积小 100 倍
安全机制
Fable 5 采用了全新的安全分类器系统:
- 回退机制:当检测到网络安全、生物化学或蒸馏相关请求时,自动由 Claude Opus 4.8 处理
- 超过 95% 的会话不受影响
- 网络攻击测试中,Fable 5 的攻击成功率为 0%
- 外部测试团队在超过 1000 小时的越狱测试中未发现通用越狱方法
- 所有 Mythos 模型强制 30 天数据保留(不用于训练,仅用于防御新型攻击)
定价与可用性
| 项目 | 价格 |
|---|---|
| 输入 token | $10 / 百万 |
| 输出 token | $50 / 百万 |
| 5 分钟缓存写入 | $12.50 / 百万 |
| 1 小时缓存写入 | $20 / 百万 |
| 缓存命中 | $1 / 百万 |
- 价格不到 Mythos Preview 的一半,但约为 Opus 4.8 的两倍
- 即日起至 6 月 22 日:Pro、Max、Team 和企业版订阅用户可在订阅额度内使用
- 6 月 23 日起:需要使用额度,后续会恢复为标准订阅功能
- API 和按量计费的企业版计划即日起可用
企业早期反馈
- Stripe:5 个月工程压缩到数天
- GitHub:在长周期编码任务中表现出前所未有的自主性和可靠性
- Cognition:FrontierBench 最高分模型
- Rakuten:最高努力级别下能自我反思和验证,使高度自主运营成为可能
- Cursor:CursorBench SOTA,开启了一类此前模型无法触及的长周期问题
总结
Fable 5 / Mythos 5 标志着 Anthropic 将 Mythos 级能力从封闭的安全研究项目推向公众的关键一步。模型在编码、分析、视觉和科学研究方面全面领先,但高定价($10/$50 per MTok)和强制数据保留政策可能会限制其广泛采用。安全回退机制在保护公众的同时也意味着部分高风险查询会降级到 Opus 4.8。
参考链接
