Claude Opus 4.8 这次更像是在补齐长任务短板

Claude Opus 4.8 发布了。这次不是那种“参数更多、跑分更高”的单点升级,Anthropic 把重点放在了更长期、更复杂的 agent 工作流上。

几个值得关注的变化:

  • 模型本身:Opus 4.8 建立在 Opus 4.7 之上,Anthropic 自己的说法是“modest but tangible improvement”,也就是温和但可感知的提升。方向主要是编码、agent 任务、推理和专业知识工作。
  • 更诚实:官方强调 Opus 4.8 更愿意标出不确定性,而不是在证据不足时硬说自己完成了。Anthropic 的评估称,它让代码缺陷“悄悄通过、不加提示”的概率约为前代的四分之一。
  • Claude Code 动态工作流:新推出的 Dynamic Workflows 处于 research preview。Claude 可以把大型任务拆成计划,拉起数百个并行子 agent,在单个 session 里执行并验证结果。官方举的例子是跨数十万行代码的代码库迁移,从 kickoff 一路做到 merge,并以现有测试套件作为验收标准。
  • Effort control:claude.ai 和 Cowork 里新增 effort 控制,可以选择 Claude 在任务上投入多少“思考”。Opus 4.8 默认 high effort;复杂任务和长时间异步工作流建议用 extra,Claude Code 中对应 xhigh,也可以选 max。
  • API 更新:Messages API 现在允许在 messages 数组里放 system entries,开发者可以在长任务中途更新系统指令,同时尽量不破坏 prompt cache。
  • Fast Mode:Opus 4.8 的 fast mode 速度约为常规 2.5 倍。常规价格不变,仍是输入 $5 / 百万 token、输出 $25 / 百万 token;fast mode 为输入 $10、输出 $50 / 百万 token,相比此前 Opus fast mode 明显便宜。
  • 可用平台:官方称 Opus 4.8 已上线 Claude API,模型 ID 为 claude-opus-4-8。AWS 也宣布已在 Amazon Bedrock 和 Claude Platform on AWS 提供。GitHub Copilot 方面,Opus 4.8 已面向 Pro+、Business、Enterprise 用户逐步开放,Business/Enterprise 管理员需要在设置里开启对应策略。

我觉得这次更像是 Anthropic 在把 Claude 从“聊天模型”继续往“长时间干活的工程 agent”推。模型能力当然有提升,但更关键的是周边机制:动态工作流、effort 控制、中途 system message、prompt cache 成本优化,这些都是为了让 agent 在真实项目里跑更久、少中断、少自信犯错。

比较克制的一点是,Anthropic 没把它包装成断代升级。Simon Willison 也提到,官方直接承认这是“modest but tangible improvement”,反而比常见的大模型发布话术更可信。对普通聊天用户来说,体感可能不会像换代一样夸张;但对 Claude Code、长上下文分析、多文件重构、企业知识工作流这些场景,Opus 4.8 的价值会更明显。

如果你现在主要拿 Claude 写代码、跑 agent 或处理长文档,Opus 4.8 值得试。简单问答和日常聊天,可能还是要看成本和额度,没必要所有任务都上 Opus。

参考来源: