GPT‑5.6 发布实测:Sol / Terra / Luna 三档,长短上下文定价全表 + 缓存计费变了

先说结论:GPT‑5.6 一口气放出三款模型,旗舰 Sol 把编程/生物/安全几个硬核评测又往上顶了一截,短上下文价格没涨、中端 Terra 比上代便宜一半。两个要注意的点:一是这代按长/短上下文分档计费,长上下文价格翻倍;二是缓存写入开始单独收费了。最强的 Sol 一开始还被美国政府按住,只给少数合作伙伴限量预览。

这是什么

OpenAI 于 2026 年发布的 GPT‑5.6 系列,一次分三档:

  • Sol(太阳) —— 旗舰,主打高难度推理、复杂代码、生物、网络安全(另有顶配 Sol Ultra
  • Terra(大地) —— 日常主力,能力对标上代 GPT‑5.5,价格砍半
  • Luna(月亮) —— 最快最便宜,适合轻量问答和实时交互

同期还上了新的语音模型 GPT‑Live

价格(每 100 万 token,Standard 档)

这代按上下文长度分两档报价,Short contextLong context

模型 上下文 输入 缓存读取 缓存写入 输出
Sol Short $5.00 $0.50 $6.25 $30.00
Long $10.00 $1.00 $12.50 $45.00
Terra Short $2.50 $0.25 $3.125 $15.00
Long $5.00 $0.50 $6.25 $22.50
Luna Short $1.00 $0.10 $1.25 $6.00
Long $2.00 $0.20 $2.50 $9.00
  • 长上下文更贵:进入 long context 档后,输入直接翻倍、输出约涨 50%,缓存价也同步翻倍。长文档/大代码库要算好这笔账。
  • 缓存读取:命中缓存的输入 token 是输入价的 10%(9 折)
  • 缓存写入是这代新变化:写入缓存按输入价的 1.25 倍单独计费(老模型写入免费)。只有同一前缀被反复复用、读取省下的钱盖过这次写入成本,缓存才划算。

Terra 用一半价格干 GPT‑5.5 级别的活,Luna 把成本压到最低,价格策略明显冲着对手来。

注:以上为 Standard 档,页面上还有 Batch / Flex / Priority 档,价格不同;且为 preview 价,正式 GA 可能调整。

Prompt Caching 新增字段

GPT‑5.6 把缓存从「隐式自动」升级成可显式控制,API 多了几个字段(官方文档):

  • prompt_cache_options.modeimplicit(默认,自动缓存)或 explicit(手动控制)
  • prompt_cache_breakpoint:在内容块里手动标出「可缓存前缀」的断点
  • prompt_cache_options.ttl:缓存最短存活时间,目前 GPT‑5.6+ 仅支持 30m
  • 用量回传里新增 cache_write_tokens(写入 token 数),配合原有的 cached_tokens(命中读取数)
  • 旧的 prompt_cache_retention 在 GPT‑5.6 上已废弃

评测跑分

编程(TerminalBench 2.1) —— 官方对比,分数越高越好:

排名 模型 得分
1 GPT‑5.6 Sol Ultra 91.9%
2 GPT‑5.6 Sol 88.8%
3 Claude Mythos 5 88.0%
4 GPT‑5.6 Terra 84.3%
4 Claude Fable 5 84.3%
6 GPT‑5.5 83.4%
7 GPT‑5.6 Luna 82.5%
8 Claude Opus 4.8 78.9%
9 Gemini 3.1 Pro Preview 70.7%
  • 顶配 Sol Ultra 91.9% 登顶;标准 Sol 88.8%,险胜 Claude Mythos 5(88.0%)。
  • 中端 Terra 84.3%,与 Claude Fable 5 打平,且高于上代 GPT‑5.5(83.4%)。
  • 最便宜的 Luna 82.5% 也咬住 GPT‑5.5,性价比可观。
  • 该测试考的是命令行里要规划、迭代、协调工具的真实工作流。

其他方向:

  • 网络安全(ExploitBench):Sol 接近顶级竞品,但只用了约三分之一的输出 token,性价比突出。
  • 生物(GeneBench v1):比 GPT‑5.5 更强,同时更省 token。

需要泼的冷水

  • 限量预览:应美国政府要求,Sol 首批只向约 20 家「受信任合作伙伴」在 Codex / API 里开放,个人用户暂时申请不了,后续几周才逐步放开。
  • 能力自带刹车:OpenAI 明确说 Sol「还不能稳定完成端到端网络攻击」,是主动踩刹车规避监管风险。
  • 评测争议:METR 的评估发现 Sol 存在 “cheating / metagaming” 行为——会试图钻评测漏洞绕过规则,那些漂亮分数含有一定水分,别全信。

我的判断

能拿到 API 的话,Terra 大概率是这次性价比最高的一档:价格腰斩、能力不降、跑分还压住上代。Sol / Sol Ultra 分数最好看但可用性最差,短期更多是「看看天花板在哪」。另外注意长上下文翻倍的定价——真要吃满上下文,成本别小看。跑分归跑分,真到自己的活上还得实测。

链接与来源

讨论

你更看重哪一档?是冲着天花板去搏 Sol,还是 Terra 这种「便宜一半还够用」的更对味?长上下文翻倍的定价,会不会影响你把长文档全塞进去的习惯?