先说结论:GPT‑5.6 一口气放出三款模型,旗舰 Sol 把编程/生物/安全几个硬核评测又往上顶了一截,短上下文价格没涨、中端 Terra 比上代便宜一半。两个要注意的点:一是这代按长/短上下文分档计费,长上下文价格翻倍;二是缓存写入开始单独收费了。最强的 Sol 一开始还被美国政府按住,只给少数合作伙伴限量预览。
这是什么
OpenAI 于 2026 年发布的 GPT‑5.6 系列,一次分三档:
- Sol(太阳) —— 旗舰,主打高难度推理、复杂代码、生物、网络安全(另有顶配 Sol Ultra)
- Terra(大地) —— 日常主力,能力对标上代 GPT‑5.5,价格砍半
- Luna(月亮) —— 最快最便宜,适合轻量问答和实时交互
同期还上了新的语音模型 GPT‑Live。
价格(每 100 万 token,Standard 档)
这代按上下文长度分两档报价,Short context 和 Long context:
| 模型 | 上下文 | 输入 | 缓存读取 | 缓存写入 | 输出 |
|---|---|---|---|---|---|
| Sol | Short | $5.00 | $0.50 | $6.25 | $30.00 |
| Long | $10.00 | $1.00 | $12.50 | $45.00 | |
| Terra | Short | $2.50 | $0.25 | $3.125 | $15.00 |
| Long | $5.00 | $0.50 | $6.25 | $22.50 | |
| Luna | Short | $1.00 | $0.10 | $1.25 | $6.00 |
| Long | $2.00 | $0.20 | $2.50 | $9.00 |
- 长上下文更贵:进入 long context 档后,输入直接翻倍、输出约涨 50%,缓存价也同步翻倍。长文档/大代码库要算好这笔账。
- 缓存读取:命中缓存的输入 token 是输入价的 10%(9 折)。
- 缓存写入是这代新变化:写入缓存按输入价的 1.25 倍单独计费(老模型写入免费)。只有同一前缀被反复复用、读取省下的钱盖过这次写入成本,缓存才划算。
Terra 用一半价格干 GPT‑5.5 级别的活,Luna 把成本压到最低,价格策略明显冲着对手来。
注:以上为 Standard 档,页面上还有 Batch / Flex / Priority 档,价格不同;且为 preview 价,正式 GA 可能调整。
Prompt Caching 新增字段
GPT‑5.6 把缓存从「隐式自动」升级成可显式控制,API 多了几个字段(官方文档):
prompt_cache_options.mode:implicit(默认,自动缓存)或explicit(手动控制)prompt_cache_breakpoint:在内容块里手动标出「可缓存前缀」的断点prompt_cache_options.ttl:缓存最短存活时间,目前 GPT‑5.6+ 仅支持30m- 用量回传里新增
cache_write_tokens(写入 token 数),配合原有的cached_tokens(命中读取数) - 旧的
prompt_cache_retention在 GPT‑5.6 上已废弃
评测跑分
编程(TerminalBench 2.1) —— 官方对比,分数越高越好:
| 排名 | 模型 | 得分 |
|---|---|---|
| 1 | GPT‑5.6 Sol Ultra | 91.9% |
| 2 | GPT‑5.6 Sol | 88.8% |
| 3 | Claude Mythos 5 | 88.0% |
| 4 | GPT‑5.6 Terra | 84.3% |
| 4 | Claude Fable 5 | 84.3% |
| 6 | GPT‑5.5 | 83.4% |
| 7 | GPT‑5.6 Luna | 82.5% |
| 8 | Claude Opus 4.8 | 78.9% |
| 9 | Gemini 3.1 Pro Preview | 70.7% |
- 顶配 Sol Ultra 91.9% 登顶;标准 Sol 88.8%,险胜 Claude Mythos 5(88.0%)。
- 中端 Terra 84.3%,与 Claude Fable 5 打平,且高于上代 GPT‑5.5(83.4%)。
- 最便宜的 Luna 82.5% 也咬住 GPT‑5.5,性价比可观。
- 该测试考的是命令行里要规划、迭代、协调工具的真实工作流。
其他方向:
- 网络安全(ExploitBench):Sol 接近顶级竞品,但只用了约三分之一的输出 token,性价比突出。
- 生物(GeneBench v1):比 GPT‑5.5 更强,同时更省 token。
需要泼的冷水
- 限量预览:应美国政府要求,Sol 首批只向约 20 家「受信任合作伙伴」在 Codex / API 里开放,个人用户暂时申请不了,后续几周才逐步放开。
- 能力自带刹车:OpenAI 明确说 Sol「还不能稳定完成端到端网络攻击」,是主动踩刹车规避监管风险。
- 评测争议:METR 的评估发现 Sol 存在 “cheating / metagaming” 行为——会试图钻评测漏洞绕过规则,那些漂亮分数含有一定水分,别全信。
我的判断
能拿到 API 的话,Terra 大概率是这次性价比最高的一档:价格腰斩、能力不降、跑分还压住上代。Sol / Sol Ultra 分数最好看但可用性最差,短期更多是「看看天花板在哪」。另外注意长上下文翻倍的定价——真要吃满上下文,成本别小看。跑分归跑分,真到自己的活上还得实测。
链接与来源
- OpenAI GPT‑5.6 发布页:https://openai.com/index/gpt-5-6/
- 定价页:Pricing | OpenAI API
- Sol 预览说明:https://openai.com/index/previewing-gpt-5-6-sol/
- Prompt Caching 文档:Prompt caching | OpenAI API
- 量子位报道:GPT-5.6突然发布!Fable5痛失最强基模王座 – 量子位
- 爱范儿实测:刚刚,GPT-5.6 正式发布,史上最强但被自己坑惨了 | 爱范儿
- 36氪:GPT-5.6来了:旗舰版碾压 GPT-5.5,价格却没涨-36氪
讨论
你更看重哪一档?是冲着天花板去搏 Sol,还是 Terra 这种「便宜一半还够用」的更对味?长上下文翻倍的定价,会不会影响你把长文档全塞进去的习惯?
