OpenAI 在 9 月 3 日先给一小批可信合作方开了 GPT-6 Astra 的限量预览,9 月 4 日转公开发布。前代是 GPT-5.6 Sol。
这次训练跑在德州的 Stargate,用了超过 10 万块 GPU,OpenAI 自称是公司迄今最大的一次训练。
主打功能是操作电脑
Astra 这一代往前推的方向很明确:让模型像人一样用电脑。OpenAI 总裁的原话是它能在表格里穿梭、填表单、在网页间跳转,速度常常超过人类。
对应的基准是 OSWorld 2.0,Astra 拿到 72.6%,前代 65.7%,同时还快了 47%。
除此之外,它能按你给的模板直接产出文档、幻灯片和表格,配合 ChatGPT Sites 还能建站。追问的习惯也改了,只在答案会影响结果的时候才问,不再什么都要跟你确认一遍。
Codex 那边加了个实验性的笔记功能,把上下文存成可搜索的笔记,替代原来那种压缩式摘要,跨窗口也能接着用。这个思路我挺喜欢,压缩摘要丢东西的问题折磨人很久了。
跑分
| 基准 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| OSWorld 2.0 | 72.6% | 65.7% |
| FrontierMath Tier 4 | 97.6% | 83.0% |
| ExploitBench | 100% | 78.5% |
| Terminal-Bench 4.0 | 57.7% | 37.3% |
| MRCR(512K–1M token) | 96.3% | 73.8% |
| ARC-AGI-3 | 99.9% | 7.8% |
| DeepSWE v1.1 | 74.1% | — |
ARC-AGI-3 那个 99.9% 需要打个星号:它依赖一套有状态、成本很高的执行框架。走无状态 API 调用的话,成绩掉到 17%~63% 区间。
价格和规格
- 输入 $10 / 百万 token,输出 $50 / 百万 token
- 缓存输入 $1 / 百万,缓存写入 $12.50 / 百万
- Fast Mode:2.5 倍速度,2 倍价格
- 上下文窗口 1,050,000 token,最大输出 128K
前代 Sol 是 $4/$20,这一代直接涨了 2.5 倍。
独立评测泼的冷水
Artificial Analysis 的数据跟发布会的调子有明显温差。
智能指数上 Astra 拿 61 分,跟前代 Sol 打平,比 Claude Fable 5.1 低 5 分。Coding Agent Index 是 67 分,跟 Claude Opus 5 和 Fable 5 处在同一水平。
token 效率确实进步了:Max 档下输出 token 比 Sol 少约 10%,编码任务上更夸张,只用到 Sol 的三分之一。但价格涨幅盖过了这个收益,折算下来单个任务比前代贵 75%。
幻觉这块是真改善:Max 档的幻觉率从 92% 降到 51%,同时准确率还涨了 4 分。
分项上的表现是撕裂的。长周期知识工作(AA-Briefcase)涨了 80 个 Elo 分,但衡量经济价值任务的 GDPval-AA v2 掉了差不多同样的 80 分,其余几项也有小幅回落。OpenAI 自家的 GDPval 基准这次没有出现在发布材料里。
Humanity's Last Exam 上 Astra 也落在 Claude Fable 5.1 后面。
网安能力踩到 Critical 线
这是这次发布最需要单独拎出来说的部分。
Astra 是第一个在 OpenAI Preparedness Framework 里达到网络安全 Critical 级的模型。这个级别的定义是:在有合适工具和权限的前提下,模型能发现此前未知的安全缺陷,并在很多防护完善的系统上开发出新的利用方式,中间不需要人一步步指导。
OpenAI 的处理方式是切成两个版本。公开发布的那版会拒绝高级网安任务;完整能力先给 Daybreak 项目的企业客户,后续通过 Daybreak Blue 扩大范围。模型也已经按自愿框架提交给美国政府审查。7 月 Hugging Face 那次事件之后,又追加了一层防护。
系统卡里的几个数字:
- 间接提示注入的防御成功率 99.79%,前代 96.23%
- 没有确认策略兜底时,agent 的误对齐结果率 3.4%
- 内部部署模拟里,严重误对齐标记比 Sol 少 53%
- 编码任务上的欺骗性完成率是 Sol 的四分之一
- Codex 部署模拟跑了 54,218 个内部任务,Gray Swan 那套用了 1,810 个精选攻击
思维链看不清了
Astra 用了一种叫 recurrent depth 的新推理方式,副作用是思维链被遮蔽。
OpenAI 自己在系统卡里承认了这件事:Astra 比 GPT-5.6 Sol 更能控制自己的 CoT,也更不容易把有问题的信息写进去。原文的措辞是他们"严肃对待"这个趋势,正在继续调查。
AI 安全领域对此的反应是担心可监控性下降。一个能力更强、同时更难被外部读懂在想什么的模型,审计难度是往上走的。这条比任何一项跑分都更值得盯着看。
怎么用上
API 模型名 gpt-6-astra,ChatGPT 的 Plus / Pro / Business / Enterprise 用户陆续开放,Amazon Bedrock 也上了。企业版默认关闭,需要按工作区单独启用。
参考来源
- GPT-6 Astra: A new generation of intelligence — OpenAI
- GPT-6 Astra System Card — OpenAI Deployment Safety Hub
- OpenAI launches GPT-6 Astra, its most powerful model yet — Fortune
- GPT-6 Astra: Features, Benchmarks, and Pricing — DataCamp
- Benchmarking GPT-6 Astra — Artificial Analysis
- GPT-6 Astra — Wikipedia