GPT-6 Astra 发布:主打操作电脑,网安能力首次触及 Critical 级

OpenAI 在 9 月 3 日先给一小批可信合作方开了 GPT-6 Astra 的限量预览,9 月 4 日转公开发布。前代是 GPT-5.6 Sol。

这次训练跑在德州的 Stargate,用了超过 10 万块 GPU,OpenAI 自称是公司迄今最大的一次训练。

主打功能是操作电脑

Astra 这一代往前推的方向很明确:让模型像人一样用电脑。OpenAI 总裁的原话是它能在表格里穿梭、填表单、在网页间跳转,速度常常超过人类。

对应的基准是 OSWorld 2.0,Astra 拿到 72.6%,前代 65.7%,同时还快了 47%。

除此之外,它能按你给的模板直接产出文档、幻灯片和表格,配合 ChatGPT Sites 还能建站。追问的习惯也改了,只在答案会影响结果的时候才问,不再什么都要跟你确认一遍。

Codex 那边加了个实验性的笔记功能,把上下文存成可搜索的笔记,替代原来那种压缩式摘要,跨窗口也能接着用。这个思路我挺喜欢,压缩摘要丢东西的问题折磨人很久了。

跑分

基准 GPT-6 Astra GPT-5.6 Sol
OSWorld 2.0 72.6% 65.7%
FrontierMath Tier 4 97.6% 83.0%
ExploitBench 100% 78.5%
Terminal-Bench 4.0 57.7% 37.3%
MRCR(512K–1M token) 96.3% 73.8%
ARC-AGI-3 99.9% 7.8%
DeepSWE v1.1 74.1%

ARC-AGI-3 那个 99.9% 需要打个星号:它依赖一套有状态、成本很高的执行框架。走无状态 API 调用的话,成绩掉到 17%~63% 区间。

价格和规格

  • 输入 $10 / 百万 token,输出 $50 / 百万 token
  • 缓存输入 $1 / 百万,缓存写入 $12.50 / 百万
  • Fast Mode:2.5 倍速度,2 倍价格
  • 上下文窗口 1,050,000 token,最大输出 128K

前代 Sol 是 $4/$20,这一代直接涨了 2.5 倍。

独立评测泼的冷水

Artificial Analysis 的数据跟发布会的调子有明显温差。

智能指数上 Astra 拿 61 分,跟前代 Sol 打平,比 Claude Fable 5.1 低 5 分。Coding Agent Index 是 67 分,跟 Claude Opus 5 和 Fable 5 处在同一水平。

token 效率确实进步了:Max 档下输出 token 比 Sol 少约 10%,编码任务上更夸张,只用到 Sol 的三分之一。但价格涨幅盖过了这个收益,折算下来单个任务比前代贵 75%。

幻觉这块是真改善:Max 档的幻觉率从 92% 降到 51%,同时准确率还涨了 4 分。

分项上的表现是撕裂的。长周期知识工作(AA-Briefcase)涨了 80 个 Elo 分,但衡量经济价值任务的 GDPval-AA v2 掉了差不多同样的 80 分,其余几项也有小幅回落。OpenAI 自家的 GDPval 基准这次没有出现在发布材料里。

Humanity's Last Exam 上 Astra 也落在 Claude Fable 5.1 后面。

网安能力踩到 Critical 线

这是这次发布最需要单独拎出来说的部分。

Astra 是第一个在 OpenAI Preparedness Framework 里达到网络安全 Critical 级的模型。这个级别的定义是:在有合适工具和权限的前提下,模型能发现此前未知的安全缺陷,并在很多防护完善的系统上开发出新的利用方式,中间不需要人一步步指导。

OpenAI 的处理方式是切成两个版本。公开发布的那版会拒绝高级网安任务;完整能力先给 Daybreak 项目的企业客户,后续通过 Daybreak Blue 扩大范围。模型也已经按自愿框架提交给美国政府审查。7 月 Hugging Face 那次事件之后,又追加了一层防护。

系统卡里的几个数字:

  • 间接提示注入的防御成功率 99.79%,前代 96.23%
  • 没有确认策略兜底时,agent 的误对齐结果率 3.4%
  • 内部部署模拟里,严重误对齐标记比 Sol 少 53%
  • 编码任务上的欺骗性完成率是 Sol 的四分之一
  • Codex 部署模拟跑了 54,218 个内部任务,Gray Swan 那套用了 1,810 个精选攻击

思维链看不清了

Astra 用了一种叫 recurrent depth 的新推理方式,副作用是思维链被遮蔽。

OpenAI 自己在系统卡里承认了这件事:Astra 比 GPT-5.6 Sol 更能控制自己的 CoT,也更不容易把有问题的信息写进去。原文的措辞是他们"严肃对待"这个趋势,正在继续调查。

AI 安全领域对此的反应是担心可监控性下降。一个能力更强、同时更难被外部读懂在想什么的模型,审计难度是往上走的。这条比任何一项跑分都更值得盯着看。

怎么用上

API 模型名 gpt-6-astra,ChatGPT 的 Plus / Pro / Business / Enterprise 用户陆续开放,Amazon Bedrock 也上了。企业版默认关闭,需要按工作区单独启用。


参考来源