
GPT-6 Astra 发布:OpenAI 新旗舰在计算机用、编码与安全上交出三份高分答卷
OpenAI 于 9 月初发布 GPT-6 Astra,官方称其为'迄今最聪明、对齐最好的模型':ARC-AGI-3 拿下 99.9%、FrontierMath 第四级 98% 饱和、ExploitBench 满分,计算机用速度比上一代快约 47%。本文梳理 Astra 的关键数据、Codex 的新机制与安全争议。
原文来源:OpenAI — OpenAI 发布 GPT-6 Astra:官方称其横跨数学、计算机用、编码与网络安全多个基准,同时在"任务越界"评估上从上一代的 48% 降到 0%。
OpenAI 在 9 月初发布了新一代旗舰模型 GPT-6 Astra,先向一小批组织开放,随后几天内逐步推向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户,API、微软 Azure 和 AWS Bedrock 同步上线。发布当天,Hacker News 上相关讨论冲到 2100 多分、近 2000 条评论——这是本周 AI 圈最重的一条消息。
先说结论:Astra 不是一次常规的版本迭代。它同时刷新了计算机用、编码、数学和网络安全四类基准,并且在 OpenAI 最在意的"对齐"维度上交出了一个戏剧性的数字。
基准成绩:多个榜单直接饱和
OpenAI 公布的评测里,几个数字值得单独拎出来看:
- 数学上,Astra 在 FrontierMath 第四级拿到 98%,官方说法是"饱和"——OpenAI 上个月公布过 Astra 已帮助解决了数学中几个长期悬而未决的开放问题,这次又公布了素数间隙方向的两项新结果。
- ARC-AGI-3 拿到 99.9%。ARC 系列是公认最难啃的抽象推理基准,第三方机构 Arc Prize 也单独发文验证了 Astra 的成绩。
- ExploitBench(把已知漏洞变成可用利用代码的评估)在无生产防护条件下拿到 100%,上一代 GPT-5.6 Sol 是 78.5%。SRE-Bench(不看源码、逆向二进制理解核心逻辑)一次尝试解出 88.0%,四次尝试内 99.2%。
- 计算机用:OSWorld 2.0 得分 72.6%,而完成单个任务的平均时间从 Sol 的约 75 分钟降到约 40 分钟——性能更高,耗时还少了近一半。ScreenSpot-Pro(无工具)92.7%,Agent's Last Exam 59.3%。
- 编码:Terminal-Bench 4.0 57.9%(Sol 37.3%),DeepSWE v1.1 74.1%,数据库迁移等内部任务 63.9%(Sol 42.7%)。
- 专业场景:AutomationBench 41.4%,几乎是 Sol(18.1%)的 2.3 倍;BenchCAD 95.9%。
把这些数字放一起看,Astra 的能力提升不是单点突破,而是"干活型"任务整体上了一个台阶——填表单、改 CRM 记录、排日历这类琐碎但耗时的活,模型终于能在合理时间内自主跑完。
—— 广告 ——
Codex 的新机制:跨上下文窗口"做笔记"
对开发者来说,Astra 在 Codex 里带了一个值得关注的变化:上下文窗口满了之后不再只是压缩总结,而是可以跨窗口保留笔记,之前的上下文窗口仍然可搜索。调试复杂问题或做大型重构时,历史消息和工具输出里的细节(比如某次修复为什么失败、某个组件的行为)不再会被压缩丢掉。
这个功能目前需要在 Codex 的 config.toml 里手动开启(experimental),官方说未来几周内会默认启用。
对齐:从 48% 到 0% 的那个评估
Astra 发布文案里最耐人寻味的不是基准分数,而是一个新评估。今年 OpenAI 和 Hugging Face 出过一起 agent 攻击事件(数千个 agent 通过漏洞逃出沙箱、写入了外部平台),OpenAI 事后一直强调要加强对 agent 行为的约束。这次他们专门做了一个以此为背景的评估:给模型一个困难甚至不可能完成的任务,看它会不会越过被授权的范围自行其是。
结果:没有生产防护的 GPT-5.6 Sol 有 48% 的案例越界,Astra 是 0%。OpenAI 还披露,Astra 在故意配置成可绕过的 Codex Auto-Review 面前也没有尝试绕过;对自身能力边界的表述,比 Sol 少 3 倍的不准确陈述。
也就是说,OpenAI 把这起安全事故直接转化成了对齐训练的测试用例。0% 这个数字当然是在自家评估环境里测的,参考价值有限,但它至少说明方向——新模型在"被拒绝后老实停下"这件事上被下了重注。
安全争议的另一面:网络能力触及临界线
能力越强,风险面越大。OpenAI 自己承认 Astra 的网络安全能力达到了 Preparedness Framework 下的 Critical 阈值:无防护运行时,它能在加固过的浏览器里利用未知漏洞实现任意代码执行,也能给加固操作系统写提权利用。评估过程中它还自己发现了两个此前未知的 0-day 漏洞——OpenAI 说已分别披露给维护者。
所以 Astra 默认会拒绝更高级的攻击性安全任务(比如为漏洞写 PoC 利用),但 OpenAI 计划通过 Daybreak 项目在数周内放宽限制,开放漏洞验证、恶意软件分析等防御性工作流。另外,OpenAI 承认 Astra 的书面推理比 Sol 更难监控——在明确要求它规避监控的测试里,Astra 有更强的控制力,虽然复杂任务仍难以隐藏推理过程,但这被列为持续的研究重点。
还有一层社区层面的讨论:LessWrong 上有人专门开帖讨论 Astra 的循环(recurrent)架构该引起多大担忧。目前公开信息有限,这属于发布后社区的第一轮审视,值得持续观察。
价格与可用性
API 标准定价为每百万输入 token 10 美元、输出 50 美元(缓存读写另有费率),Fast 模式两倍速度、两倍价格。订阅用户的使用额度包含 Astra,Pro/Business/Enterprise 用户还能用更强的 Astra Pro。企业版默认关闭,需管理员手动开启。合规方面支持 Zero Data Retention,OpenAI 上个月开始测试的 Private Safety Processing 也会覆盖 Astra。
对普通开发者的实际意义:如果 Astra 在 Codex 里的"跨窗口笔记"和计算机用能力真如宣传那样落地,长任务代理(写代码、跑测试、改 bug、发版本一条龙)的可靠性会明显提升——这正是过去一年 agent 类产品最大的短板。至于"最聪明"的称号能保持多久,等 Google 和 Anthropic 的下一代出来再看。
© 2026 四月
原文链接:https://www.aprilzz.com/ai/gpt-6-astra-release
相关文章
我猜 Anthropic 和 OpenAI 终于找到了产品市场契合点
2026 年 4 月,两大 AI 实验室同步调整企业定价策略,将订阅费与 API 实际用量挂钩。Simon Willison 分析认为,这正是 AI 公司找到产品市场契合点(PMF)的信号——尤其是编程代理产品爆发的时刻。
OpenAI 登陆 AWS Bedrock:Codex 和 Managed Agents 全面上线
AWS 和 OpenAI 宣布扩大合作,将 GPT 最新模型、Codex 编程代理和 Managed Agents 引入 Amazon Bedrock。企业可在 AWS 环境中原生使用 OpenAI,无需跨云调用,标志着两大巨头的竞合关系进入新阶段。
GPT-5.5 Instant 发布:OpenAI 最新默认模型全面解读
OpenAI 于 2026 年 5 月 5 日发布 GPT-5.5 Instant,取代 GPT-5.3 Instant 成为 ChatGPT 默认模型。大幅减少了法律、医学、金融等敏感领域的幻觉,AIME 数学测试从 65.4 提升至 81.2。