近日,OpenAI宣布即将推出的新一代AI模型 Astra,已达到其《准备框架》里定义的“重大(Critical)”网络安全能力门槛。这也是OpenAI首次让某个模型被评定到该最高风险等级。换句话说,Astra不仅能理解安全问题,还表现出能把攻击流程从“发现”走到“执行”的能力,而且是以高度自主的方式完成。
根据OpenAI的规则,模型只要满足两类能力中的任意一项,就会被判定触及重大门槛:其一是模型能够自行找出零时差漏洞,并且可通过编程发动攻击;其二则是给定一个更高层级的目标后,模型会主动规划并完成一整套网络攻击策略。Astra此次之所以“上榜”,正是因为它在多项评估中显示出明显超越前代模型的表现。
在评测ExploitBench这一针对AI攻防能力的基准中,Astra拿到了满分100%。同时,为了排除数据污染,OpenAI还自建了名为“ExploitBench – Internal Port (June–August 2026)”的内部测试基准,并额外加入了今年中才披露的20个高风险V8漏洞。结果显示,Astra在使用更少计算资源的情况下,依然实现了远高于GPT-5.6 Sol的任意代码执行成功率。
更引人关注的是,Astra还能自主发现并串联利用两个零时差漏洞:OpenAI正准备将相关漏洞通报给维护方。在专家主导的测试里,Astra被仅给予“高层目标”,它便自行规划攻击路径,先完成浏览器沙箱逃逸,再把多个漏洞组合起来实现权限扩充——从普通用户迅速提升到系统最高权限。整个链条涵盖漏洞发现、策略规划与实际落地执行,呈现出“从漏洞到完整攻击链”的全流程能力。
不过,OpenAI强调Astra的最先进网络安全功能将受到严格限制,并不会全面开放。其计划是在推出后,先开放给少数测试者,随后通过Daybreak Blue项目逐步扩展到防御性用途,但具体会放开哪些能力,官方尚未给出细节。对安全从业者而言,这意味着新一轮“攻防能力差距”的讨论正在逼近现实。