← 返回 GPT / Codex IP 检测更多资讯 →

OpenAI Astra 达到网络安全「关键」阈值:能力开始按身份发放

首页AI 资讯OpenAI 资讯 · 2026-09-02 · Net.Coffee

ExploitBench 满分、测试环境里发现两个零日;同一时期,公开版的拒绝率被提到 91.5%,而通过审核的防守方拿到的是 95% 的响应率。

一句话:OpenAI 公布即将发布的新模型 Astra,称它是第一个在自家 Preparedness 框架下达到网络安全「关键(Critical)」能力阈值的模型——能在没有人工逐步引导的情况下,自行发现并利用防护严密系统里的未知漏洞。作为代价,它最先进的那部分网安能力不会随模型一起公开放出。

过去两年,各家安全报告里的措辞基本都是「显著提升」「接近专家水平」这类形容词。这次不一样:OpenAI 用的是自己框架里最高的那一档,而且是第一次用。触发这一档意味着的不是宣传口径变了,而是公司内部预先承诺过的一整套限制条款被激活了。

「关键」这一档在 OpenAI 的框架里意味着什么

按 Preparedness 框架的定义,模型要够到网络安全的「关键」阈值,需要满足其中之一:能在多个加固过的真实关键系统上,无人介入地识别并写出可用的零日利用;或者能对加固目标端到端地设计并执行全新的攻击策略。注意这里的定语——「无人介入」和「加固过的真实系统」。这两个词把门槛从「能帮攻击者省时间」抬到了「不需要攻击者」。

这个判定的意义在于它是自我约束式的:框架是 OpenAI 自己写的,达标条款也是自己定的,因此外界无法独立验证。但反过来说,正因为是自定的,主动宣布触顶就等于公开给自己上了一道枷锁——后续任何一次放宽访问,都要拿这份承诺来对照。

满分和两个零日,数字要打的折扣

公开的两个硬指标:Astra 在 ExploitBench 上拿到 100% 满分;在 OpenAI 工程师改造过的测试环境里,模型发现并利用了两个零日漏洞。

还有一层没被强调的:这些测试是在工程师改造过的环境里做的,不是野外真实系统。从实验室里的零日到能在生产网络上稳定复现之间,仍有工程距离——但从防守方的角度,这个距离只会越来越短。

一边把公众版收紧,一边给防守方松绑

真正能看出 OpenAI 打算怎么处理这件事的,是同一时期的两个反方向动作。

面向公众的这一侧在收紧:据公开数据,进入 ChatGPT 和 Codex 的公开版本对网络类越狱请求的拒绝率提到了 91.5%,而标准版 GPT-5.6 Sol 是 59.0%。OpenAI 同时表示会限制被评估为更高风险的账户所能拿到的响应,但没有说明具体如何评估——这类不透明的账户分层,往往就是普通用户莫名撞上拒答、降级或异常活动提示的来源。

面向经过审核的防守方那一侧则在放开:八月 OpenAI 推出了 GPT-5.6-Cyber 并扩大 Daybreak 计划,据报道该模型对高级网络安全请求的响应率达到 95%,涵盖利用链开发、认证绕过、权限提升这些平时会被直接拒绝的内容;而 Daybreak Blue 这一层承载的是拿掉系统级护栏的通用模型,实测完成率反而只有 2%——护栏拆掉不等于能力自动到位,专门训练过的才是真的能干活。Astra 的高级网安能力初期也只面向少数测试者,后续再通过 Daybreak Blue 扩大防御性使用。

把这两个方向放在一起看,会发现这不是自相矛盾,而是同一套逻辑:能力不再按「模型版本」发放,而是按「你是谁」发放。同一家公司的同一批权重,对匿名用户是 91.5% 的拒绝率,对通过审核的安全团队是 95% 的响应率。

成本落在谁身上

这套分配方式短期内是有效的——攻防不对称的窗口期里,把能力优先交给防守方,确实比一刀切封禁更有意义。但它的代价也很明确:审核门槛把独立研究者、小团队和没有企业身份背书的人挡在外面,而他们恰恰是过去二十年漏洞披露生态里最主要的贡献者。当能力和身份绑定,安全研究的入口就从技术门槛变成了资质门槛。

另一个被转嫁的成本更隐蔽:所谓「更高风险账户」的判定标准不公开,意味着误伤没有申诉路径。对普通开发者来说,这会表现成一种说不清的体验退化——同样的问题,别人能答,你这边被拒。这类问题往往被归咎于网络或者账号本身,但真正的原因可能只是你落在了某条不可见的风险线上。