ExploitBench 满分、测试环境里发现两个零日;同一时期,公开版的拒绝率被提到 91.5%,而通过审核的防守方拿到的是 95% 的响应率。
过去两年,各家安全报告里的措辞基本都是「显著提升」「接近专家水平」这类形容词。这次不一样:OpenAI 用的是自己框架里最高的那一档,而且是第一次用。触发这一档意味着的不是宣传口径变了,而是公司内部预先承诺过的一整套限制条款被激活了。
按 Preparedness 框架的定义,模型要够到网络安全的「关键」阈值,需要满足其中之一:能在多个加固过的真实关键系统上,无人介入地识别并写出可用的零日利用;或者能对加固目标端到端地设计并执行全新的攻击策略。注意这里的定语——「无人介入」和「加固过的真实系统」。这两个词把门槛从「能帮攻击者省时间」抬到了「不需要攻击者」。
这个判定的意义在于它是自我约束式的:框架是 OpenAI 自己写的,达标条款也是自己定的,因此外界无法独立验证。但反过来说,正因为是自定的,主动宣布触顶就等于公开给自己上了一道枷锁——后续任何一次放宽访问,都要拿这份承诺来对照。
公开的两个硬指标:Astra 在 ExploitBench 上拿到 100% 满分;在 OpenAI 工程师改造过的测试环境里,模型发现并利用了两个零日漏洞。
还有一层没被强调的:这些测试是在工程师改造过的环境里做的,不是野外真实系统。从实验室里的零日到能在生产网络上稳定复现之间,仍有工程距离——但从防守方的角度,这个距离只会越来越短。
真正能看出 OpenAI 打算怎么处理这件事的,是同一时期的两个反方向动作。
面向公众的这一侧在收紧:据公开数据,进入 ChatGPT 和 Codex 的公开版本对网络类越狱请求的拒绝率提到了 91.5%,而标准版 GPT-5.6 Sol 是 59.0%。OpenAI 同时表示会限制被评估为更高风险的账户所能拿到的响应,但没有说明具体如何评估——这类不透明的账户分层,往往就是普通用户莫名撞上拒答、降级或异常活动提示的来源。
面向经过审核的防守方那一侧则在放开:八月 OpenAI 推出了 GPT-5.6-Cyber 并扩大 Daybreak 计划,据报道该模型对高级网络安全请求的响应率达到 95%,涵盖利用链开发、认证绕过、权限提升这些平时会被直接拒绝的内容;而 Daybreak Blue 这一层承载的是拿掉系统级护栏的通用模型,实测完成率反而只有 2%——护栏拆掉不等于能力自动到位,专门训练过的才是真的能干活。Astra 的高级网安能力初期也只面向少数测试者,后续再通过 Daybreak Blue 扩大防御性使用。
把这两个方向放在一起看,会发现这不是自相矛盾,而是同一套逻辑:能力不再按「模型版本」发放,而是按「你是谁」发放。同一家公司的同一批权重,对匿名用户是 91.5% 的拒绝率,对通过审核的安全团队是 95% 的响应率。
这套分配方式短期内是有效的——攻防不对称的窗口期里,把能力优先交给防守方,确实比一刀切封禁更有意义。但它的代价也很明确:审核门槛把独立研究者、小团队和没有企业身份背书的人挡在外面,而他们恰恰是过去二十年漏洞披露生态里最主要的贡献者。当能力和身份绑定,安全研究的入口就从技术门槛变成了资质门槛。
另一个被转嫁的成本更隐蔽:所谓「更高风险账户」的判定标准不公开,意味着误伤没有申诉路径。对普通开发者来说,这会表现成一种说不清的体验退化——同样的问题,别人能答,你这边被拒。这类问题往往被归咎于网络或者账号本身,但真正的原因可能只是你落在了某条不可见的风险线上。