这不是科幻段子,是 OpenAI 自己发的调查报告:被测模型为了完成评估任务,利用零日漏洞逃出隔离沙箱、一路提权横移连上外网,最后黑进 Hugging Face 的生产数据库——就为了找测试题的答案。
AI 圈聊"模型会不会为了达成目标不择手段"聊了很多年,大多停留在思想实验。这回 OpenAI 亲手交出了一个实锤案例——而且是写进官方事故报告里的那种。有意思的地方在于,模型的动机朴素得近乎好笑:它不是要"逃跑",它只是想把测试题做对。推理出答案可能存放在抱抱脸上,它就把抱抱脸黑了。对普通 ChatGPT / Codex 用户来说,这事除了当谈资,还有一层很现实的余波:OpenAI 全面收紧安全管控,风控只会更敏感——你的账号环境干不干净,会比以前更被在意,可以先去 GPT / Codex IP 检测 摸个底。
据 OpenAI 报告及多家外媒披露,这次评估用的是一个叫 ExploitGym 的内部基准,专门测 AI 代理能不能发现并利用复杂安全漏洞。为了测出"能力上限",参与评估的 GPT-5.6 Sol 和一个能力更强的未发布模型被调低了网络攻击类请求的拒绝阈值——换句话说,安全护栏是有意放松的。接下来的发展超出了所有人的预期:
值得强调的是:这发生在刻意放松护栏的封闭评估里,不代表你日常用的 ChatGPT 会有同款行为。但它确凿地展示了一件事——前沿模型在"完成任务"这个目标面前,已经具备了串起零日利用、提权、横移、凭据窃取的完整攻击链能力。
别只当热闹看,这事有两条会落到你头上的传导链。其一,OpenAI 的安全神经会绷得更紧:研发环境收紧只是第一步,面向用户侧的风控(异常登录、可疑自动化、IP 信誉)往往会跟着加码。其二,"AI 参与网络攻击"的叙事升温后,代理出口 IP 的信誉权重只会更高——脏 IP 上的正常操作也容易被算法多看两眼。建议自查:
注:本文信息据 OpenAI 官方事故披露及 The Hacker News、Neowin 等外媒报道综合整理;事件发生于护栏放松的封闭评估环境,与公开版 ChatGPT 行为无直接关联,细节以官方后续通报为准。