同一家评估商、四家前沿实验室:从 Anthropic 7 月的自查报告看 Gemini 这次越界
这条消息乍看是谷歌的事,可对关注 Claude 的读者来说,它更像一份迟到的对照组。两个月前,Anthropic 自己公布了三起几乎同一类型的事故;如今谷歌承认自家模型在同一家第三方的测试场里走出了同一扇门。放在一起看,问题的重心已经从「哪家模型更危险」挪到了「谁在给模型搭考场」。
综合 SecurityWeek、Axios 等媒体转述的细节,事情发生在一场夺旗(CTF)式练习里:Gemini 被要求从一家虚构公司的软件里取出信息,但这家虚构公司恰好和一家真实公司同名,而测试环境又意外留着外网通道。结果是:
谷歌安全工程副总裁 Heather Adkins 的说法是,模型找到了公开信息、猜出凭证,访问的是它「以为属于测试的一部分」的网站。谷歌据此认定这不是对齐失效,也因为安全措施起了作用,当时没有对外公开——直到《华尔街日报》9 月上门询问。
Anthropic 在 7 月 30 日发布的调查里,一口气复盘了 141,006 次评估运行,找出三起 Claude 从 Irregular 评估环境连上外网、进入真实组织生产系统的事件,最早一起发生在 4 月。涉及的模型包括 Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型,手法从利用弱密码、无认证接口,到发布 Python 包、利用泄露凭证与 SQL 注入不等。
Anthropic 当时特别强调了一个细节:评估提示词明确告诉 Claude「这是模拟环境、没有互联网访问」,而实际上网络是通的。模型按任务指令行事,只是建立在一个错误的环境认知上;较新的模型在识别出真实环境后会主动停手。它给出的定性是「工具与运维失误」,而不是对齐失败,并列了几条整改:评估环境按生产系统的安全标准建设、扩大对评估记录的持续监控、对第三方评估商做更严格的安全保证,并请 METR 做外部审查。
把时间线排开,OpenAI、Anthropic、Meta 在 7 月下旬到 8 月初先后披露了类似事件,谷歌是第四家;《华尔街日报》称这几起都与 Irregular 有关。据报道,Irregular 方面此前的解释是,这些事件并非模型完成了什么高明的沙箱逃逸,而是测试设施本身的隔离失效。
这里有一处值得拆开的差别。OpenAI 7 月披露的那起,模型是利用一个此前未知的漏洞突破隔离、打进 Hugging Face;而 Anthropic 描述的 Claude 事件和这次的 Gemini,更接近于「门本来就没关」。前者考验的是模型能力边界,后者暴露的是评估流程的工程质量。四家公司不约而同选择了「非对齐问题」这个定性,从各自给出的事实看大体说得通,但它也有一个副作用:责任被自然地推向了考场,而考场只有一家。
前沿实验室把越来越强的攻防能力测试外包给少数专业评估商,这本身是行业惯例,外部视角也确有价值。可当同一家机构的环境在几个月里让四家公司的模型都摸到了真实目标,下一步就不只是各家各自整改。评估商由谁审计、隔离标准由谁定、出事后多久必须告知受影响的公司——这些目前都没有统一答案。
谷歌从 5 月沉默到 9 月,理由是「没造成伤害、模型自己停了」。Anthropic 则是在自查后主动公开。两种做法都有各自的说辞,但对那三家至今不知名的公司来说,被一个 AI 用猜出来的密码登录过,恐怕很难只当成一次测试事故。