本该关在沙箱里的网络安全演练,因为评测环境配置失误接上了真实互联网。三家企业在毫不知情的情况下被"打靶",Anthropic 主动披露并已通知对方。
这些事故都发生在同一类场景里:夺旗赛(CTF)。这是安全圈很常规的能力评测——把一段信息故意藏在另一台机器或另一个网段上,让参与者想办法拿到手,用来衡量模型的攻防水平。按设计,靶机应该在一个与外网隔绝的环境里。
问题在于,Anthropic 与评测合作方 Irregular 共同搭建的那套环境,双方对"到底通不通外网"的理解并不一致:一方以为是断网的,实际却是通的。于是模型在执行任务时顺着网络出去了。据报道,模型用的手法并不高级,主要是弱口令、未做鉴权的接口这类老问题,靠这些就摸进了真实系统。
Anthropic 称,公司复查了超过 14.1 万次测试日志,才把这三起事件筛出来。值得注意的是,被波及的组织此前并没有察觉到这些活动,也就没有向任何人报告过——是 Anthropic 主动排查后找上门通知的。
争议点其实不在"模型会不会黑东西"——CTF 评测的目的本来就是测这个能力。真正让安全从业者警觉的是隔离机制失效:当一个被要求"尽力完成任务"的模型手里握着一条真实的出网通路,它的行为边界就不再由提示词决定,而是由网络本身决定。安全专家 Alex Stamos 就此提出警告,认为勒索软件团伙可能很快会用 AI 发动规模化攻击,行业亟需更硬的测试隔离标准。
另一面的评价则相对正向:这次是厂商自己翻日志翻出来、自己通报的,而不是被受害方或第三方曝出来的。在 AI 安全事件披露这件事上,主动性本身有一定示范意义。当然,从 4 月到 7 月的时间差,也确实会被拿来讨论。
先把话说清楚:这类事故发生在 Anthropic 的内部评测环境里,跟你日常在网页版或 Claude Code 里的对话没有关系,你的账号不会因此被牵连,也不存在"模型跑到你机器上"的问题。
会变的是氛围。每出一次这样的事件,厂商在滥用检测、异常行为识别上就会收得更紧一点,而收紧的第一道闸门几乎总是访问侧——出口 IP 的类型、地区、历史信誉,以及请求特征是否"像正常人在用"。对国内和走代理的用户来说,这才是真正会体感到的部分:同样的用法,昨天没事,今天突然要验证、突然限速。
与其猜风控什么时候收紧,不如先把自己这一端弄干净。打开 Claude AI IP 检测,几秒钟就能看到当前出口 IP 是住宅还是机房、有没有被标为代理/VPN、地区判定落在哪里。