30 天预发布访问、"可信伙伴"名单、机密的能力基准——一份判断模型是否危险的规则,本身不对外公开
一份用来判断"哪些模型危险到需要政府先看一眼"的规则,做完了却不给外界看。这大概是这条消息最反常的地方:通常政府定完标准会急着宣传,这次是宣布完成、然后闭嘴。
据 Axios、CNBC 等媒体报道,白宫官员确认框架已在截止日前交付,正与"远不止 Anthropic、OpenAI 和谷歌"的众多业界伙伴讨论后续步骤,这三家实验室在截止日前已就草案提交过反馈。周二白宫还将开一场职员级会议,请这些公司当面审阅。
但被追问细节时,白宫拒绝披露文件本身、测试指标,以及企业实际启用的时间表。换句话说,公众现在知道的只有"它存在"这一件事。
从行政令和目前流出的描述看,这套机制大致长这样:
值得注意的是评估的落点:这一轮政府最关心的不是模型会不会说错话、有没有偏见,而是它的网络攻防能力。这和过去两年 AI 安全讨论的重心明显不同,说明监管方真正紧张的,是模型能不能被用来写漏洞利用、自动化入侵这类具体的事。
把测试题列为机密,听上去像是刻意回避监督,但它至少有一个说得通的技术理由:一旦门槛公开,"刚好压在线下"就成了一个可优化的目标。模型开发方完全可以针对已知基准做规避性调整,让模型在测试里表现得没那么危险,从而绕开这 30 天的审查。这在业内不是假设——公开基准被针对性优化,早已是常态。
代价则是外部无法验证。基准保密、名单保密、时间表保密,结果就是没有人能从外面判断这套机制是严是松、是否真的被执行过。政府拿到了信息优势,公众拿到的是一句"我们做完了"。
"自愿"两个字通常意味着约束力有限,但放在这件事上要分两层看。对 OpenAI、谷歌、Anthropic 这类既想拿政府订单、又长期主张"需要监管"的公司来说,不参加的政治成本比参加高得多,实际上很难拒绝。真正会漏在框架外的是另外两类:一类是不在这张名单上的中小实验室,另一类是根本不受美国管辖的海外团队——而后者恰恰是这一轮政策焦虑的真正源头。
所以这份框架能起到多大作用,短期内没法评估,因为评估它所需要的一切材料都被封起来了。能看见的只有一个动作:政府已经把手伸到了模型发布之前那 30 天,而这条线一旦划下,后面通常只会往前挪,不会往后退。