← 返回 Claude AI IP 检测更多资讯 →

OpenAI 为 Astra 的网络能力踩下刹车,Anthropic 四个月前就这么做过

Claude 资讯 · 2026-08-20 · Net.Coffee

同一个理由被两家头部公司先后用来自我限制:模型在网络攻防上的能力过了线。门槛怎么定、谁来核验,仍然只有厂商自述。

一句话:OpenAI 8 月 18 日称即将推出的 Astra 可能触到「关键网络安全能力」门槛,已对拟部署的最新模型暂停两周强化学习训练;而最早用这套理由把模型关起来的,是四个月前的 Anthropic。

OpenAI 那篇公告的标题直译过来是「为网络能力放缓模型研发节奏」。措辞是标准的安全公告口吻,落到动作上却相当具体:对拟部署的最新模型暂停两周强化学习训练,规模最大的那批前沿 RL 运行也仍处于暂停状态,同时上线一套多阶段自动化调查流程,目标是异常出现后 30 分钟内报警。一家公司主动说自己被自己拖慢了,这种公告本身不多见。

「过线」这套说法,Anthropic 先用过一次

消息在中文圈的转述开头是「继 Anthropic 后」,这四个字是重点。4 月 7 日 Anthropic 公布 Project Glasswing 与 Claude Mythos Preview 时给出的理由,与 OpenAI 现在这套几乎同构:模型在发现和利用软件漏洞上的能力已经超过除顶尖人类安全专家之外的所有人,因此这个模型不公开发布,只通过 Glasswing 向维护关键基础设施的伙伴开放,用途限定在防御一侧。创始伙伴名单里有 AWS、苹果、博通、思科、CrowdStrike、谷歌、摩根大通、Linux 基金会、微软、英伟达、Palo Alto Networks 等十余家。据多家报道,Mythos 在公布前数周自主找出的高危零日覆盖了主流操作系统与浏览器,数量以千计。

差别在于 Anthropic 这个判断挂在制度上:它的 Responsible Scaling Policy 规定能力过了某条线,防护等级就得往上抬一级,ASL-3 的防护已经启用,而 ASL-4 具体要求什么至今没有写完——按 Anthropic 自己的说法,其中一些验证手段(比如用可解释性从机制上证明模型不会做出灾难性行为)还是没解决的研究问题。所以「过线」在 Anthropic 那里至少有个外壳,虽然这个外壳是它自己写的。

暂停两周的强化学习,停的是哪一段

OpenAI 停的不是发布,是训练里最靠后的那一段。预训练把知识铺好之后,能力跃升最快的通常是强化学习阶段,尤其是长链条工具调用、自主执行这类行为——正好也是网络攻防能力最依赖的部分。选择在这里刹车而不是等成品出来再评估,意味着它想在能力定形之前先把测量做完。公告里给出的几项动作:

这四条里,前三条是姿态,最后一条是账单。

五分之一的算力用来看着自己

在推理成本已经是主要开支项的今天,把 20% 的算力划给监控不是小数目。更值得注意的是它的方向:安全投入正在从「发布前评估」挪向「运行时监控」。前者是一次性成本,做完就过去了;后者是持续摊在每一次调用上的成本,而持续成本最终总会以某种形式出现在限流阈值、分类器拦截和账号风控里。

对使用者来说,这才是「能力门槛」这种听起来很远的词落地的地方。没有人会收到一封通知说模型的安全等级动了,能感知到的只是某类请求突然开始被拒、或者某个账号莫名进入受限状态——而这类现象和自己网络环境导致的风控几乎长得一模一样,怎么区分我们在账号风控与 Unusual Activity 的排查里单独写过。

门槛握在谁手上

两家公司先后用同一个理由自我限制,读起来像行业自律正在成形,但有个缺口一直没补:门槛本身没有公开可核验的定义。「关键网络安全能力」是厂商自述,评估集是厂商自建,结论由厂商自己宣布。外界能拿到的只有一句「我们判断它过线了」,或者反过来「我们判断它还没过线」——这两句话的商业含义完全相反,可信度却完全一样,都只取决于自我披露的诚实程度。在没有第三方评估机构的情况下,这种自律的下限取决于竞争压力,而不是规则。

短期内更实际的变化是节奏。如果两家头部公司都开始为这类评估留出两周量级的缓冲,模型发布的间隔会变长,手上这个版本会被用得更久。对靠它干活的人来说这未必是坏事,稳定版本比频繁跳版好用;代价是遇到卡顿、报错、莫名限流时,更难把问题推给「新版本还没稳」,只能先把自己这一侧排干净——出口 IP 和账号状态是最先要看的两项,Claude 可用性与 IP 检测会直接给出当前出口的判定结果。