这次把人从审批环里请出去的理由,不是模型变聪明了,是那颗确认按钮本来就没人在看。
把这条消息当成"Anthropic 又放松了一道安全阀"来读,会读错方向。它真正的论据不在分类器有多准,而在另一个数字上:人不准。而且不是一开始就不准,是看着看着就不准了。
官方公布的对照很干脆:在涉及 1,053 名付费测试者的研究中,自动模式的分类器拦截了 89% 的危险命令,人工审批只识别出 13.6%。多家外媒还提到一个更扎心的补充——测试者的警觉性在大约 50 次提示之后掉到了 5% 左右。
这个衰减曲线才是整件事的关键。逐条弹窗确认这套设计,隐含的假设是"每次弹窗都会被认真读一遍"。而它面对的现实是:一个正常的编码会话里,绝大多数工具调用是 ls、读文件、跑测试这种毫无风险的操作。人在连续点了几十次"允许"之后,手指的动作已经先于判断——真正危险的那一条出现时,它和前面四十九条长得没什么两样。安全界给这个现象起过名字叫"审批疲劳",Claude Code 只是把它量化到了小数点后一位。
按官方描述,自动模式不是"不再检查",而是把检查从人换成机器:每一次工具调用和 shell 命令交给一个独立的分类器实时评估,放行安全操作,拦下不可逆的、破坏性的、以及会越出用户环境的动作。三个关键词值得单独拎出来看——
注意这套判据里没有"这条命令对不对"。分类器管的是后果的形状,不是意图的对错——一条写错了但可撤销的命令它会放行,因为撤销的成本你承担得起。这也解释了为什么它能做到 89%:它要识别的不是"错误",而是一类结构上更容易辨认的东西。
换个角度想,这次改动的实质是把风险从"漏点"转成了"漏判"。以前的模型是双闸门——分类器不参与,你是唯一的把关人,代价是疲劳;14 日之后,分类器是主闸门,你的注意力退成兜底。数字上这是笔划算的买卖(89% 对 13.6% 不是同一量级),但它意味着分类器漏掉的那 11% 会更直接地落到你的环境里,因为你已经不在那个位置上盯着了。
对个人开发者来说这大概率是净收益,毕竟原本那 13.6% 的把关质量也谈不上防线。但对在生产环境、共享机器、或者带凭证的目录里跑 Claude Code 的人,值得在 14 日之前先想清楚一件事:你现在依赖的到底是弹窗,还是弹窗背后那份"我会看一眼"的自信。如果是后者,这次更新恰好证明了那份自信不成立。
这轮默认化只覆盖 Pro、Max、Team 计划的新会话。Claude Enterprise、Claude API,以及 AWS 上的 Claude 平台、Amazon Bedrock、Google Cloud 的 Agent Platform、Microsoft Foundry 等渠道暂时仍是可选项,官方称计划在未来一个月内陆续改为默认。
还有个容易被跳过的细节:自动模式带来的分类器额外开销,即日起对上述用户不再收费。这一步很实际——只要审查还在计费,用户就有经济动机把它关掉,那么"默认开启"就只是个摆设。先免费再默认,顺序没搞反。
真要在 14 日之前做点什么,与其纠结开不开,不如把手边的权限配置和目录边界过一遍——Claude Code 的配置项里可调的东西比多数人以为的多,模式换了之后它们的作用只会更重要。