← 返回 Claude AI IP 检测更多资讯 →

Anthropic 松绑 Fable 5 生物学防护:误拦截减少约 85%

Claude 资讯 · 2026-08-07 · Net.Coffee

重写了分类器的规则集,而不是调阈值。代价是病毒学、毒理学、分子设计照旧过不去。

一句话:Anthropic 于 8 月 7 日更新了 Claude Fable 5 的生物学安全分类器,官方测试中生物学相关的"回退"减少约 85%,看化验单、问症状、学生物这类日常提问不会再被悄悄甩给能力更弱的模型;但病毒学、毒理学、分子设计仍然一律回退。

Fable 5 从发布起就带着一套故意放得极宽的生物学分类器。宽的意思是宁可错拦一千:只要提问沾上生物、医学、化学的边,就有相当概率被判定为"需要防护"。这两个月社区里那些"Fable 突然变笨了""同一个问题昨天答得好好的今天开始装傻"的抱怨,有一部分并不是模型能力退化,而是这套分类器在背后改了路由。

被"降级"的时候,模型那边发生了什么

这里的机制值得说清楚,因为它和常见的"拒答"完全不是一回事。分类器判定一条请求需要防护时,Fable 5 不会给你一句"抱歉我不能回答",而是把这次请求转交给 Opus 5 来处理——按 Anthropic 的原话,Opus 5 是一个能力很强、但不具备同等生物学能力的模型。

用户端因此看不到任何报错,只看到答案突然浅了一层、语气也换了个人。这是最难自查的一类退化:没有提示、没有日志、没有开关,你甚至不确定是自己提问方式变了,还是对面换了个模型。这也是这次更新真正的价值所在——它修的不只是"拦得太多",还有"拦了你也不知道"。

改的是规则本身,不是灵敏度旋钮

Anthropic 说这次做了三件事:重写分类器的"宪章"(constitution,也就是那套判定规则的集合),就改动向一批内外部专家征求意见,再据此生成新的训练数据把分类器重新训练一遍。

这个做法和单纯调阈值有本质区别。调阈值只是把整条判定曲线整体平移,误拦少了,漏放必然同步变多,属于零和;重写规则集则是在良性用途上单独凿口子——把"解读化验结果""理解症状""学习生物学基础"这类场景从防护范围里明确划出去,理论上可以在不放松真正危险请求的前提下把误伤降下来。当然,规则写得对不对,最终还是要靠实际使用来检验。

85% 之外,还有一组更耐人寻味的数字

官方给的不只是那个 85%,还有各产品面上总回退次数的预计降幅:

把这组数字和 85% 放在一起看,能推出一件官方没有明说的事:生物学触发的回退被砍掉了八成半,而 Claude Code 的总回退只少了一成七、API 只少了 7%,这说明在这两个场景里,绝大多数回退根本就不是生物学分类器干的。写代码的人如果最近还在被莫名其妙地降级,这次更新大概率帮不上什么忙——问题出在别的防护上。

反过来,Claude.ai 上 67% 的降幅说明,普通聊天场景里的回退确实有三分之二压在生物学这一条线上。日常用网页版的人会是这次改动最直接的受益者。

仍然过不去的三个词

Anthropic 明确保留了双重用途领域的防护:病毒学、毒理学、分子设计相关的请求,Fable 5 依旧会回退到 Opus 5。也就是说,真正做这些方向研究的人,处境和更新前没有区别——被误伤最狠的恰恰是最需要模型能力的那批用户,这次并没有被照顾到。

公司给出的方向是"可信访问通道"(trusted access pathways),意思是让通过审核的研究者用上最强模型,同时不给滥用留口子。目前这还只是一句承诺,既没有时间表,也没有说明审核门槛和适用范围。在通道落地之前,专业生物研究场景下的 Fable 5,实际能力上限仍然由分类器而不是模型本身决定。

最后有个容易混淆的地方值得提一句:模型突然"变笨"和账号被风控是两条完全不同的路径。前者不报错、只是背后换了模型;后者通常会给出明确的错误、验证要求或者登录异常。真遇到后一种情况,先用 Claude AI IP 检测 看一眼出口 IP 那边有没有问题,再去怀疑模型是不是又被拦了。