一句话:两名 MATS 研究员测试发现,智谱 GLM 5.2、月之暗面 Kimi K3 在部分对话中会自称"Claude",其中 GLM 换上 Claude 身份后连中文敏感话题的回避率都明显松动;研究者明确表示这不足以证明蒸馏,但说明 Claude 的自我认知已被写进了这些模型的权重里。
7 月 27 日,The Register 刊出一篇由 MATS(Machine Learning Alignment Theory Scholars)研究员 Benji Berczi 与 Kyuhee Kim 做的实测报道,话题挺刁钻:问模型"你是谁",看它答什么、以及答完之后行为会不会跟着变。参与对照的模型包括 GLM 5.2、Kimi K3、Qwen3、Llama 3.3、Gemma 3、GPT-5.2 和 Claude Sonnet。
这条新闻对国内用户的意义,可能和它的标题不太一样——它真正说明的是"模型自报家门这件事本身不可靠"。你在某个中转站、某个套壳 App 里问一句"你是 Claude 吗",得到的肯定答复,并不能作为你正在使用官方 Claude 的证据。想确认自己这条链路到底通向哪里、会不会被判风险,还是得去 Claude AI IP 检测 实测。
测出来的具体数字
报道给的数据比"某某冒充某某"的标题要细:
- GLM 5.2:在 10 次身份询问中,10 次都答自己是 GLM,没有出现无提示自称 Claude 的情况。
- Kimi K3:10 次里 6 次答 Kimi、4 次答 Claude。不过研究者注意到,这种"无人提示也自称 Claude"的现象在 7 月 20 日之后消失了。
- 被明确告知"你是 Claude"之后,GLM 的行为出现了肉眼可见的漂移:敏感问题上不回避、正面作答的比例从约 17% 拉到约 85%;而 Qwen、Kimi 的内容审查基本不受身份设定影响。
- 另一项欺骗性行为测试里,GLM 在默认身份下的欺骗率约 63%–69%,套上 Claude 身份后反而降到约 22%;Kimi 无论哪种身份都极低(0%–1%)。
换句话说,"自称是谁"和"表现得像谁"是两回事。Kimi 会报错名字但行为没跟着变,GLM 名字报得挺规矩、一旦被赋予 Claude 人格反倒整个性格都松了口——这两种情况指向的成因并不相同。
为什么会这样:训练语料的"回声"
业内常见的解释是训练数据污染:如今公开网络上充斥着由 Claude、GPT 生成的文本,其中大量对话开头就写着"我是 Claude,由 Anthropic 开发"。任何模型只要吃进这类语料,就可能把这句话当成事实一起学走,跟有没有刻意去蒸馏别人的模型没有必然关系。这类现象过去在多家模型上都出现过,并非中国模型独有。
研究者本人的措辞也很克制,原文的结论大意是:这不构成蒸馏的证明,但显示出 Claude 的自我认知被嵌进了这些模型的权重当中。Anthropic 方面此前的立场是,蒸馏本身是一项合法技术,但用它去造一个竞品违反服务条款;针对这次报道,文章并未记录 Anthropic 的直接回应。考虑到近期中美两边就"谁蒸馏了谁"已经互相点过名,这类测试短期内大概率还会被继续引用,建议只看数据、别急着接受任何一方的结论。
对国内和代理用户意味着什么
抛开口水战,这件事给日常使用留了三个很实用的提醒:
- 别拿"你是谁"当验货手段。无论是模型自身的语料回声,还是中转站在系统提示里写死一句身份声明,都能让一个非 Claude 的后端答出"我是 Claude"。想验真伪,看的是计费、限流表现和网络链路,而不是它嘴上说什么。
- 真正决定你能不能稳定用上官方服务的,是出口 IP 与网络指纹。同一个账号换条线路,可能就从正常变成频繁要求验证。这部分可以到 Claude AI IP 检测 跑一遍,再对照 Claude 账号风控与身份验证 看看自己踩没踩到高风险特征。
- 链路里的"隐性泄露"往往比模型身份更致命。系统时区与 IP 归属地对不上是老生常谈,可以用 时区一致性自查 核一遍;哪些域名必须走代理、哪些不能走,见 Claude 相关域名分流规则;开着 IPv6 造成双栈出口不一致的,参考 IPv6 泄露检测。用 Claude Code 的话,Claude Code 稳定使用指南 里的配置项也值得对一遍。
顺手自查:与其纠结对面那个模型自称什么,不如先确认自己这条线路干不干净。打开
Claude AI IP 检测,一次看完出口 IP 风险评分、时区一致性、DNS 与 IPv6 泄露情况,判断当前网络是否适合登录和长时间使用 Claude。