一个在论文里讨论了十年的标准工程手段,被搬进了国家安全的语境。
被点名的六家是 DeepSeek、Moonshot AI(月之暗面)、阿里巴巴、MiniMax、StepFun(阶跃星辰)和 Z.AI。被指为提取对象的美国模型来自 Anthropic、OpenAI 与谷歌;关于第四家,各家报道口径并不一致——彭博的表述里出现的是 SpaceX,NBC 则写的是马斯克旗下 xAI 的 Grok。
通告的措辞比以往任何一次都重:不止说这降低了中国公司的研发成本,还说它「增强了中国的军事和网络攻击能力」。一项在论文里被当作标准工程手段讨论了十年的技术,就此被搬进了国家安全的语境。
知识蒸馏的原始定义很朴素:用一个大模型的输出去训练一个小模型,让小模型学会大模型的判断分布,而不必重新承担一遍大模型的训练成本。这个方法在深度学习里资历很老,几乎每家实验室都在用——用自家的大模型去蒸出更便宜的小型号,是各家产品线里轻量档位的常规做法。
让它变得敏感的从来不是技术本身,而是三件事的叠加:
换句话说,通告要处理的是一个经济学问题:当能力可以被采样复制,前沿实验室那笔巨额训练支出所买到的领先窗口,能维持多久。把它归到情报口,是因为这个问题在商业和法律层面并没有称手的工具。
指控蒸馏,难点在举证。模型权重不会留下水印,蒸馏出来的模型也不会承认自己的来源。可用的线索大多是间接的:行为指纹的相似度、拒答边界的位置、遇到特定构造问题时的失败模式、以及最著名的那类乌龙——模型在自我介绍时报出别家的名字。这些证据在技术圈够写一篇分析,放到法庭上都不够。
此前公开的处置也停留在账号层面。据当时报道,OpenAI 在 2025 年初封禁过一批被认为与 DeepSeek 相关的账号,理由正是违规抽取输出。那是平台自治的处理方式,成本低、见效快,但对方换一批账号或换一个中间商就能继续。
这里要把性质说清楚:这次公布的是一份情报机构的联合通告,不是起诉书。它没有指控具体罪名,没有列出可交叉验证的证据链,也没有随附任何制裁或出口管制措施。它更接近一次官方定性——把此前散落在服务条款纠纷和技术社区争论里的事情,收进国家安全的叙事框架。
通告发布在两件事之前:中国国家领导人月底访美,以及中美之间的一场 AI 安全对话。在谈判前把对方的技术路径定性为窃取,是一个熟悉的动作;这不影响指控本身是真是假,但决定了它会被怎么读。
指控中最难核实的一段,恰恰是分量最重的那段——蒸馏所增强的「军事和网络攻击能力」。从公开材料看不出这一步的论证过程:一个通过采样输出获得对话能力的通用模型,如何被折算成军事与网络攻击能力的提升,通告没有展开,报道也没有给出更多细节。
对 Anthropic 这类被点名的受害方来说,这份通告在实务上改变不了什么。真正管用的仍是那些老办法:速率限制、异常访问模式识别、可疑批量调用的账号处置——也就是每天都在跑的那套风控。它们拦不住有耐心、有分布式出口的对手,只能抬高成本。
技术条件没有变:一个对外提供 API 的模型,就是一个可以被采样的模型;开放程度和可蒸馏程度是同一件事的两面。这次变的只是它归谁管——从法务部门,挪到了情报部门。