欧盟 ChatGPT 与 Codex 输出将带机器可识别水印,API 可选开启,检测器不对公众开放
欧盟 AI 法案第 50 条的透明度义务已于今年 8 月 2 日生效,要求生成式 AI 提供方让输出的内容能以机器可读的方式被识别为 AI 生成。图片和音视频有 C2PA 元数据这类现成方案,文字却没有地方「贴标签」——复制粘贴一次,任何附加信息都会丢失。所以对文本来说,可行的路径基本只剩一种:把信号藏进用词本身。
OpenAI 这次采用的是分阶段方案:先覆盖欧盟的 ChatGPT 与 Codex,再通过 API 选项把能力开放给全球开发者。它在公告中把文本水印和检测称为「仍有显著局限的早期技术」,这种措辞在一份合规公告里并不多见。
OpenAI 给这套方法起名 TextGrain。据公开的技术说明,它在模型挑选下一个词时注入一个人眼看不出的统计偏好,借助 Gumbel 随机变量与带 KL 正则的最优传输求解,同时用「熵预算」限制平均采样损失,尽量不让文风和质量因为水印而走样。检测端则扫描一段文字里这种统计偏好是否显著存在。
官方给出的检测效果(误报率控制在 1% 时):
数学弱并不奇怪:公式和推导留给模型「换个说法」的余地很小,可供藏信号的选择空间自然也小。同理,代码输出的可变空间同样有限,Codex 产出的文本里水印能有多强,公告没有单独给出数字。
最值得看的是 OpenAI 自己公布的鲁棒性测试:把 10% 的词替换成同义词,检出率从约 92% 降到 66%;替换 25%,只剩 17%。也就是说,一个稍微勤快点的人,或者另一个模型做一轮改写,就足以让水印几乎失效。
OpenAI 对此并不回避,还专门列了水印「不能说明什么」:它不衡量人类参与了多少,不确定内容归属,不识别具体用户,不验证内容真假;而检测不到水印,也不能证明文字出自人手。这几条否定句等于提前给可能的滥用划了线——尤其是学校和雇主把「测出水印」当成作弊铁证的冲动。
检测器目前按欧盟透明度行为准则逐案审批,只给研究人员和专业机构用。不公开的理由不难推测:一旦任何人都能反复调用检测器,绕过水印就变成了「改一句、测一次」的简单循环,鲁棒性本就有限的信号会更快被摸透。代价是,普通读者和教师手里依然没有工具,水印的识别权集中在少数机构手中。
至于效果,一个只覆盖欧盟、API 默认关闭、改写四分之一就测不出的机制,与其说是在识别 AI 文本,不如说是在为法规要求的「机器可识别」交出一份最低限度的技术答卷。真正的考验在于,其他模型厂商是否会跟进同类方案——如果只有一家打水印,用户换个工具就绕开了。