一份不具法律约束力的意见书,把训练数据之争从私人纠纷抬到了产业政策的高度。
合理使用(fair use)在美国版权法里是一套四要素的权衡,其中最常被援引的是"使用目的的转换性":如果新用途与原作品的市场功能足够不同,就更可能被认定为合理。政府这份意见书正是从这里切入的,把生成式 AI 的训练过程描述为高度转换性的使用。
更值得注意的是它没有停在法条层面。据外媒引述,意见书把这个问题与科学进步、国家安全和美国的经济竞争力挂钩,并写下这样一句:美国有强烈利益,希望法院拒绝任何认为"用受版权保护的文本训练大语言模型即构成侵权"的主张。
把版权案的技术性争点接到国家竞争力上,是一个相当强的框架选择。它等于告诉法院:这不只是两个私人主体的纠纷,判决结果会外溢到产业格局。这种论证方式在反垄断和出口管制案件里常见,用在版权案上则相对少。
过去两年,作者、出版商、唱片公司和新闻机构对 AI 公司提起的诉讼已经积成一大摞,法院之间的判法并不统一,业界一直在等一个能收敛分歧的信号。联邦政府此前始终没有正式下场。
所以这份意见书的信息量不在于它的具体论证——那些论点 AI 公司的律师已经写过很多遍了——而在于表态本身。它意味着行政部门在这一轮"AI 训练数据是否侵权"的争夺里,明确站到了模型厂商这一侧,并愿意用政府信誉为这个立场背书。
需要立刻补一句限定:意见书不裁决案件、不约束法官,也没有宣布所有涉及版权素材的训练行为都合法。它是一份法庭之友性质的意见,法官可以完整采纳,也可以只字不提。这一点在多家报道里都被特意点明,不宜过度解读。
《纽约时报》的回应没有纠缠法律技术细节,而是直接质疑立场:政府站在了"少数万亿美元级 AI 公司"一边,代价由创作者承担。
这个反击角度选得很实际。合理使用的四要素里有一条是"对原作品潜在市场的影响",而新闻机构主张的恰恰是:模型学完之后直接向用户输出答案,读者不再点进原文,广告与订阅收入随之流失。这不是抽象的权利受损,而是可以量化的市场替代。政府意见书强调训练环节的转换性,绕开的正是输出环节的市场替代问题——两方其实在谈同一条链上的不同环节。
该报 2023 年起诉 OpenAI 与微软,指其未经许可使用数百万篇文章训练 ChatGPT,是这一波新闻业维权诉讼里最受关注的一起。案子拖到今天仍未有终局判决,本身就说明这个问题在现行法框架下有多难切割。
务实地看,这份意见书最可能产生的影响有两层。
反过来,风险也在同一处。把训练问题绑上国家安全叙事,短期内是有效的说服工具,长期却容易让版权规则的讨论变成产业政策的附庸。真正需要被回答的问题——训练用数据要不要付费、按什么标准付、由谁来核算——并没有因为这份意见书而向前推进一步,只是被暂时压后了。
对每天在用这些工具的人来说,眼下不会有任何可感知的变化:模型照常提供,价格照常波动。但这类案子的走向,最终会决定未来的模型能拿哪些数据来训练,也就决定了它们在专业领域里能有多深。现在只是把这个问题的答案,又往后推了一程。