← 返回 Claude AI IP 检测

亚马逊被曝拆书扫描训练 AI,追踪器一路指向拉斯维加斯仓库

Claude 资讯 · 2026-08-21 · Net.Coffee

毁书看着野蛮,却是这轮判决之后最「合规」的那条取数路径

一句话:404 Media 把一枚追踪器塞进一本稀有书,最后追到亚马逊在拉斯维加斯的仓库;仓库员工称他们的活就是剪掉书脊、高速扫描,纸质书随后销毁。这条路 Anthropic 已经走过一遍,而且走通了。

消息本身并不长,但它补上的是一块此前只在诉讼文件里出现过的现实画面:AI 训练数据不只是从网上爬,也从二手书市场成批买进来,拆开,扫完,扔掉。

追踪器最后停在拉斯维加斯

据 404 Media 的调查,记者与一位匿名书商配合,把一枚苹果 AirTag 放进一本稀有书里,这本书随一批约一千册的书发出,最终定位显示落在亚马逊位于拉斯维加斯的 LAS8 仓库,其中一片区域另有代号 VGT3,入口处的标志是一只抱着书的霸王龙。

该处员工向 404 Media 描述的流程很直接:收到印刷书后剪掉装订以便快速扫描,书页扫完即销毁。亚马逊方面回应称,公司通过商业渠道购买图书,用于改进客户所使用的产品与服务——没有否认扫描,也没有解释销毁。

拆书这件事,法官已经表过态

把这条新闻单独看会觉得离奇,放回时间线上就顺了。Anthropic 在早前的版权诉讼中被披露采购了约 200 万册二手实体书,同样是裁掉书脊、高速扫描、销毁原件。

2025 年 6 月的即决判决把这套做法和另一套做法分开处理:对于合法买来的纸质书,法院认为把它转成可检索的数字文件属于格式转换,用途与出售或阅读原书不同,用于模型训练具有高度转化性,构成合理使用;而对于从盗版源批量下载并留存的数百万份文件,则认定侵权。后一部分最终以 15 亿美元的集体和解收场,据报道该和解已于 2026 年 7 月 20 日获批,覆盖 482,460 部作品,每部作品赔偿约 3,000 美元。

判决画的那条线,正好指向物理销毁

于是行业拿到了一份非常清晰的操作指引:下载盗版库,赔钱;花钱买旧书回来拆了扫,合法。两条路的成本差着几个数量级,结果没有悬念。

更微妙的是「销毁」这一步。它看上去是最刺眼的部分,法律上却恰恰是让格式转换站得住脚的关键——一册纸质书换一份数字副本,原件不再流通,总量没有增加,这才对得上「格式转换而非复制扩散」的说法。也就是说,把书扔掉不是野蛮的副产品,而是这条路径成立的必要动作。判决在压住盗版的同时,顺手把纸质书的物理销毁变成了最稳妥的取数方式,这大概不是当初写判词时想要的效果。

代价落在稀有书上。普通再版书扫完扔掉只是浪费,孤本、绝版和小印量书没有第二份,扫描件也补不回装帧、批注和纸张本身承载的信息。404 Media 的报道之所以引起反应,多半也在这一点上。

ISBN 说明这不是抽样

报道里有个容易被略过的细节:员工被要求扫描每本书的 ISBN 条码。

如果只是想弄一批语料,没必要逐本登记书号。逐本扫 ISBN 的意义在于对账——手上有一份清单,需要知道哪些已经拿到、哪些还缺。以书号为索引推进,指向的目标不是「弄一些书」,而是「把出版过的书过一遍」。从这个角度看,二手书市场上那些成批消失的旧书,接下来还会继续消失。