404 Media 在 8 月底刊出了一份匿名的亚马逊仓库员工采访 —— 不是站在传送带外的观察,而是真正站在 VGT3 仓库地上、把书一本一本塞进切书机的人。

VGT3 位于内华达州拉斯维加斯,与亚马逊的按需印刷业务 LAS8 共用一处园区,后者面向终端消费者。404 Media 编辑 Emanuel Maiberg 在 8 月 26 日刊出的访谈里,把内部操作讲得非常具体:

仓库每天会到大量整托盘的图书,语种包括德语、俄语、日语,有全新未拆封的,也有从英国伦敦大学图书馆清出来的旧书,甚至还有装订成册的、注明「呈交议会代表女王陛下」的政府文件。员工的工作流程是:扫描条码剔重 → 把书塞进一台带安全罩的手动切书机 → 把裁下来的散页推到下一站 → 用大约 20 到 25 台「像点钞机一样快速翻页」的扫描仪成像 → 散页被扔进高约 6 到 7 英尺的敞口纸箱(gaylord),再也不可能复原成一本完整的书。

这位员工对采访者说了一句很关键的话:亚马逊最初告诉他们,这是给 Kindle 电子书库做数字化。「我一眼就觉得不对劲,出版权和版权那儿根本过不去。」 后来才知道真正去向是给 AI 训练建语料库。

这件事为什么值得说

仓库里的细节本身没有技术含量,但它把一个长期悬而未决的问题,第一次以「可观察」的方式拍到了桌面上:前沿大模型正在消耗的语料,有多少是带着明确版权状态的纸质书?

书脊被切掉那一刻,意味着它不再作为一本书存在,而变成了一堆没有封皮、没有版权页、没有 ISBN 的扫描页。员工说重复的书「会被退回供应商」,但退回的判断标准是条码,不是版权状态 —— 一本 1923 年之后再版的、在美国仍受版权保护的学术专著,被条码命中后进了切书机,跟一本 1900 年的公版书没有任何区别。

更值得注意的是流程的「故意模糊」。仓库员工自己描述说:「他们的流程每天都变,他们也不太知道自己在干什么,至少不想说自己在干什么。」 当一个本应只是机械工作的执行层,被有意隔离在「为什么要做」的答案之外,通常是上游不想让执行层承担知情责任。

算一笔账

404 Media 在前一篇追踪报道里已经披露:这个仓库的前身定位之一,就是为 AI 公司获取的训练语料。采访里也提到,这些书「有的是稀有版本,我看到员工私下讨论过」,言下之意,亚马逊可能正在批量买入市面上仍可流通的稀有书,而不是只清理库存。

如果按一个保守的数量级来估算 —— 一个仓库一天处理数千到上万本书是 VGT3 员工描述的常规工作量 —— 一年下来就是数百万到上千万册级别的物理图书,被不可逆地变成只服务于单一 AI 模型的训练样本。对一个单本定价可能几十到几百美元的珍本来说,这是无法复现的资源消耗。

训练数据合规的「擦边球」传统

这件事不是孤例。Anthropic 在 8 月底被索尼和华纳音乐告上法庭,诉状指控其使用 BitTorrent 下载超过 500 万本盗版图书训练 Claude,以及通过 Pirate Library Mirror 下载超过 200 万本;OpenAI 也被多次指控用影子库训练模型。VGT3 这条线如果被认真追下去,指向的是另一类问题:不通过 P2P 或盗版站,而是通过合法的商业采购渠道把版权状态模糊的书物理销毁后入库,这条路径是否同样构成对作者权利的实质侵犯?

目前美国版权法对「合理使用」在 AI 训练场景下的边界,还在 New York Times v. OpenAI 等几个未决案件中博弈。但 VGT3 仓库至少证明一件事:语料采购的成本,已经不只是服务器账单和律师费,而开始包括对实体书籍的不可逆消耗。

所以呢

如果你是 AI 工程师,在做语料清洗时:优先确认来源链路。即使你的供应商打包说「已经做过版权清理」,也要追问每一批数据的物理来源 —— 是从公版书数字化、是作者授权、还是从某个「切书仓库」流出的。

如果你是机构采购方或投资人:训练数据合规,正从法务部的灰色地带,变成采购流程里必须显式问的一道问题。一个能在公开市场上批量买书、不可逆地破坏、且无明确版权披露机制的供应链,迟早会成为下一个被集体诉讼盯上的环节。

如果你是普通读者:了解一下你手上正在流通的绝版书,可能正以每天数千本的速度被消化进不可复用的训练样本。这不是耸人听闻,这是 VGT3 员工接受采访时说的现状。