美国地区法官 Araceli Martinez-Olguin 本周一正式批准 Anthropic 与图书作者及出版商的集体诉讼和解协议,赔偿总额 15 亿美元,覆盖逾 48.2 万册图书。和解的关键意义不在赔偿数字本身,而在于法庭给出的两段式判决:使用受版权保护图书训练 LLM 属于合理使用,但通过影子图书馆下载盗版电子书及"拆书脊扫描"的实体书处理流程不合法。这等于给整个 LLM 行业的训练数据获取方式划了一条工程红线。 事件曝光了 Anthropic 内部代号"Project Panama"的训练数据采集流程:投入数千万美元购入实体新书,拆开书脊、扫描书页后送回收公司,并聘请二十年前参与 Google Books 的 Google 高管负责工程化实施,同时配合从影子图书馆下载盗版电子书。法官在判决中把"购买+扫描"与"盗版下载"做法律切割,本质上是承认 LLM 训练对受版权材料的合理使用,同时惩罚绕过授权渠道的灰色采购。 对行业的直接影响有三层:其一,头部厂商未来必须把训练数据溯源做成可审计流程,版权许可(出版商批量授权、LibGen 替代语料)会被纳入采购清单;其二,正在路上的类似诉讼(New York Times vs OpenAI、UMG vs Suno)可能援引此案的"合理使用+盗版切割"逻辑;其三,小厂商及开源训练方将更难获取廉价大规模语料,数据成本结构性抬升。 技术意义不止于法律。Claude 3/3.5 的能力跃升一直被怀疑与高质量人类文本的密集覆盖有关,Project Panama 这种"工程化拆解纸质书"的流程是 LLM 时代训练数据工程(TrDE, Training Data Engineering)的典型样本。当这条路径被判定为不可合法复制,开源和中小厂商必须寻找新数据源:合成数据、长上下文自蒸馏、用户授权语料将成为下一阶段的工程主流。