[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-03143280-34e6-4492-9ce6-b2a8cacdeb74":3},{"id":4,"title":5,"summary":6,"original_url":7,"source_id":8,"tags":9,"published_at":23,"created_at":24,"modified_at":25,"is_published":26,"publish_type":27,"image_url":13,"view_count":28},"03143280-34e6-4492-9ce6-b2a8cacdeb74","Anthropic 15 亿美元图书和解落槌:\"Project Panama\" 把 LLM 训练数据工程推到监管视野","美国地区法官 Araceli Martinez-Olguin 本周一正式批准 Anthropic 与图书作者及出版商的集体诉讼和解协议,赔偿总额 15 亿美元,覆盖逾 48.2 万册图书。和解的关键意义不在赔偿数字本身,而在于法庭给出的两段式判决:使用受版权保护图书训练 LLM 属于合理使用,但通过影子图书馆下载盗版电子书及\"拆书脊扫描\"的实体书处理流程不合法。这等于给整个 LLM 行业的训练数据获取方式划了一条工程红线。\n\n事件曝光了 Anthropic 内部代号\"Project Panama\"的训练数据采集流程:投入数千万美元购入实体新书,拆开书脊、扫描书页后送回收公司,并聘请二十年前参与 Google Books 的 Google 高管负责工程化实施,同时配合从影子图书馆下载盗版电子书。法官在判决中把\"购买+扫描\"与\"盗版下载\"做法律切割,本质上是承认 LLM 训练对受版权材料的合理使用,同时惩罚绕过授权渠道的灰色采购。\n\n对行业的直接影响有三层:其一,头部厂商未来必须把训练数据溯源做成可审计流程,版权许可(出版商批量授权、LibGen 替代语料)会被纳入采购清单;其二,正在路上的类似诉讼(New York Times vs OpenAI、UMG vs Suno)可能援引此案的\"合理使用+盗版切割\"逻辑;其三,小厂商及开源训练方将更难获取廉价大规模语料,数据成本结构性抬升。\n\n技术意义不止于法律。Claude 3\u002F3.5 的能力跃升一直被怀疑与高质量人类文本的密集覆盖有关,Project Panama 这种\"工程化拆解纸质书\"的流程是 LLM 时代训练数据工程(TrDE, Training Data Engineering)的典型样本。当这条路径被判定为不可合法复制,开源和中小厂商必须寻找新数据源:合成数据、长上下文自蒸馏、用户授权语料将成为下一阶段的工程主流。","https:\u002F\u002Fapnews.com\u002Farticle\u002Fanthropic-copyright-authors-settlement-training-f294266bc79a16ec90d2ddccdf435164","833c1eca-f067-4241-91c1-1f82efecb59c",[10,14,17,20],{"id":11,"name":12,"slug":12,"description":13,"color":13},"1fcfaaf2-67de-43d3-9e35-5784852fec60","ai-safety",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"23544f6a-eea1-4f05-aa8d-749ca862d5d2","anthropic",{"id":18,"name":19,"slug":19,"description":13,"color":13},"dca4d0ab-7994-43a7-839e-7756fc77344a","claude",{"id":21,"name":22,"slug":22,"description":13,"color":13},"01598627-1ea6-4b27-a5d8-874971571a71","llm","2026-07-22T08:00:00Z","2026-07-22T08:05:33.289018Z","2026-07-22T08:05:33.289030Z",true,"agent",3]