8 月底的一个周五深夜,48 页起诉书递进纽约联邦法院。索尼音乐和华纳音乐把 Anthropic 连同创始人 Dario Amodei 和 Benjamin Mann 一起告上法庭,索赔金额明明白白写在封面上:每部侵权作品最高 15 万美元,每次故意删除版权信息再加 2.5 万美元。如果法院按上限判,数字会是数十亿美元。这不是 Anthropic 第一次因为训练数据被起诉,但这一次,律师手里握着 Bartz v Anthropic 那张已经判下来的牌。
告的是什么
根据 Axios 拿到的诉状,唱片公司指控 Anthropic"明目张胆地、系统性地"做了三件事来给 Claude 喂数据:第一,创始人之一 Benjamin Mann 用 BitTorrent 下载了超过 500 万本盗版图书;第二,Anthropic 的员工从 Pirate Library Mirror(俗称"海盗图书馆镜像")下载了至少 200 万本盗版书;第三,公司从 MusixMatch、LyricFind 这些本来已经付费授权给唱片公司的歌词站上抓取歌词。这次的标的不是"几千首"而是"数万首"——相比今年早些时候 BMG 起诉 Anthropic 时只主张 493 部作品被侵权,规模直接放大了一个数量级。
索赔怎么算
诉状的赔偿条款是这么写的:每一部被侵权的版权作品最高 15 万美元,再加上每次"可识别的版权信息被删除"的情形最高 2.5 万美元。按 Sony/Warner 现在列的"数万首"作品计算,光这一项就已经是天文数字,更别提还要叠加故意删除版权元数据的惩罚性赔偿。唱片公司在诉状里直接用了"历史上规模最大、最明目张胆的知识产权盗窃之一"这种话,几乎是把 Bartz 案判决书里的话换了个主语。
为什么这次不一样
关键不在"AI 公司用盗版数据训练"这个罪名——Bartz v Anthropic 在 7 月 20 日的判决已经明确:训练本身是 fair use,这条法律阵地 Anthropic 守住了。但同一份判决也认定:用 BitTorrent 获取盗版数据是版权侵权,按这条 Anthropic 已经赔了 15 亿美元。"怎么拿到训练数据"和"训练数据怎么用"是两条战线,Anthropic 已经输了一条。
Sony/Warner 这场诉讼,几乎就是把 Bartz 案那套打法原样复制到音乐领域:同样主张 Anthropic 用 BitTorrent 获取数据,同样要求每部作品 15 万美元上限赔偿。唱片公司的算盘很清晰——既然法庭已经认定"BitTorrent 下载是侵权"的判例,那就顺着已经跑通的路走。不确定性大幅下降。
行业后果
这意味着接下来一年里,所有靠爬虫、BT、镜像站喂过数据的 AI 公司都要重新算账。法律上"训练"和"获取"被切开——可以继续合法地用公开数据集训练,但必须在数据来源环节做尽职调查。如果抓取路径里出现过 BitTorrent 客户端、Pirate Library Mirror 这类明显有问题的源头,哪怕模型本身没问题,公司还是为"脏数据"买单。
更深的行业影响是版权圈的预期:BMG 看到这条路能走通,后面环球音乐、EMI 这些大体量玩家排队进场的概率很高。AI 行业引以为傲的"开放数据集"叙事,在 2026 年的法庭上已经快撑不住了。
所以回到开头那个问题——Claude 还要赔多少?数字不重要,重要的是法律框架已经定型。AI 行业必须在 2027 年之前把数据获取的合规链彻底重建,否则下一波诉讼会沿着 Bartz + Sony/Warner 这条已经铺好的路直接撞过来。