最近一周,科技圈被一份解封的法庭文件炸开了锅。《纽约时报》诉 OpenAI 和微软的版权案,原告律师团提交了一份 92 页未删节的摘要判决动议,大量引用了微软和 OpenAI 高管在内部文件和作证时的原话——这些话,被微软和 OpenAI 此前以"商业秘密"为由遮了三年多。

内部文件说了什么

最炸的一句来自微软应用科学总监 Brent Hecht。他在 2023 年 1 月的内部备忘录里写道:抓取新闻内容训练 AI 是"人类历史上最大规模的劳动成果盗窃",这一行为"完全是对合理使用理念的嘲弄"。在另一处,他把 LLM 的训练机制描述为"在没有把经济价值分配到供应链的情况下窃取内容,这必然威胁内容创作者的经济稳定"。

比这句话更可怕的是微软自己写的一份策略文件,直接承认 AI 业务已经陷入"死亡循环"。文件原话是:"我们的 AI 内容战略已开始形成'死亡循环',会同时伤害我们模型的性能和整个 Web——一个终端产品威胁到它基础供应商的经济基础,这非常罕见,但这就是我们为 LLM 业务在'内容供应链'上制造的局面。"同一份策略文件还下了个结论:"LLM 是一种会摧毁自身供应链的产品。"

微软的数据印证了这一点。文件指出,部分新闻出版商网站的点击率下降了 83%-93%,其它新闻机构下降 51%-94%。微软 CEO 纳德拉在宣誓证词中承认,抓取《纽约时报》及新闻网站后,Bing 上对这些网站的点击"完全崩盘",降幅超过 90%。换句话说,AI 用他们的内容训练出了更好的搜索引擎,然后再把这些内容提供方从搜索结果里挤掉。纳德拉还确认:聊天机器人本质上已"替代"了去原始网站获取信息的行为。

OpenAI 侧的故事同样不光彩。文件披露,联合创始人 Greg Brockman 得知爬虫绕过《纽约时报》付费墙时回了句"Ah, nice";OpenAI 的企业代表在证词中承认,他"不知道"公司做过任何"检测付费墙内容"的努力。ChatGPT 业务负责人 Nick Turley 在内部沟通中写道,AI 聊天机器人对出版商构成"生存性威胁",因为它们"基本上是替代性的"。政策总监 Jack Clark 补充:"我们正在创建替代定义社会'文化'的人们的劳动的系统。"

这份文件为何重要

这份文件的意义,不在于披露了外界不知道的事。它的意义在于:这是被告自己的嘴说出来的。微软和 OpenAI 的律师团在法庭上的核心抗辩是"合理使用"和"转换性使用",即训练 LLM 是高度转换性的、不替代原作的使用。但他们自己的高管在同一时间线上的内部文件里,把这些模型形容成"盗窃"、"替代劳动"、"死亡循环"、"摧毁供应链"。内部承认和外部抗辩之间的鸿沟,正是《纽约时报》律师团要拿来说服法官的关键弹药。

行业影响与更深的问题

这份文件的影响远超这一桩诉讼——它把 AI 公司对训练数据合规性的真实内部评估,第一次大规模公开化。接下来几个月,围绕训练数据授权、"opt-out"机制和"AI 检索分成"的讨论会进一步加速。OpenAI 自己的经济学专家也承认,Google AI Overviews 可能让新闻出版商搜索推荐流量下降 20% 到 60%,说明整个 AI 检索生态对内容产业的挤压是系统性的。

更深一层的信号是:即便 AI 公司赢了"合理使用"的判决,"死亡循环"的问题也不会消失。LLM 的质量依赖高质量的原始内容,如果 AI 把内容产业的商业模式摧毁,下一代的训练数据从哪里来?这是 AI 行业不能只交给律师去回答的问题。