AI 行业那层「合理使用」的薄纱,被一封内部备忘录和几段证词捅穿了。
9 月 17 日,《纽约时报》诉 OpenAI 与微软版权官司刚解封的法庭文件,把两家公司过去三年对新闻业做了什么摆到台面上。微软应用科学总监 Brent Hecht 在 2023 年 1 月的内部备忘录里,把 OpenAI 用抓取的新闻训练 AI 称为「令人震惊的、史无前例的盗窃」「人类历史上最大规模的劳动成果盗窃」。这份由微软应用科学部门负责人亲自撰写的 PowerPoint,是被告自己内部对自家训练数据实践的最尖锐定性。
微软自家数据先回答了「替代性」
Hecht 同期的演示文稿记录下 Copilot「answer engine」对《纽约时报》域名点击率的冲击:相比传统 Bing 搜索,部分页面点击率下滑达 93%,整体也跌了 51%-94%。他把这叫作「doom loop」——一个会同时伤害自家模型和整个开放网络的恶性循环。
「终端产品威胁其必要供应商的经济基础,这种情况极为罕见,但这正是我们针对 LLM 业务'内容供应链'制造的现状。」
这句话是「合理使用」四要素中「不得损害原作市场」那一条最直接的反驳。微软 2024 年初就已经把数字算出来了,然后用「合理使用」这套话术,在过去三年里把 OpenAI 的训练数据合法性反复洗白。
纳德拉把「许可」写进了庭审记录
微软 CEO Satya Nadella 在 2025 年初的证词里给了另一个关键陈述:任何付费墙内容,如果想被用于「grounding」或训练,都应该拿到许可;如果他早知道 OpenAI 绕过付费墙抓取并训练,他「会援引微软的权利,要求 OpenAI 重新训练」。
这一段对微软-OpenAI 这对「共生关系」相当致命。微软一边在公开场合捍卫 OpenAI 的「合理使用」,一边在法庭上承认,如果同样的事情发生在自己不知情时,会要求对方重做。这等于承认:这套做法在道德和合同层面是错的,只是因为没人追究,才一直没人去做。
91,692 个副本与「ah nice」
技术细节这次也没藏着:OpenAI 的中训数据集包含逾 91,692 份来自《纽约时报》《每日新闻》和调查报道中心的副本;一个 Common Crawl 派生的数据集里,nytimes.com 单独贡献了 200 多万文档。
更黑色幽默的是绕过付费墙那一条。OpenAI 研究员 Nick Ryder 给 Brockman 发消息说「有个 hack 可以绕过 nytimes 的付费墙」,Brockman 回的是:「ah nice。」这条对话被诉方拽进了法庭文件。
为什么是行业分水岭
过去两年,法庭和监管对 AI 训练数据的合法性普遍偏向「合理使用」。美国白宫 9 月初也提交了支持 OpenAI 的 brief。但这次的解封文件让天平多了一块新的砝码——不是外部批评者的观点,而是被告自己内部的文件。
这类材料的杀伤力在于,它把「合理使用」抗辩中「无市场损害」「非替代性」「非故意」三个支柱同时拆掉了。当公司自己的应用科学总监写下「doom loop」,当 CEO 承诺「付费墙必须被许可」,当对手公司总裁笑着回「ah nice」时,「合理使用」这道防线在事实层和法律层都变得极其脆弱。
接下来 12 个月的走向基本取决于和解条款——金额、训练数据披露义务、未来的「许可优先」机制——会不会被强制写进行业惯例。Hecht 那句「人类历史上最大规模盗窃」,最后可能成为这个行业的判例级注脚。