纽约时报诉 OpenAI 与微软的版权诉讼,三年里第一次露出这种程度的内部表态。9 月 17 日 TechCrunch 拿到的新解封文件里,微软应用科学总监 Brent Hecht 在 2023 年 1 月的内部备忘录里把 AI 数据抓取直接称为「an astonishing theft of unprecedented proportions」与「the largest theft of labor in human history」。同份文件还披露了具体的训练集规模与商业影响——这些细节以前只活在猜测里。
文件说了什么:训练集规模与商业伤害都被量化
这次解封内容把过去几年版权诉讼里反复被质疑的两件事,变成了有数字的指控:
- 训练数据规模:OpenAI 用于中期训练的数据集里,包含超过 91,692 份由纽约时报、Daily News 和 Center for Investigative Reporting 出版的作品副本。仅从 nytimes.com 一家抓出来的 Common Crawl 衍生数据,就含超过 200 万份文档。
- Copilot 自伤效应:微软自己的数据显示,Copilot「答案引擎」让纽约时报域名的点击率相比传统 Bing 搜索最多下降 93%。Hecht 在 2024 年 1 月的另一份内部演示文稿把这称作「末日循环」, 称其将「同时损害我们模型的性能和整个网络」。
- 双方互相输送数据:Project Taxi、Project Mango 等代号项目让 OpenAI 与微软互相交送训练素材;Project Mango 数据集至少含 160,903 份来自三家原告出版商的独特作品。
- 绕过付费墙:OpenAI 研究员 Nick Ryder 向总裁 Greg Brockman 提到一个「绕过 nytimes 付费墙的黑客手段」, Brockman 回复「ah nice」。
这批解封材料并不是 OpenAI 与微软主动披露,而是《纽约时报》在案情摘要里引用——原始证据仍处于封存状态。换句话说,这些引语脱离了原有语境,公司仍然保有反击空间。
个人评论:这案子真正危险的点不在「数据从哪来」
这件事的技术读者容易陷在「他们到底抓了多少」的惊叹里,但真正影响产业链的,是它把 fair use 抗辩里最关键的两根支柱直接拆了。Fair use 法理要求 AI 公司证明「使用没有替代或损害原作品市场」——但现在解封材料里微软自己用 83%-93% 的点击率跌幅、OpenAI 内部把 ChatGPT 描述为「largely substitutive」, 主动承认了「替代效应」。加上 Hecht 备忘录里「an end-product threatens the economic foundations of its essential suppliers」这种字面承认,合理使用抗辩的「不替代」门槛在事实层已经塌了。
对正在做模型训练与产品落地的团队,值得追的不是判罚本身,而是三件事:一是法院会不会把「AI 公司内部对市场伤害的自我认知」纳入 fair use 考量;二是后续和解条款会不会要求训练数据透明披露;三是 Project Mango 这种代号化数据流通会不会被追溯判定为「共谋式侵权」。无论最终怎么判,这批文件已经被多家新闻机构列入下一步诉讼的证据清单,版权战的中段已经翻开。
所以呢
如果你是 AI 公司法务或合规岗,现在应该把这件事放进内部演练:训练数据来源文档有没有「我们知道这是偷的」这种带情绪的措辞。如果你是做数据采集或数据集的团队,Project Mango 的命名法与「绕付费墙」的研究员叙述应该成为新的合规红线——它是「明知」的证据点。如果你只是关注 AI 行业的读者,后续真正值得追的不是某一次判决金额,而是 2027 年合理使用边界会不会被这批文件改写。
来源:TechCrunch 报道,Rebecca Bellan 2026 年 9 月 17 日。