「theft of labor」来自微软内部 PPT

最近 Ars Technica 拿到一份微软内部文件,主角是微软应用科学总监 Brent Hecht。他的措辞相当激烈:抓取新闻内容训练 AI 是「人类历史上最大规模的劳动成果盗窃」——他在文件里用了「theft of labor」这个表述,而且明确说「这完全是对合理使用理念的嘲弄」。一家全球市值前几的科技公司,在内部文件里承认自己最赚钱的合作伙伴(OpenAI)所用训练数据是「盗窃」,这件事本身就够戏剧了,但更狠的是数字。

微软自己的数据指出,部分新闻出版商网站自 ChatGPT 上线以来,点击率下降了 83% 到 93%;另一批新闻机构的点击率下降了 51% 到 94%。换句话说,新闻业不仅在被偷内容,还在被偷流量。Hecht 在文件里承认「几乎没有人希望自己创作的内容被以这种方式使用,也几乎没有人因此获得报酬」,但这句话是写给内部同事看的——他真正想推的论点是,这条链路会形成「恶性循环」,既伤害模型,也伤害整个 Web。当原创内容方因为没收入、没流量而停止生产,模型可吃的语料也会枯竭。

纳德拉国会承认 vs Brockman Slack 里说「好极了」

最戏剧性的不是这份内部文件,而是接下来发生的事情。微软 CEO 萨蒂亚·纳德拉(Satya Nadella)在国会作证时亲口承认,AI 公司不应该通过绕过付费墙的方式违反新闻网站的使用条款——这相当于在公开场合重复了 Brent Hecht 在内部文件里的立场。但根据 Ars Technica 拿到的 OpenAI 内部信息,当一名 OpenAI 员工把「我们爬虫找到了绕过《纽约时报》付费墙的漏洞」这件事通知总裁 Greg Brockman 时,得到的回复是「好极了」。

一边的内部文件说这是盗窃,一边的国会证词承认这是违约,而真正动手绕过付费墙的另一头,高管在内部 Slack 里为这个 bug 庆祝。这不是单点的失误,是头部公司之间长期在「嘴上承认问题、行动上继续薅」的拉扯。如果连 OpenAI 的最大投资人和算力供应商微软都承认「不该这么干」,那剩下的辩护空间还能有多大?(详见 Ars Technica 原报道:Microsoft exec called AI scraping "the largest theft of labor in human history")

所以 Hecht 这份文件的真正信号不是「AI 公司用新闻训练」这件事本身,而是这件事的代价已经被量化,而且被量化在微软自己的内部 PPT 里——点击率下降 83% 到 94% 这种区间,不是某个外部机构的怀疑,而是当事方的内部测算。当这种数字第一次以「内部文件外泄」的形式出现在公开报道里,它就不再只是伦理议题,而是会被监管方和法院拿来当证据用的事实基础。