In November 2022, OpenAI pushed ChatGPT into the public spotlight. Less than four years later, the Pew Research Center pulled apart half a decade of English-language webpages and asked a plain question: how much of the modern internet is already written by machines?

数据从哪里来:49 万份 Common Crawl,一台检测器

皮尤数据实验室的高级数据科学家 Samuel Bestvater 领衔的团队,从 Common Crawl 这套公开网页档案里抽取了大约 49 万份英文网页样本,时间跨度从 2021 年 1 月一直覆盖到 2026 年 7 月——也就是 ChatGPT 公测前两年到当下。文本经过一款名叫 Open Pangram 的开源 AI 检测器打分。Pangram 由第三方研究机构 Pangram Labs 训练,模型权重开放下载,逻辑是抓取 AI 与人类写作之间统计意义上的分布差异,识别哪些样本里 AI 写作的语言指纹明显。

这是一次大样本、明确方法论、明确工具的研究。皮尤在 2026 年 8 月 20 日发表了完整数据论文,并公开了原始 CSV 数据。

三组数据:10%、三分之一、十倍

最显眼的一组数字:把全部样本时间窗口合在一起看,2026 年 7 月快照里 10% 的网页呈现明显的 AI 写作痕迹。听上去比例不高,但这背后是互联网里混着大量 ChatGPT 之前的旧页面。皮尤做了一个更锋利的子集筛选——只保留 2022 年 11 月底 ChatGPT 发布之后才上线的网页,这一组里 超过三分之一(逾 33%)的页面被检测器判定有明显 AI 写作痕迹

顶级域名分布的差异更加戏剧性。2026 年样本里,.com 域名网页约 10% 命中 AI 痕迹,几乎是 .org 域名(4.6%)的两倍,又是 .edu 和 .gov 域名(都在 1% 上下)的十倍。换句话说,商业网站是 AI 内容的主战场,学术、政府机构在内容生成上对生成式工具的采纳明显保守。

AI 写手留了哪些指纹:em dash、牛津逗号、负面平行句式

皮尤同时分析了 AI 写作偏爱的语言特征在网页上的变化。相比 2023 年的网页样本,2026 年的网页样本里有几个信号被显著放大:

  • em dash(——):出现频率大约是 2023 年的两倍。
  • 牛津逗号(列举项里最后一项前面的逗号):使用频率上升 63%。
  • AI 偏爱词汇:delve、interplay、testament 等代表词的出现频率翻了一倍以上。
  • 负面平行句式("it's not just X, it's Y" 或者中文里"不只是 X,更是 Y"那种结构):几乎是三倍,虽然绝对比例仍然偏低。

Open Pangram 并不是靠这些"标点症"和"用词习惯"做单一判定,但大样本对照下,这些特征确实成了 AI 文本的稳定指纹。

检测工具本身不是神:误判与对抗

皮尤在论文里反复提醒:检测模型偶尔会把人类作品判成 AI,反过来也会漏判。AI 写作也在进化,刻意改写、加入更多人类写作风格,会让判定变难。Open Pangram 的策略是看统计意义上多维度的偏差,而不是盯住单一标志。这意味着同一篇文本在 2026 年的检测分数可能和 2027 年不一样——检测器和生成器会持续互相对抗。

这也是皮尤把数据集和工具全部公开的原因:研究者、新闻机构、监管者都可以自己复跑、迭代检测器,而不是被某一家的黑盒分数绑架。

对内容生态意味着什么:信息源分层在加速

数字背后真正的信号是信息源分层在加速。.edu 和 .gov 域名里 AI 痕迹占比只有 1%,意味着这些机构的内容生成仍以人类把关为主;而商业 .com 域名的 AI 写作占比已经接近学术、政府机构的十倍——读者面对同样的"网页",面对的是两种性质完全不同的内容供给:一边还带着机构审核的影子,另一边更可能是流水线产物。

这种分层短期对消费者不友好:搜索引擎和聚合平台的排序不会自动告诉你面前这篇文章是不是机器生成。但长期看,它会倒逼内容平台、内容订阅服务、SEO/反 AI 检测工具形成新的合同关系——内容创作者需要明确声明是否使用了 AI 生成辅助,平台需要提供 AI 痕迹过滤,而读者侧会出现"我想看人类写的"作为新的内容筛选维度。

所以呢:别再问"机器会不会写",该问"我怎么知道这是机器写的"

皮尤这份研究最重要的一步,不是给 AI 写作占比盖棺定论,而是把检测工具和样本都摆到桌面上。Common Crawl 是公开数据,Open Pangram 的权重是开源的,皮尤也公开了每一个时间点的具体比例。当我们习惯说"现在 AI 已经能写任何东西"时,这份 49 万页面的对照研究提醒了一件更精细的事实:能写被检测器识别之间仍然存在一个可以量化的差,这个差既是技术问题,也是治理问题。

接下来一两年,值得继续盯的是同一组样本在更晚时间的检测结果——AI 生成的占比是继续往上爬,还是在某个平台/规则约束后出现拐点,以及检测工具本身的容错率能不能跟得上生成器的进化。这两份曲线哪个先掉头,就会决定"机器写的互联网"在我们日常生活里到底显现成什么样子。

参考:Pew Research Center "How Much of the Internet Is Written With AI?",2026 年 8 月 20 日。原文链接见 NewsForAI。