2022 年 11 月 ChatGPT 面世时,很少有人预料到它会以什么方式改写网页本身。皮尤研究中心(Pew Research Center)8 月 20 日发布的研究,给"互联网上有多少内容是 AI 写的"这个悬置已久的问题交出了第一份大样本量化答案——结论比多数人的直觉更激进。

49 万个网页,一个检测模型

研究团队从 Common Crawl 网页存档抽取了 2021 年 1 月至 2026 年 7 月、跨度近五年的约 49 万个英文网页——起点刻意选在 ChatGPT 发布前两年,前后对比才有参照系。检测工具是 Pangram 开源的开放权重检测模型 Open Pangram,通过词汇、短语与句式癖好等语言统计模式,判断文本是否"由 AI 写作或深度编辑"。

必须交代一个诚实前提:皮尤自己强调,检测模型并不完美,单篇文档存在误判可能;但当样本放大到几十万级,群体层面的统计趋势是可靠的。

两个数字:十分之一,与三分之一

2026 年 7 月快照的随机抽样里,全部网页有 10% 出现显著 AI 写作痕迹。这个数字看似温和,但互联网是新旧内容的混合体——大量存量页面诞生于 ChatGPT 之前,物理上不可能由 AI 写成。

把旧页面过滤掉、只看 ChatGPT 发布之后新出版的页面,比例骤然跳到超过三分之一。皮尤指出,这与 ai-on-the-internet.github.io 汇总的同类研究相互印证,并非孤证。

.com 是重灾区,.edu 与 .gov 是净土

ChatGPT 刚发布时,各顶级域名的 AI 语言模式出现率基本一致;到 2026 年已显著分化:约十分之一的 .com 页面带 AI 痕迹,是 .org(4.6%)的两倍、.edu 与 .gov(均约 1%)的十倍。商业内容在批量拥抱 AI,而学术与政府站点的编辑流程构成了一道更有效的防火墙。

趋势也没有放缓迹象:.com 的 AI 痕迹占比从 2021 年初的 1.09% 一路爬升到 2026 年初的 9.35%。

AI 的文风指纹,已经渗进语料库

对比 2023 年与今天的网页,皮尤列出的文风变化几乎是一份 AI 写作鉴定清单:

  • 破折号使用频率约翻倍(每万词 5.79 次 → 11.19 次);
  • 牛津逗号增长 63%(34.04 次 → 55.51 次);
  • delve、interplay、testament 等 AI 高频词用量翻倍以上(11.94 次 → 26.02 次);
  • "not just X, it's Y"式否定平行结构增长近两倍(0.87 次 → 2.36 次)。

报告还附上完整"AI 词汇表":additionally、crucial、fostering、landscape、tapestry、underscore、vibrant……常读英文博客的人应该都会心一笑。

怎么看这件事

真正值得警惕的不是"AI 写了多少网页",而是这些页面接下来的去向。模型从人类语料里学出了这些文风偏好,而这些偏好正以翻倍的速度扩散回互联网语料——生成与训练之间的循环在收紧。叠加上检测器的误判率和人类作者对这些句式的主动模仿,"有 AI 痕迹"和"AI 生成"的边界会越来越模糊。

对模型开发者,这是数据清洗环节权重的又一次上调;对内容平台,.com 与 .edu 之间十倍的差距说明,编辑把关仍是目前最有效的质量控制手段。下次再有人争论"互联网会不会被 AI 填满",把这份研究甩给他:不是会不会,是已经发生了——只是分布远比想象中不均匀。

原文:皮尤研究中心 How Much of the Internet Is Written With AI?(2026-08-20)