过去几年,学术圈对「论文里有多少是 AI 写的」一直停留在猜测阶段:检测工具不可靠,问卷调查又依赖自愿承认。8 月 11 日提交到 arXiv 的预印本 arXiv:2608.10715 给出了迄今最硬的答案:到 2025 年底,PubMed Central 收录的开放获取生物医学论文中,89% 出现 LLM 关联词汇过量。Nature 的报道直接把「Staggering 90%」写进标题,并指出这一数字远高于此前对 LLM 使用比例的估计。

词频漂移,而不是逐篇检测

这项工作来自 Lena Holzwarth、Rita González-Márquez、Dmitry Kobak 三位作者。他们没有再造一个「AI 检测器」去逐篇判定真伪,而是提出一种基于词频变化的无偏估计方法:把整个语料当作流行病学样本,统计 LLM 时代词频的系统性偏移,从分布层面估算被 LLM 改写过的文本比例。作者在摘要里直言,尽管这个方向近期有进展,但此前没有任何现有方法能给出可靠估计——先有可信的测量,才谈得上政策,这是整项工作的起点。

三个坐标轴上的数字

  • 时间轴:2025 年全年英文论文的 LLM 使用比例达到 77%,2024 年为 52%;2025 年 12 月发表的论文,近九成带 AI 辅助写作痕迹。
  • 章节轴:讨论部分段落的使用率约为 68%,接近方法部分段落(32%)的两倍;但即便在方法部分,整体使用率也超过 50%。摘要、引言、讨论等章节的痕迹比方法、结果部分更常见。
  • 自认轴:2025 年的一项调查显示,71% 的研究人员承认在用 AI 辅助写作,实际比例可能更高——与词频估计的结果互相印证。

真正的警报:方法部分过半

讨论部分被大量改写,多数人不会意外——那本来就是「发挥」的章节。扎眼的是方法部分:方法章节存在的意义,是精确记录实验到底怎么做的,它直接决定可复现性。当描述事实的段落也开始被模型重写,读者面对的就不只是文风问题,而是这份记录离原始操作有多远的问题。

对期刊与审稿体系而言,这项研究把一个模糊的担忧变成了可测量的基线。作者也点明了双面性:LLM 写作降低了语言壁垒,对非英语母语作者是实打实的好处,但学术不端与造假风险同步放大。可以预期的下一步,是披露要求与方法章节写作规范收紧——连「方法部分过半」这种数字都有了,继续装作没看见的成本只会越来越高。

参考:arXiv:2608.10715 · Nature 报道