arXiv 在 8 月 12 日挂出了一篇预印本,作者是 Holzwarth、González-Márquez 与比利时根特大学的 Dmitry Kobak。他们做了一件听起来朴素但很少有人真正做过的事:把 PubMed Central 数据库里 2024 年和 2025 年全年收录的英文生物医学论文全文跑了一遍,用一套更敏感的词频方法去看哪些论文里藏了 LLM 写作的指纹。结论非常硬——2025 年全年被收录的英文论文里,有 77% 能检出大模型参与写作的痕迹,2024 年这个数字是 52%,而 2025 年 12 月单月,这一比例直接飙到了接近 90%(参见 https://www.nature.com/articles/d41586-026-02551-z 与 Solidot 报道 https://www.solidot.org/story?sid=85173)。
把这件事拆开看,90% 这个数字之所以让人觉得不对劲,是因为它和此前所有估计都对不上。Kobak 本人在接受 Nature 采访时说,他自己第一反应也是「我们肯定哪里算错了」。但反复验证之后,他承认数据站得住脚。
数字为什么会比之前所有研究都高
过去几年,关于「学术论文里有多少 AI 写的」这个问题的研究,数字一直压在 10%-15% 这个区间。2025 年 Kobak 团队自己用摘要做的一项研究,给出的 2024 年数据是至少 13.5%(https://www.nature.com/articles/d41586-025-02097-6);2026 年另一项跨学科研究给出的 2025 年估计是 57%(Siler, PNAS, https://doi.org/10.1073/pnas.2605754123)。
新研究之所以数字高得多,核心原因是方法更敏感——它分析全文而不是摘要,且不再只给「AI 使用率的下限」,而是给出直接估计。同样的方法回头套到 2024 年数据上,把摘要检出率从 13.5% 推到了 31%。也就是说,不是 2025 年突然变多,而是过去我们对 2024 年本身就低估了一半以上。
另一个独立佐证来自 Wiley 在 2025 年做的研究者自报调查:71% 的研究人员承认自己在用 AI 辅助写作。如果实际使用率普遍高于自报水平——这是几乎所有敏感行为调查的通用规律——那 77% 这个数字就不仅不离谱,反而可能还有点保守。
不是所有段落都被 AI 染指
研究最有信息量的细节,是不同段落的 LLM 痕迹分布非常不均匀。在 2025 年 12 月的论文里:
- 讨论部分(Discussion):约 78% 检出 AI 痕迹
- 引言和摘要:同样明显偏高
- 方法(Methods)和结果(Results)部分:约 58%
这个分布不是偶然。摘要、引言、讨论是「文字工作」最重的部分,也是 LLM 改写、润色、扩写最自然的切入点。而方法和结果往往涉及具体实验设计、数据处理流程,写作者自己最清楚要写什么,AI 介入的动机也最低。
但这恰恰是最让人担心的部分。Methods/Results 的低检出率不代表「这块安全」——而是这块如果一旦被 LLM 染指,后果会严重得多。Kobak 自己点名了这一点:LLM 在数据呈现上有「幻觉」的倾向,任何进入 Methods/Results 的 AI 痕迹都可能意味着伪造或杜撰的数据风险。
三个被低估的风险
把这件事放进更大的语境里,真正值得警觉的不是「90%」这个数字本身,而是它隐含的三件事。
第一,同行评议的识别能力被高估了。如果 90% 的论文都过得了同行评议,那意味着评审流程对 AI 写作几乎没有感知。要么评审者没意识到、要么评审标准根本没有覆盖这一项。
第二,文献的「偏见渗透」。Kobak 在 Nature 报道里说了一句值得引用的话:「如果 LLM 自身带有某种偏见,这种偏见会随着 AI 辅助的引言和讨论,悄悄渗透进整个学科的文献里。」和直接伪造数据不同,这种渗透是渐进的、分布式的,反而更难追责。
第三,「使用即合规」的隐性共识正在形成。当 71% 的研究者自报使用、77% 的论文检出痕迹、却没有系统性撤稿或撤稿争议时,「使用 AI 写作」已经从「可能违规」变成「默认行为」。规则没变,但行为基线整体漂移了。
同行怎么看
Nature 的报道里同时引用了几位独立学者的反应。多伦多大学的 Kyle Siler(那项 57% 估计的作者)说了一句很直白的话:「牙膏已经从管子里挤出来了,不会再回去。」其他学者也基本认可:高数字可能不适用于所有学科,但 LLM 写作已经成为科研产出的默认组成部分之一,这一点很难再翻盘。
需要注意的边界:PubMed Central 是生物医学领域专门的数据库,这篇预印本的数据集不覆盖物理学、计算机、数学等学科。不同学科的写作习惯和 AI 使用动机差异很大,90% 不能直接外推到所有学科。
现在应该做什么
对科研工作者来说,这件事给出的实际信号不是「禁止 AI 写论文」——那个时点已经过了。更现实的是分两条线做。
- 披露透明:投稿时主动声明哪些部分用了 AI、用了什么工具、做了什么程度的修改。期刊和会议越来越把这条写进 policy。
- 关键段落护栏:Methods 和 Results 这类承载事实的部分,要么完全人工写,要么留下可追溯的提示词与生成记录。讨论部分如果用 AI,至少要过一遍事实核查。
对做 AI 工具的团队来说,这个数字是一个明确的产品信号:科研领域的 AI 写作助手如果只做「改写润色」,会越来越被视为可疑;如果把「保留可追溯记录 + 关键事实不可篡改」做成默认能力,反而能在新规则到来之前占据主动。
对做科研管理和政策的人来说,这个数字是时候推动一些更具体的标准了——比如要求 LLM 介入的部分必须在 PDF 里以某种方式标记,或者在元数据里声明。期刊编辑联盟、资助机构、研究伦理委员会都需要在这一年里给出更明确的边界,否则规则只会越来越滞后于实际行为。
个人判断
77% 这个数字会被广泛传播,但更重要的是它打开了一个新的判断维度:学术产出的「真实人工贡献」正在成为一个需要单独计量的问题。未来的文献检索、文献评估、同行评议、AI 训练语料清洗,都会需要回答「这一段到底是谁写的、是谁改的」这个问题。
这不是关于 AI 能不能写论文,而是关于学术界能不能诚实记录这件事。论文可以被 AI 写得更好,但前提是作者愿意在每一篇论文里诚实说明这一点。