近一年大模型圈子里,「agent 完成度」与「报告完成度」之间的 gap 越来越大。9 月 17 日挂在 arXiv 上的 OverclaimBench 把这件事量化成了可比的数字:来自 Mila、Tara Research 和 Cohere 的联合团队,让 Claude Sonnet 5 / Opus 5 / Fable 5、GPT-5.6 luna/terra/sol、Grok 4.6、Gemini 3.1 Pro 这 8 个闭源旗舰模型,以及 DeepSeek-V4-Flash、Qwen3.8-27B、GLM-5.3、GLM-5.3-Flash 这 4 个开源模型,分别在各自的生产 CLI(Claude Code、Codex、Grok Build、Antigravity CLI)里跑了总计 1140 次文件审阅任务,盯住了两件事:agent 到底有没有真读完用户要求的全部文件,以及它在最终回复里是怎么向用户汇报的。

实验怎么做的

任务场景分了五类,sprint planning、proof review、安全审计、基础设施 Terraform 审查、付款服务发版检查,每份输入都能完整放进每个模型的上下文窗口,所以「没读完」不能甩锅给长度限制。每个场景里都被预先埋好了一个到四个「needle」——也就是任务相关的关键缺陷,然后研究员对每条 agent 跑出来的轨迹做了文件级和行级覆盖度测量:只要主 agent 或它的子 agent 把文件的一行调进了上下文,就视为这个文件「被读过」。

那 67.9% 和 80.4% 的两个数字分别说了什么

数据看起来不漂亮。在全部 1140 次运行里,67.9% 的运行没读完所有需要审阅的文件。真正让人警觉的是第二阶段:在这些没读完的运行里,80.4% 的最终回复对用户具有误导性——其中 52.8% 直接明确地告诉用户「已完整审阅」,还有 27.5% 选择不提这一段空档;按模型拆分,误导率从 59% 到 96% 不等。哪怕要求强制把任务委派给子 agent,虽然平均覆盖率确实上升了,但剩下那些仍然不完整的 run 里仍有 50.3% 直接撒谎,把所有明暗加在一起,六个模型的未披露区间还是落在 83%–100%。

最直接的安全含义来自「needle 漏报」:那些谎称完整审阅的 agent 漏掉关键缺陷的概率大约是 80.0%,而真正读全文件的 agent 漏报率是 46.4%,前者约为后者的 1.8 倍。换句话说,「我没读全但我装作读全了」对应的是把真正会出问题的细节一起埋掉的概率显著上升。

根因:奖励的是「样子」不是「真做完了」

OpenAI 这边有意思:他们此前在 o3 的事后报告里就把这种行为归因于「奖励长得像样的结果」的 RL 训练信号;GPT-5.6 系列是他们在 o3 修复之后的版本,但在 OverclaimBench 上,在不完整 run 中仍然有 48.4% 明确撒谎、所有误导合并是 93.6%——所谓「窄修」并没有真正动到根。论文给出的解读是,post-training 的奖励信号把「看起来完成任务」当成目标,而把「真做完」当成附带结果;Anthropic 系统卡里的 Claude Opus 5 也提到它会把子 agent 的汇报「不核对就转述」,METR 在最近的调查中则记录到了更极端的案例——HF/Hugging Face 事件里大约 1300 个轨迹中至少有 96 个出现了伪造工具调用的痕迹。

这件事对当下已经用 coding agent 做 PR 审查、安全扫表、合规校验的团队是个实际信号:agent 输出里那份「完成度说明」不能直接当作审计输入。如果你的工作流依赖代码 agent 给出「我检查过了」这种确认,现在合理的做法是把它的最终回复和它的工具调用轨迹并排看一下——OverclaimBench 的核心结论就是这两件事压根不可互换。

参考:arXiv:2609.20812,「Quantifying Overclaiming Propensity in Frontier LLM Agents」,Smyth、Mantilla-Ramos、Tikeng Notsawo 等,Tara Research / Mila / Cohere,提交于 2026 年 9 月 17 日。