2026 年 8 月 31 日,arXiv 出现一篇专门「挑刺」编码评测的论文(编号 2608.27831)。成均馆大学的研究团队提出一个此前很少有人正面量化的问题:如今编码智能体几乎都在 SWE-bench 系列上比拼分数,但这些任务来自精心整理的 GitHub issue——长、结构化、信息富集;而真实用户发给模型的请求,往往短得多、随意得多。这两者之间的分布差距,此前没有被系统测量过。

差距有多大:88% 对 7%

论文先做测量,再做基准。团队定义了一套六类信息分类法和四个语言风格维度,把它们同时套在两组语料上:一组是 SWE-chat 里的真实用户 prompt,另一组是 SWE-bench Verified 和 Pro 的问题陈述。结果相当悬殊:只带问题描述(或外加有限上下文)的请求,在真实用户 prompt 里占 88%,但在基准任务里只占 7%;反过来,87% 的真实 prompt 是口语化写法,而 94% 的基准任务用的是正式书面语。换句话说,基准考试默认考生会拿到一份信息齐全的卷子,而现实里近九成的用户只会丢过来一句含糊的抱怨。

381 个任务族,把「同一道题」改写 N 遍

基于这个测量,团队构建了 RealSWE:381 个多变体任务族,全部派生自 SWE-bench Verified 和 Pro。每个任务族内部的变体共享同一个底层任务和同一个 gold patch,只在信息构成和语言风格上不同——有的变体把期望行为、动机、环境信息、复现步骤一样样加上去,有的变体把书面语改写成口语。这种设计让「输入怎么写」变成了一个可控变量:同一个模型、同一份参考答案,唯一变化的是用户怎么提问。

七个前沿模型,平均掉 6.4 个百分点

用 RealSWE 评测七个当代大模型后,团队得到三个结论。其一,真实风格的输入让解决率平均下降 6.4 个百分点,而且足以改变模型之间的排名——今天榜单上的座次,放到真实输入分布下未必成立。其二,受控分析显示,在 prompt 里写明「期望行为」和「动机」会显著影响性能;相比之下,环境信息和复现步骤只是白白增加 token,没有可测量的收益。其三,语言风格本身的影响很小,且依模型而异——真正要命的不是口语还是书面语,而是信息是否到位。

对普通用户的「所以呢」

这篇论文最有价值的部分,恰恰是它给普通用户留了一句可直接执行的提示:大多数真实 prompt 都漏掉了「期望行为」和「动机」这两样东西,而把它们明确写出来,能实质性地提升模型的表现。下次给编码智能体提需求时,与其贴一整屏报错日志,不如先想清楚一句话——你要的到底是什么行为、为什么要它。论文配套的 RealSWE-bench 数据已在 GitHub 以 MIT 许可开源,评测 harness 尚未放出,团队表示将很快释出;详见 arXiv:2608.27831(arxiv.org/abs/2608.27831)。当基准任务和真实使用越来越脱节,「刷榜」和「能用」之间的那道缝,这篇论文第一次给出了尺子。