评测 Agent 的账单正在失控。EarlyEval 论文的原话是:让前沿模型在一个 agentic 基准上完整跑一遍,成本可达「数百到数千美元」,而这个价格在迭代开发周期里要反复支付。上海交大团队 9 月 2 日挂上 arXiv 的这项工作给出了一个新解法:不删任务、不换小模型,而是在 agent 跑到一半、结局已经可预判时,提前把它叫停。
换一条轴省评测的钱
此前评测降本的主流路线是 benchmark distillation(基准蒸馏)——把成百道题蒸馏成更少的任务,任务数少了,但每个保留任务的执行成本原封不动。EarlyEval 补的是另一条轴:任务内部提前止损。它的核心观察很朴素:agent 的最终结局,往往在执行完成前就从中间行为里显形——一个注定失败的 run,看前几步的行为特征就能判断。
方法上,框架训练了一对 LightGBM 分类器(一个判成功、一个判失败),特征覆盖行为、文本与参考解三族;一旦任一分类器越过校准过的置信度阈值,run 立即中止。论文强调这套监视的单步开销可以忽略。
数字:省多少,误差多大
在 SWE-bench Verified、TerminalBench、Toolathlon 三个基准上,论文报告 EarlyEval 可以砍掉 13%-26% 的 agent 步骤,最多省下 44.1% 的输入 token 和 29.4% 的输出 token,同时保持 89%-97% 的结局预测准确率;对每个 agent 的任务解决率(resolve rate)的平均扰动只有 1-2 个百分点。
这个交换比值得细看:对高频内部评测来说,用 1-2 个百分点的榜单噪声换近半的输入 token,在开发迭代场景里几乎一定划算;但如果评测目的是对外发榜、数字要经得起审计,这个扰动就必须谨慎对待。论文自己也把「对解决率的影响」当作核心指标摆出来,而不是藏进附录。
开源仓库:代码全给,工件不给
配套 GitHub 仓库(inphotoo/earlyeval)是一次 code-only release:训练、测试、特征构建、消融、架构对比、策略回放、表格生成代码全部放出,连 TerminalBench 上 4x4 的「换模型 × 换 harness」交叉诊断实验脚本都在;但刻意不含训练好的模型、预测文件、论文表格等生成工件,需要按 README 的复现流水线自建。架构对比部分,仓库在 LightGBM 主模型(I_LightGBM_Dense_AF)之外,还提供了 direct MLP、BERT/CodeBERT、本地 LLM-logit 和 Qwen 微调等基线代码,方便对照复跑。README 的输出路径里出现了 icse_submission_draft 字样,暗示这是投稿 ICSE 的配套代码。
所以呢
Agent 评测的经济学正在变成一门独立的学问:训练要钱、推理要钱,现在连「验证训练有没有用」也要按美元计价。EarlyEval 的价值不在于那个 44.1%,而在于它把「评测预算」从常量变成了可调参数——想省钱就提前停,要精确数字就等跑完。对每天在 SWE-bench 上烧钱的团队来说,这可能是最务实的一类研究。论文上线当天在 Hugging Face Daily Papers 收获 110 个推荐(单一社区榜单口径)。
参考:arXiv:2609.02783 — https://arxiv.org/abs/2609.02783