跑长程任务的 Agent 都遇到过同一类翻车:任务进行到一半,它突然引用一个从没被证实过的假设,或者照着几轮之前已经过时的计划继续执行。问题往往不在模型能力,而在上下文历史本身——错误一旦写进历史,就会像污染物一样持续扭曲后面的每一步决策。中国人民大学团队 9 月 23 日提交到 arXiv 的论文给这个现象起了名字:任务状态污染(task-state contamination),并给出了一套编辑式的解法。
世界模型换了目标:不预测环境,改编辑状态
论文提出的 Agent-Editing World Model(AEWM)首先对主流做法提出质疑:现有语言世界模型通常学习预测环境的下一步观测,但工具返回的结果高熵、依赖具体执行过程,在真实反馈随手可得的情况下,重建这些观测价值有限。AEWM 转而建模推理和动作如何影响未来的任务进展。
具体分两步。Action Judge 负责在执行前给决策分类,区分关键(Critical)、探索(Exploratory)、噪声(Noisy)三类;State Revision 负责从同一观测历史出发,直接改写噪声决策的推理-动作延续。推理框架 EditAct 把两者接进真实执行——它不是在旁边打分给建议,而是直接改变后续决策所依赖的状态。论文还用验证过的 EditAct 轨迹做拒绝采样微调(AEWM-RFT),不需要在线 AEWM 引导,在三个领域比 Self-RFT 高 2.2 到 2.6 分。
自报数字:判别器超基线 10.6 分,六基准平均涨 3.2-6.7 分
论文在 Search、Terminal、Software Engineering 三个领域通过 mid-training 加监督微调训练 AEWM。自报成绩单上,AEWM 在其 Action Judge 基准达到 70.5% macro-F1,比最强前沿基线高 10.6 分;EditAct 在六项基准、三种 Agent 骨干上的平均分比最强基线高 3.2 到 6.7 分。
需要说明,这些数字均来自论文作者自己的评测与基准,尚未见第三方独立复现,采信时建议保留归因措辞。
对做 Agent 工程的人意味着什么
这条路线的价值在于把纠错时机前移:传统做法是让错误发生、再靠重试或反思挽救;AEWM 则在错误写入历史之前就把噪声决策识别出来并改写。对上下文窗口越拉越长、任务链越来越长的 Agent 系统来说,历史卫生(history hygiene)可能比更大的模型更划算——毕竟污染是随步数累积的,而参数规模并不天然免疫污染。
另一个值得留意的信号:论文署名来自人民大学 RUC 团队(通讯作者 Wayne Xin Zhao、文继荣等),Agent 基础设施这个方向的学术产出正在向中国团队集中。
论文原文见 arXiv:2609.28416。所以呢:下次你的 Agent 在第 20 步引用第 3 步的错误假设时,先别急着换更大的模型——它可能只是需要一次状态编辑。