跑过长时间任务的 Agent 都会遇到同一件事:每一步的思考过程被原封不动地堆进上下文,任务还没做完,历史推理已经吃掉了大半窗口。更麻烦的是,这些推理在对应的动作执行完、环境反馈也拿到之后,大部分就再没被用过——但它们依然占据着每一轮请求的输入,缓存、计费、延迟全都跟着涨。静态的思维链压缩解决不了这个问题,因为 Agent 的推理不是写完就定的文本:改掉第 t 步的推理,第 t+1 步的工具调用、观察和后续决策全都会跟着变。arXiv 9 月 24 日的 30 页论文《When Can Agents Forget Their Reasoning?》正面回答:什么时候,Agent 能安全忘掉已执行过的推理。
用熵当手术刀,免训练在线删
论文提出的方法叫 ICLR(Interaction Aware Compression for Long Horizon Reasoning,和那个顶会缩写撞名,算论文自带的梗),核心思路出奇地朴素:在每一轮交互结束后,把新产生的推理切块,交给一个冻结的代理模型打分——低熵的块删掉,动作、工具调用和环境观察一律保留。全程无需微调,直接嵌进真实的 Agent 交互循环,压缩后的历史写回持久层,后续所有模型调用都在改过的轨迹上继续跑。判断标准很直觉:低熵意味着模型对这些内容很有把握,大概率是重复确认和程序性叙述;高熵的部分往往对应真正的分叉决策。
260 个任务:奖励涨了,token 降了
在 260 个 WorkBuddyBench 任务(覆盖代码、办公、安全、网页四个域)上,底座模型为 DeepSeek-V4-Flash:平均奖励从 0.699 升到 0.718,同时输入 token 减少 25.5%,输出 token 减少 14.4%,缓存读 token 减少 33.3%,总 token 从 2.69M 降到 2.19M。逐任务看是 102 胜 76 平 82 负。最有意思的是分域表现:安全域大涨 22.9 分,办公域和网页域基本持平,唯独代码域掉了 6.4 分——删推理不是免费的午餐,在需要精读历史的场景里,熵值排序也会误伤关键上下文。
轨迹放大:删 10%,省下 60%
论文里最反直觉的发现叫「轨迹放大」(trajectory amplification):局部删除量和系统总算力节省完全不成比例。随机删 10% 的推理 token,总输入降了 60.5%;随机删 20%,反而只降 44.0%。原因在于,对推理历史的任何局部改动都会改变后续的工具选择、观察内容和恢复行为,进而放大成整条轨迹的变化——「删多少」和「省多少」之间是非线性的。这也说明 Agent 推理压缩是闭环决策问题,不是文本编辑问题。
真正的结论:推理是工作记忆,不是档案
论文用三组实验收尾。表征探针显示,当前上下文边界的隐状态里确实编码了「这段推理将来还要不要用」的信号,AUROC 达到 0.844。轨迹分析给出了更实用的规律:当任务关键状态只存在于推理里时,未来行为风险率是 67.3%;一旦这些状态被外化成代码、文件、工具输出或环境反馈,风险率降到 36.2%。受控干预更直接:代码写进磁盘之后再清掉后续推理,得分纹丝不动;而把环境反馈藏起来,Agent 会多发一次 Bash 调用、重新观察同一个报错。结论一句话:历史推理的价值取决于「任务相关信息存在哪里」——它还是唯一载体时很值钱,外化之后就变成可丢弃的工作记忆。
对工程团队的启示:与其纠结上下文窗口还能再买多大,不如先把 Agent 的产出沉淀到文件和工具输出里,再配一个熵值门卫按时清理低熵推理。窗口不够用的解法,可能不是更长的窗口,而是更干净的遗忘。参考:https://arxiv.org/abs/2609.29875