SWE-Pruner Pro:ByteDance 让 Agent 自己当剪枝器,省 39% token 还涨分

多轮编程 Agent 跑长任务时,上下文里 80% 是工具返回的「无用行」——测试日志、报错堆栈、diff 残留。SWE-Pruner Pro 反直觉:哪些行该删,Agent 自己的中间层表征已经知道,根本不需要外挂分类器。\n\n字节 Seed 这篇 arXiv(2607.18213)在冻结 Coder LLM 上挂小剪枝头,把 Agent 阅读工具输出时的 hidden state 映射成「行级 keep/prune」决策,叠 length-aware embedding 区分不同长度工具块。在 MiMo-V2-Flash 等两个开源 backbone、四个多轮基准上几乎不增加推理延迟就省下最多 39% 的 prompt+completion token,SWE-Bench Verified 求解率 +3.8pp,Oolong 长上下文准确率 +2.2pp。\n\n意义在范式转移。之前所有上下文压缩方法都默认「需要独立判定模型」,Pro 用 Coder 自身表征证明这是多余假设——Agent 已是「上下文相关性」最优判断器,只是没人把这层信号读出来。代码已开源,下一步:能否搬到通用 Agent。