大家训练 agent 时都在拼命攒成功轨迹——跑对的任务留着蒸馏,跑错的直接丢掉。9 月 30 日挂上 arXiv 的 Agent Error Dataset(编号 2609.40111)反着来:把 50,228 对「错误-诊断」记录整理成数据集,专门研究失败轨迹怎么变成训练资产。论文开头一句话点题:一次失败的 rollout 所包含的信息,比它的最终 reward 多得多——观测、动作、环境响应,全都是可以复盘的证据。

数据集里有什么

规模数字相当扎实:50,228 对错误-诊断记录,来自 9,961 个源任务,覆盖 33 个环境、19 类 harness 框架、23 个策略模型,全部是文本交互式 agent 系统。去重后有 38,278 条独立源轨迹,平均每条带 1.31 份诊断——同一错误可以换视角反复重新诊断,原始 rollout 不用重跑。数据集还保留完整的执行元数据,支持跨设置做失败分析与再诊断。

五阶段流水线怎么造数据

配套的 AET(Agentic Error-to-Training)流水线分五步:先收集自然发生的失败,把基础设施故障和评分器 bug 剔出去,只留真正的 agent 错误;然后给每个错误定位失败步骤和责任方,诊断解释必须引用 trace 里的原文证据;第三步做结构与语义双重校验,被拒的提案也留档;第四步是重放——在同一个 checkpoint、同样的策略、预算与验证器设置下,让「执行修正方案」和「原动作重试」打对照;最后按诊断 SFT、恢复 SFT、动作偏好三类训练视图分别组织数据。

数字说话

对照重放共 3,062 组:首轮修正方案把验证器通过率从 18.4% 拉到 51.1%,净增 32.7 个百分点——同一个 checkpoint,只换成修正过的动作,通过率就是原来的 2.8 倍。用冻结的诊断版本微调 Qwen3-8B,模型对错误步骤的定位一致率从 47.2% 涨到 63.6%(三个种子平均,943 例留出集),而最强的提示词参考模型只有 54.7%。行为侧,只训修复动作比只训成功轨迹在 WebShop-lite 上高 6.67 个百分点;定位辅助的续跑通过率 31.3%,也高于泛泛重想的 26.0% 和纯重放的 18.6%。

冷水也得泼

第一,数据和代码还没放出来,论文写明「接收后」再开源代码、checkpoint 和数据,想上手的团队现在只能读论文;第二,行为侧 6.67 个百分点是单 seed 结果,作者自己标注了;第三,通讯作者 Heng Ji 署名机构是 Apodex,论文致谢了 Tianqiao Chen 的指导支持——这条产学路线的后续值得留意。

对行业的信号很直接:当大家把算力砸在合成成功数据上时,失败轨迹可能是被系统性丢弃的免费矿。修正方案 2.8 倍于原动作的通过率说明,「会认错」本身就是一种可训练的能力。问题留给读者:你的 agent 上线后,那些跑挂的 trace,现在存在哪里?

论文:https://arxiv.org/abs/2609.40111