终端代码 agent 越普及,一个资源错配就越显眼:agent 干活的完整记录——轨迹——在批量积累,而 agent 后训练真正稀缺的素材「可执行环境」却始终造不出规模。9 月 3 日提交到 arXiv 的 Terminal-Universe(2609.04148,来自 Qwen 团队等机构的 14 位作者)给出了一个反向思路:环境不必凭空生成,它就藏在旧轨迹里。
论文的判断很直接:环境才是 agent 后训练需要的东西——一个环境可以反复查询、派生出多个可验证任务,还能提供执行反馈;而轨迹只是一次冻结的演示,用一次就废。
轨迹是环境的压缩包
Terminal-Universe 的核心观察是:轨迹里记录的工具执行历史,本身就暴露了它当初运行环境的结构与内容。既然如此,环境可以从轨迹反向重建。做法分两步:第一步,重放轨迹中记录的文件操作,把每个文件恢复到 agent 修改之前的状态,得到一个残缺工作区;第二步,派一个补全 agent 补齐缺失的文件和依赖。在复原出的工作区上,既能重建原始意图任务,也能合成全新任务。
广度与深度两条扩展轴
光有环境还不够,论文沿两个方向扩任务。广度上,在相关环境之间挖掘有向依赖关系,合成跨多个代码库的 cross-workspace 查询——对应真实开发里「改这个库还得看那个库」的常态。深度上,把单轮查询扩成多轮会话,由一个用户 agent 模拟迭代的用户反馈与需求变更。
数字盘点
应用到公开终端 agent 轨迹上,该框架产出 37.3k 个「任务充分」的环境。在这批语料上对 Qwen3.5-27B 做监督微调,Terminal-Bench 2.1 单轮成绩提升 11.9 分,EvoCode-Bench v2 MT@4 多轮成绩提升 13.8 分。论文发布次日即登上 Hugging Face Daily Papers 当日第一,拿到 182 个 upvote。
值得注意的三点
一是轨迹可能是 agent 时代最被浪费的资产。各家团队都在攒轨迹,SFT 用完一次就扔;这篇工作证明轨迹是环境的「压缩包」,能反向解出可复用、可再出题的工作区。二是真实性优势:文件结构来自真实运行过的环境,不是模型凭空想象,比从零生成环境的路线少了一层幻觉风险。三是接口意义:可重复查询加执行反馈,恰好是把训练从 SFT 推向 RL 所需的闭环条件——论文本身只做了 SFT,但地基明显指向更远处。
对正在积累海量 agent 日志的团队来说,这篇论文的启示很实际:你的轨迹库里可能已经躺着一批免费的环境,只是还没人去解压。