AI 智能体要在真实工作流里交付成果,需要的是能扎根在真实文件、又有可验证结果的训练任务。USTC 团队 9 月 30 日放出的 GraphForge 框架,把这两件事缝进了同一个证据图(evidence graph):既负责拼出任务的工作区,也负责为每条评分项(rubric)锚定能验证它需要的文件。
证据图同时管任务与评分
具体做法分四步。第一步是 occupation-grounded 种子,从一份职业画像出发(行政、会计、销售、运营等)控制任务的多样性;第二步为每个种子把真实文件组成工作区,文件之间的关系被建模为一张证据图,任务的文字要求和每条 rubric 都从图中生成,这样任务需求天然由工作区文件支撑,评分项也天然锚定到验证所需的文件;第三步先跑一次 rollout,目的是测试任务是否真能跑通,跑不通的就让 revision agent 对照原文件改任务和 rubric;第四步才去采轨迹做微调。
2169 条轨迹换来三基准齐涨
数据规模不大但效果很硬。GraphForge 论文给出的数字是:把 Qwen3.6-27B 在 2,169 条 GraphForge 轨迹上微调后,OpenHands 框架下 GDPVal 跑到了 1445.7,比基线高 65.7;Claude Code 框架下 Workspace-Bench-Lite 涨到 63.7 (+7.7),SpreadsheetBench II 涨到 24.0 (+13.7)。后续再做一轮 rejection fine-tuning,候选轨迹按证据图锚定的 rubric 筛选,三个基准还能继续涨。
这次结果指向的不是某个新模型本身,而是一类新数据/训练范式:训练工作智能体(working agents)的关键卡点是「任务真实 + 验证可信」,过去要么合成在 NLM 生成的假文件(缺真实性)、要么拼在真文件上但没有针对任务的验证器(结果质量无法保证),GraphForge 把这两面用同一张证据图钉死。这种「rubric 与文件同源」的思路,也呼应了最近一连串 agent 训练论文(Terminal-Universe、SkillGym、CompoWorld 等)在做的事:不再追求环境规模本身,而是追求环境与验证之间的可追溯关系。原始论文见 arXiv:2609.38923。
数据与权重都已开源
可公开的部分很全。USTC 团队在 Hugging Face 上放了 GraphForge 集合,里面包括 2,169 条 SFT 轨迹数据集 GraphForge-SFT-2169,以及两个 SFT 模型权重:GraphForge-Qwen3.6-27B-SFT 和更大一档的 GraphForge-Qwen3.6-35B-A3B-SFT(35B 总参/3B 激活的 MoE 变体)。作者署名里既有 USTC 体系下的研究组,也有原作者 Qisheng Su(groundhogLLM)署名的 Hugging Face 提交,加上 Tao Gui、X.F. Zhao 等知名 LLM 训练研究者。论文挂在 arXiv:2609.38923,HF papers #3 论文榜、144 upvotes,目前仍处于「学术 + 模型开源」双发布的早期阶段。
为什么这条工作值得产业读者关注
放到更大的语境里看,GraphForge 的实际意义是:在 GPT/Claude/Gemini 主导的「能聊能写」能力红利期过去之后,2026 下半年的 LLM 增量战场已经清楚地切到了「真能跑在能干工作里」的 working agents 这边 —— 而要让 working agent 真的工作起来,核心瓶颈不是更大的模型,是任务-验证闭环的真实度。GraphForge 给出的解法是证据图,与 Terminal-Universe 的「反向重建轨迹」、SkillGym 的「自动可验证环境」是同一条赛道上的不同切入点。对关注 agent infra 与训练数据的人,GraphForge 这一波是把「训练数据合成」从纯研究推到了可下载、可在 Qwen3.6-27B 上复现的实用阶段。