9 月 24 日,arXiv 出现一篇 47 页长文:亚马逊 22 人团队把在开源基座 GLM-4.5-Air-Base(106B 总参 / 12B 激活 MoE)上的完整后训练配方公开,成品命名 Rufus-Air。数据、奖励、基础设施、逐阶段结果全部写透——后训练普遍当黑盒的年代,这是份少见的全透明材料。
骨架:八阶段串行流水线
后训练是一条串行管线:SFT → 推理 RL → 编码 RL → 指令遵循 RL → 通用 Agent → 编码 Agent → 搜索 Agent → RLHF,每阶段以上一阶段 checkpoint 为起点。排序原则有二:能力从基础到高级;奖励从硬可验证到软打分——先确定性,后 judge 软奖励,让策略晚暴露在 reward hacking 风险里。
SFT 数据规模很实:901 万样本、445 亿原始 token,遮蔽后实际监督 270 亿。仅这个 checkpoint 就已在 IFEval 领先官方版 5.3 分、IFBench 领先 24.2 分——作者反对把 SFT 当热身:它建立的是 RL 精修的地板。
阶段增量与诚实的负结果
难度过滤是实用抓手:解题率高于 0.8 的提示词当「太容易」丢,零通过的当「学不会」丢,训练只留中间可学习带。推理 RL 用 GSPO,GPQA 从 68.2 升到 73.5(+5.3),代价是 AIME 两个年度各降 2.6-2.8 分,作者坦承是主动取舍。编码 RL 把 LiveCodeBench v6 从 67.9 拉到 74.5。指令遵循 RL 用 GRPO,IFEval +4.0 到 94.5,GPQA(+3.2)基本不动。
Agent 三阶段信息量最大。通用 Agent 用 1 万个 MCP 任务、1000 个合成环境训练,MCP-Atlas +7.80、Tau2-Retail +9.80。编码 Agent 跑 Docker 沙箱加单元测试奖励,SWE-bench Verified 从 65.60 到 67.80,作者注明此阶段未训到收敛。搜索 Agent 面向开放网页,训练时最多 100 次工具调用,BrowseComp +3.0、Seal-0 +5.4。最终 RLHF 用开源奖励模型 Skywork-Reward-V2-Qwen3-8B,Arena-Hard v2 Hard Prompt 从 83.06 到 89.05。
对照与成色
同 harness 四模型对比下,Rufus-Air 在除 Arena-Hard v2 创意写作外的报告基准上全部领先官方 GLM-4.5-Air:IFEval 95.4 对 83.0,SWE-bench Verified 65.6 对 50.6。同基座的 INTELLECT-3 与 Nemotron-3、GPT-OSS、Qwen3.5 同表对照;作者读法:哪投入训练信号,产出就在哪移动。但官方版是 2025 年 7 月发布,基准代际更新后未重跑,对比含金量要打折扣。
所以呢
其一,信息不对称正被填平:MoE、agent 环境合成、RLHF 完整链路的全透明报告仍稀缺,亚马逊把「开源基座到成品」的工程路径标准化了一次。其二,美国大厂拿智谱 GLM-4.5-Air-Base 当训练地基,成品多基准反超官方版——开放权重的基座价值与后训练可塑性同时被验证,对中国开源生态是微妙信号。其三,跑分趋同时,可复现配方加负结果比刷榜更有长期价值。
开发者落点:8-32 节点跑完全部 RL 阶段,中等团队有了可照抄路径;沙箱每月约 1 万美元、搜索 API 按次计费,要单独预算。
参考:arxiv.org/abs/2609.29421 · hf.co/papers/2609.29421