AgentOPSD:用递归贝叶斯信念,让 GRPO 在多轮 Agent 上学会区分「关键 turn」与「走过场 turn」
1. 多轮 Agent RL 的老问题:trajectory 优势被广播,长 horizon 必然失真
近一年 GRPO 系列工作已经稳定把「RL with verifiable rewards」推到了 LLM 数学、代码、GUI、Web 自动化与多模态搜索等场景。但只要任务变成多轮 agent 交互,稀疏 terminal reward 就会让信用分配变得格外困难。GRPO 在每个 group 内把序列级 advantage A_seq 直接广播到所有 token;长轨迹里「关键决策」和「例行公事」被同一信号驱动,模型当然学不到「哪一步决定胜负」。GRPO+OPSD、Skill-SD、RLSD、SDAR、StepOPSD 等近期工作都试图把 teacher-student 的对数概率差嵌进优势,但它们的共同假设是:turn 之间是独立的,单点的 local gap 就能代表 sequential credit。
2. AgentOPSD 的核心思路:local gap 不是 sequential credit
来自清华(Zi-Han Wang、Jinyang Wu 等)、浙大(Zhengxi Lu 等)和美团(Qi Gu、Xunliang Cai 等)的 AgentOPSD(arXiv:2608.05987)把这件事拆到三步:
- 把 token 级 teacher-student log-prob gap 聚合成 turn 级 evidence:在每个环境切换边界求和,得到 e_k = log π_θ(a_k | s_k, c⁺) − log π_θ(a_k | s_k),其中 c⁺ 是训练阶段从 SkillRL SkillBank 里按关键词检索出的私有 skill 描述;
- 递归更新成功信念 B_k:用 group 内成功率 R̄ 当先验 B_0 = clip(R̄, ε₀, 1−ε₀),按 c_k = γ c_{k-1} + e_k 在 log-odds 空间累加,B_k = σ(logit(B_0) + c_k);
- 用边际变化 ΔB_k = B_k − B_{k-1} 替代原始 gap:再叠上 outcome 符号 sign(A_seq) 得到 q_k,做 bounded multiplier w_k = clip(1 + b·z_k, 1−b, 1+b) 重塑优势。
文章核心论点就一句话:「一个孤立的 local gap 不足以成为 sequential credit,真正决定 credit 的是该 gap 在历史累积信念上的边际变化。」 这条思路不依赖 critic、value network 或额外 rollout,代价只是一次额外的 teacher forward pass。
3. 主要数据:三个环境、两个尺度,全部刷掉 GRPO 与 5 个自蒸馏基线
在 Qwen2.5-7B-Instruct 上,AgentOPSD 把 ALFWorld 平均成功率从 GRPO 的 81.2% 拉到 89.1%,WebShop Score 从 80.9 拉到 90.2、Accuracy 从 72.6 拉到 79.7;Search-QA 在 Qwen2.5-3B 上的平均分从 GRPO 的 36.4 升到 46.7。更关键的是 horizon 越长 AgentOPSD 越能扛:ALFWorld 上把「每多一个 turn 损失的成功率」压到 −0.54pp,而 RLSD 是 −3.59pp、GRPO 是 −2.91pp,差距是数量级的。
机制消融表(Table 2)验证了四个组件缺一不可:把 recursive 改成 raw local gap e_k 直接掉 6.3 点;把 outcome sign 去掉掉 8.6 点;把经验先验 B_0 去掉掉 10.2 点;把 turn-level 聚合换成 per-token 掉 3.2 点。这组消融把「为什么是 recursive belief 而不是 score averaging」讲得很死。
4. 工程侧值得注意的三件事
- 超参只有 λ、γ、ε_high 三个,λ=0.5、γ=0.95、ε_high=0.24 在 ALFWorld / Search-QA / WebShop 三个环境都跑得稳;γ 在 0.8~1.0 之间结果只差几个点,说明「近期 turn 比远期更重要」是软信号不是硬约束。
- 代码与训练脚本即将开源(
github.com/ZethWang/AgentOPSD,Apache-2.0 协议),基于 8×H800 训练 Qwen2.5-3B/7B-Instruct,门槛对工业界很友好。 - 不与 GiGPO 互斥:GiGPO 用重复 anchor 估计 step 级 advantage,AgentOPSD 用 self-distillation 估计 evidence;前者是 reward-side credit,后者是 signal-side credit,理论上可以叠加。
5. 所以呢
如果你在做多轮 agent 训练(尤其是 Web 自动化、GUI、SearchQA、ALFWorld 这样的长 horizon 任务),AgentOPSD 给的是「不用引入 critic,就能把 group-relative RL 的均匀优势信号拆成 turn-level dense supervision」的工程答案。它背后那套「把 credit 当成 belief revision 来做」的视角,也给 OPSD 系列后续工作(RUDDER、VinePPO、process reward model)提供了一种更轻的解释。
但也别被「Qwen2.5-3B 也刷到 84.4%」这种数据带偏:它仍然依赖 SkillRL 的私有 skill 检索作为 teacher 分支,自部署团队需要先把技能库搭起来,这一层的工程量没在论文里展开。
资料来源:AgentOPSD 原论文 arXiv:2608.05987(Zi-Han Wang 等,清华+浙大+美团,2026-08-06 v1);代码仓库 github.com/ZethWang/AgentOPSD;对比基线 RLSD、SDAR、StepOPSD、GRPO+OPSD、Skill-SD、OPSD、Skill-GRPO 均出自同一论文 Table 1。