带参考答案去重新打分自己刚生成的推理轨迹——这类「特权自蒸馏」给长推理链提供了密集的 token 级监督,恰好是纯强化学习最缺的东西。但它有个已知病灶:老师视角的打分和最终验证器的对错判定是两套信号,一条看起来头头是道、最后算错的轨迹,照样能拿到高分离子,越蒸馏越自信。腾讯混元前沿团队(HY LLM Frontier)与宾夕法尼亚大学 9 月 3 日挂出 arXiv 论文 FlowBalance,修法很直接:让验证器决定方向,自教师只负责修正幅度。

机制:符号门控加轨迹能量

FlowBalance 建立在 FlowRL 的分布视角上。每条 on-policy 轨迹先由冻结的自教师(带参考解等特权上下文)重新打分,把 token 级对数概率增益聚合成轨迹级引导分数;再与验证器给出的组相对优势合成一个轨迹能量,教师项乘以优势的符号。门控逻辑就三行:轨迹被验证为正优势,教师打分照常加权;被拒绝的轨迹,教师压力整个反向;整组无对错偏好,教师项直接关闭。之后用带剖面的轨迹平衡去拟合能量重加权后的完整回复分布,每组 rollout 只需一次对数配分估计,不再需要单独的 token 级模仿损失。论文还给出了组内对比保持、最小改动 reverse-KL 表征等性质分析。

数字面:五榜均值与一个刺眼的对照

团队在五个数学推理基准上对比 GRPO、直接 OPSD、RLSD 与 FlowRL(180 步、五种子)。Qwen3-4B 上 FlowBalance 均值 64.26,较 GRPO +1.95;Qwen3-8B 上均值 67.61,+2.12,五个分榜全部拿到最优均值,AIME24 Pass@16 达 89.33。4B 侧并非全面领先:Minerva 一项由 FlowRL 领先(51.99 对 50.51)。最刺眼的对照是直接 OPSD:4B 上均值掉 8.19 分,8B 上直接崩到 41.16,较 GRPO 掉 24.33,响应长度同步坍缩——特权模仿压短推理链的病灶被量化得明明白白。训练动力学上,FlowBalance 约 100 步达到 0.5 AIME24 验证精度,GRPO 约需 143 步(1.43 倍提速),并在 400 步内保持稳定,而 GRPO 约 180 步后明显退化。消融显示验证器系数 15、教师系数 1 为峰值配置(五榜均值 67.61)。

多样性:不止答对,还要多路答对

团队用 GPT-5.5 抽取 AIME24 完整轨迹的数学表征与工具再聚类,只统计正确轨迹的 Simpson 策略多样性:FlowBalance 0.2194,约为 GRPO(0.1017)的 2.16 倍,也高于 RLSD(0.1456)。案例里同一道四面体题,常见解法走 Cayley–Menger 行列式,FlowBalance 的轨迹则识别出 41=4²+5²、80=4²+8²、89=5²+8²,把顶点嵌进 4×5×8 长方体用混合积算体积——两条路都得到答案 104。作者也明说这是单种子、LLM 评判的可控诊断,不是种群级保证。

冷水

全部数字为团队自报,第三方复现尚未出现;实验只覆盖数学推理与 Qwen3 两个规模,代码仓库刚放出(33 个 commit),社区关注还很低。这套方法迁移到代码、agent 等没有干净验证器的领域,成本要另算。但「验证器掌舵、密集信号只做修正」这个原则,给所有想混用 RLVR 与自蒸馏的团队指了一条清晰的路:先定对错,再谈打分。

参考: arXiv:2609.03241 (arxiv.org/abs/2609.03241);alexhuang13.github.io/FlowBalance-Blog;github.com/alexhuang13/FlowBalance