在推理模型的训练菜单里,on-policy 蒸馏(OPD)近一年被当成 RLVR 的替代品:RLVR 只在结果层面给稀疏的奖励信号,OPD 则由教师模型对学生自己生成的每一步打分,提供 token 级的稠密监督。听起来更精细,也更贵——你得在训练回路里一直挂着那个大教师。

教师的信号,可能比想象的更脏

普渡大学 Yi Ding 与 Ruqi Zhang 8 月 31 日挂在 arXiv 的论文(2608.31046)做的第一件事,就是量化这份监督的质量。结论有点尴尬:教师打分里存在大量噪声,而且教师规模越大,噪声占比越高。原因在结构上就埋好了——教师打分的是学生生成的轨迹,这些轨迹对教师而言天然是 off-policy 的,它在自己不熟悉的分布上打分,可靠性自然存疑。

但更反直觉的是第二层发现:学生对这些噪声几乎无感。把噪声监督保留或剔除,学生最终收敛到的性能差不多。

那提升到底从哪来?

作者继续拆,发现学习信号集中在低对数概率的 token 上;更狠的一刀是,把教师提供的优势换成一个固定的负优势值,性能居然追平。这指向一个不太舒服的解释:OPD 的收益,大部分来自「压制低概率 token」这个动作本身——而这个动作,根本不需要教师。

OPSA:把教师请出训练回路

顺着这个结论,论文提出了 On-Policy Self-Adaptation(OPSA):不用任何监督信号,用熵自适应的负优势,在高熵位置给更强的学习信号,压掉尾部 token,把概率质量摊回头部 token 上。论文报告的数据:以 Qwen3-1.7B 为基座,OPSA 在 AIME24 上把 Avg@32 提升 35.41 分(相对提升 263%),在全部三个基准上 Pass@32 翻倍以上,并比 OPD 本身在 AIME24 的 Avg@32 高出 16.77 分。论文还声明结论跨模型家族和任务成立,全篇 20 页、12 张图。

这篇论文目前排在 Hugging Face Daily Papers 榜首(截稿时 86 个赞),社区显然被「教师可能白请了」这个论点戳到了。

所以呢

对做训练的人来说,可操作的启示不是「马上扔掉教师」,而是先做消融:如果你的 OPD 收益大头来自压制效应,那教师推理预算就是在为一个人的工作付两个人的钱。对行业的隐喻则更冷一点——我们为「蒸馏」这个词支付的品牌溢价,可能远大于它实际传递的知识量。当然,这是单篇论文的结论,AIME24 这类数学基准的表现也不等于通用能力;但「固定负优势追平教师」这个实验本身,值得每个蒸馏叙事的相信者亲手复现一次。

论文:https://arxiv.org/abs/2608.31046