在线蒸馏(On-Policy Distillation,OPD)正在成为后训练阶段的流行加速手段:冻结的教师模型在学生自己生成的轨迹上提供 token 级稠密监督,比只看最终对错的稀疏信号高效得多。但 9 月 2 日提交到 arXiv、9 月 8 日登上 Hugging Face Daily Papers 的 TGOPD 论文,点破了一个被普遍忽视的盲点:vanilla OPD 对所有提示一视同仁地施加教师监督,从不检查教师在这个提示上究竟靠不靠谱。
自信的错误教师,比没有教师更糟
论文的核心观察基于一个数学性质:OPD 常用 reverse KL 作为目标,而 reverse KL 是 mode-seeking 的——一个「自信但错误」的教师会诱发强而误导的参数更新。熵、师生似然一致性这类分布式代理指标只能度量不确定性或一致性,并不能直接验证结果对错:它们能识别教师「不确定」,却识别不出教师「笃定地错」。
提示级门控怎么建
TGOPD(Teacher-Gated On-Policy Distillation)把做法概括成「先验证,再蒸馏」:先用一组经过验证器打分的教师探针,估计教师在当前提示上的可靠性;通过检查的提示走稠密 OPD,未通过的提示改走 verifier-grounded GRPO,两条路径互斥。这样一来,「教师是否可信」从默认假设变成了显式检查项。
两个层面的收益
实验覆盖 4B 与 35B 两档学生模型,横跨数学、代码、指令遵循三个域。论文报告:单域训练的全部六个设置中 TGOPD 均优于 Vanilla OPD;多域训练下,两个规模的学生都拿到更高的七基准平均分。更实际的是算力账——异步 OPD 里教师节点大量时间在闲置,把可靠性估计安排进这段空闲容量,实测 4B 单域训练中教师节点 GPU 利用率从 9.8% 提升到 78.9%,门控几乎是免费的。
所以呢
这篇论文真正值得带走的不是一个新训练技巧,而是一条工程原则:稠密监督的准入应当有验证条件。信号越密,越要问一句来源是否可靠——对蒸馏如此,对 RLHF 里的奖励模型、Agent 工作流里的工具反馈同样如此。「可靠走蒸馏、不可靠走强化学习」这种按可信度路由监督源的思路,大概率会在更多后训练管线里复现。论文原文见 arXiv:2609.02998。