更强教师反而教不动学生:Lightning OPD 2.0 剥掉蒸馏中的“文风噪声”

大模型蒸馏有一个反直觉现象:换上能力更强的教师,学生不一定进步,甚至可能几乎学不到东西。 NVIDIA 团队最新论文 Lightning OPD 2.0 把问题定位到了一个长期被忽视的变量——教师和学生参考模型之间的“文风差”。

OPD 为什么会被文风带偏

在策略蒸馏(On-Policy Distillation,OPD)里,学生先生成推理轨迹,教师再对轨迹中的每个 token 给出密集监督。相比只在整道题结束后给一个奖励,这种方法反馈更细,也比大规模强化学习更稳定。Lightning OPD 进一步把轨迹和教师概率预先缓存,让训练不必一直在线调用教师。

但这套机制暗含一个条件:生成 SFT 示范数据的模型,最好也是后续提供 OPD 监督的模型。现实中这个条件经常不成立。SFT 数据可能来自多个模型,来源甚至不完整;团队也可能先用一个模型造数据,再选择另一个更强或更便宜的教师做蒸馏。

问题在于,token 概率差并不只代表“推理对不对”。它还混入了教师对措辞、格式、过渡语和推理节奏的偏好。一个教师不喜欢“Therefore”或某种分步格式,并不等于学生的推理错误;可原始 OPD 会把两者都当成纠错信号。文风差异在大量轨迹中反复出现,最终淹没真正有价值的推理监督。

Lightning OPD 2.0 怎么做

新方法没有尝试人工标注哪些 token 属于“风格”,而是利用一个统计特征:风格偏好往往会跨题目重复,推理错误则更依赖当前上下文。

团队把缓存轨迹按提示词分成多个折,在其他折上建立两组查找表:一组按 token 身份统计重复偏差,另一组按回答位置和参考模型的惊讶度统计粗粒度上下文偏差。两组估计取平均,再从原始教师—参考模型概率差中扣除。由于当前轨迹不会参与自己的偏差估计,这种交叉拟合避免了“拿答案解释答案”。论文也很谨慎:被扣掉的是可重复偏差的操作性代理,并不等于对风格 token 的完美语义分类。

数据说明了什么

实验使用 Qwen3-30B-A3B-Thinking-2507 作为跨教师,分别蒸馏 Qwen3-4B-SFT 和 Klear-Reasoner-8B-SFT。在 4B 设置中,Lightning OPD 2.0 把数学平均分从 48.3% 提到 51.7%,代码平均分从 32.6% 提到 35.7%;在 8B 设置中,数学从 73.6% 提到 74.6%,代码从 54.9% 提到 58.5%。其中 AIME 2024 达到 82.4%,LiveCodeBench v5 达到 63.0%。

更关键的是机制验证:以 1 nat 偏差为阈值,校正后异常 token 占比在两组实验中分别从 8.14% 降到 3.85%、从 7.19% 降到 2.02%。这说明方法确实在把跨教师信号拉回更接近一致教师的方向,而不只是偶然刷高了几个榜单分数。

真正的行业意义

这项工作最有价值的地方,不是再发明一个蒸馏缩写,而是把后训练流水线里的模型耦合拆开了。以后团队可以保留已有 SFT 数据,同时独立选择更合适的蒸馏教师,不必每换一次教师就重新生成示范、重跑 SFT。

当然,结论目前只覆盖两个 Qwen 系模型组合、数学和代码任务,作者承诺的代码也尚未发布。跨 tokenizer、跨模型家族以及更开放任务能否复现,仍需验证。

但方向已经很清楚:后训练竞争不再只是挑一位“最强教师”,而是设计一条不把能力信号和表达习惯混在一起的教学通道。模型会不会教,正在变得和模型会不会答同样重要。