蒸馏是训练小模型的标准操作:拿一个大教师模型的输出分布当监督信号,学生模型学得又快又好。但 9 月 1 日提交到 arXiv 的一篇论文给这条常识加了一个重要脚注:蒸馏的效果取决于用在哪个训练阶段——同一个配方,在预训练和中间训练(mid-training)两个阶段的行为完全相反。
现象:同一个配方,两个阶段,两种结果
论文(arXiv:2609.01532)聚焦 forward KL 蒸馏——知识蒸馏的标准形式,教师用的是经过后训练(post-trained)的模型。作者通过对照实验发现:
- 在预训练阶段,forward KD 相比标准的下一 token 预测(NTP),推理能力和事实记忆同时提升;
- 到了中间训练阶段——在精选语料上继续自监督学习的过渡期——推理能力继续涨,但事实记忆的习得反而被拖慢。
也就是说,蒸馏不是万能药,它有阶段依赖的副作用。
原因:教师置信度与学生知识状态错位
作者把这个现象追溯到两个因素的组合。一是教师在不同数据域上的置信度不对称:教师对程序性(procedural)数据比知识密集型数据更自信。二是学生的知识状态在训练中不断演化:学生其实较早就能获得低熵的事实知识。两件事叠在一起,导致 mid-training 期的蒸馏信号在事实知识上反而成了干扰。
Switch Distillation:看置信度下菜
修复方案出乎意料地简单。论文提出 Switch Distillation:只在教师置信的 token 上做蒸馏,路由信号用教师预测熵(teacher predictive entropy)这个轻量指标;其余 token 直接回退到交叉熵。等于给蒸馏装了一个开关——教师没把握的地方就别教。
效果方面,论文报告的数据:
- 相对标准 NTP,推理性能达到 1.61-1.71 倍,知识与常识达到 1.13-1.19 倍,同时保留 96.7-96.8% 的事实记忆;
- 跨不同教师规模,Switch Distillation 都优于现有蒸馏目标;
- 收益还能扛过后训练:post-training 之后,推理仍保有 1.25-1.32 倍、知识与常识 1.13-1.20 倍的提升,事实记忆的差距被抹平。
论文共 33 页、13 图 9 表,作者 12 人,包括 Luke Zettlemoyer 与 Wen-tau Yih;代码已开源在 facebookresearch 组织名下,仓库为 midtraining-distillation。
所以呢
这篇论文的价值不只是一个新损失函数,而是把"蒸馏"从一个笼统的词拆成了有阶段语义的操作:在越来越多团队采用 mid-training 环节的今天,无差别蒸馏可能正在悄悄伤害模型的事实能力。如果你的训练管线里已经有这一阶段,用教师熵做路由是一个几乎零成本就能验证的改进点。原文见 https://arxiv.org/abs/2609.01532 。