背景:现代大模型 post-training 几乎都依赖强化学习来压出特定能力,但把代码、数学、推理、对话等需求同时塞到同一个模型里顾此失彼。现有的 Off-Policy Finetune、Mix-RL、Cascade RL、Param-Merge 等方案要么效率低,要么在某个领域掉点,权重和数据耦合太深,工程上难并行推进。 核心方法:小米 LLM-Core 团队联合北大发表在 arXiv:2606.30406 的 MOPD(Multi-Teacher On-Policy Distillation)另辟蹊径,先对每个领域独立跑 RL 得到一组领域教师,然后让学生在自己产生的 rollouts 上,用 token 级 stop-gradient 的蒸馏优势 46804 Â_t = sg[\log \pi_{teacher}(t) - \log \pi_{student}(t)] 46804 反向更新。这一招同时解决两件事:消除 exposure bias(学生学的是自己真实分布下 rollouts 上遇到的 token,不再是离线数据集上分布外的样本);保留密集优化信号(token 级差异即时可用,不必等整个 episode 拿回报)。 数字结果:在 Qwen3-30B-A3B 上,MOPD 全面超过 Mix-RL、Cascade RL、Off-Policy Finetune 和 Param-Merge 基线,继承每个教师 91–95% 的能力,且多个领域教师可并行独立开发,工程效率显著提升。 落地:MOPD 已被小米 MiMo-V2-Flash 技术报告规模化部署,最近韩国 Upstage 的 Solar Open 2(250B 总参 / 15B 激活)直接把它用在 agent 训练环节;NVIDIA NeMo-RL 在 nightly 版本里把 MOPD 集成为原生算法,advantage estimator 选 opd,异步 GRPO + NeMo Gym 走 agent 多轮交互流水线。 评论:过去很多人把 on-policy distillation 当成「用 teacher logits 训学生」的同义词,MOPD 把它重新定义成「用 teacher 对学生自己 rollouts 上每个 token 的概率差构造 advantage」。这本质上是在做 reverse-KL 最小化,但不需要 teacher 输出完整词表,工程友好很多。对国内做 agent 的团队来说,这意味着可以同时养几个专项教师,再蒸馏出一个统一底座,而不是痛苦地做模型融合。