[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-0bf07f31-ca28-49f1-b296-c1b5e56d200d":3},{"id":4,"title":5,"summary":6,"original_url":7,"source_id":8,"tags":9,"published_at":20,"created_at":21,"modified_at":22,"is_published":23,"publish_type":24,"image_url":13,"view_count":25},"0bf07f31-ca28-49f1-b296-c1b5e56d200d","MOPD 把多领域 RL 教师塞进同一个学生：小米\u002F北大发布的能力集成 post-training 新范式","背景：现代大模型 post-training 几乎都依赖强化学习来压出特定能力,但把代码、数学、推理、对话等需求同时塞到同一个模型里顾此失彼。现有的 Off-Policy Finetune、Mix-RL、Cascade RL、Param-Merge 等方案要么效率低,要么在某个领域掉点,权重和数据耦合太深,工程上难并行推进。\n\n核心方法：小米 LLM-Core 团队联合北大发表在 arXiv:2606.30406 的 MOPD(Multi-Teacher On-Policy Distillation)另辟蹊径,先对每个领域独立跑 RL 得到一组领域教师,然后让学生在自己产生的 rollouts 上,用 token 级 stop-gradient 的蒸馏优势 46804 Â_t = sg[\\log \\pi_{teacher}(t) - \\log \\pi_{student}(t)] 46804 反向更新。这一招同时解决两件事:消除 exposure bias(学生学的是自己真实分布下 rollouts 上遇到的 token,不再是离线数据集上分布外的样本);保留密集优化信号(token 级差异即时可用,不必等整个 episode 拿回报)。\n\n数字结果:在 Qwen3-30B-A3B 上,MOPD 全面超过 Mix-RL、Cascade RL、Off-Policy Finetune 和 Param-Merge 基线,继承每个教师 91–95% 的能力,且多个领域教师可并行独立开发,工程效率显著提升。\n\n落地:MOPD 已被小米 MiMo-V2-Flash 技术报告规模化部署,最近韩国 Upstage 的 Solar Open 2(250B 总参 \u002F 15B 激活)直接把它用在 agent 训练环节;NVIDIA NeMo-RL 在 nightly 版本里把 MOPD 集成为原生算法,advantage estimator 选 opd,异步 GRPO + NeMo Gym 走 agent 多轮交互流水线。\n\n评论:过去很多人把 on-policy distillation 当成「用 teacher logits 训学生」的同义词,MOPD 把它重新定义成「用 teacher 对学生自己 rollouts 上每个 token 的概率差构造 advantage」。这本质上是在做 reverse-KL 最小化,但不需要 teacher 输出完整词表,工程友好很多。对国内做 agent 的团队来说,这意味着可以同时养几个专项教师,再蒸馏出一个统一底座,而不是痛苦地做模型融合。","https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.30406","7437aeb9-930c-4866-a2e9-48003c1a792b",[10,14,17],{"id":11,"name":12,"slug":12,"description":13,"color":13},"5e628969-6d2a-437f-998a-104e4b16cfb1","ai-progress",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"0ef8513a-0a26-42f0-b6f9-5b6dadded45c","efficiency",{"id":18,"name":19,"slug":19,"description":13,"color":13},"01598627-1ea6-4b27-a5d8-874971571a71","llm","2026-07-24T08:00:00Z","2026-07-24T00:07:47.357191Z","2026-07-24T00:07:47.357199Z",true,"agent",3]