多模态后训练里,蒸馏和强化学习通常被当成前后相接的两个阶段:先蒸馏打底,再 RL 冲分。字节跳动团队的 Pistis 技术报告给出了不同答案——IDRL(Interleaved Distillation and Reinforcement Learning)把两件事放进同一个训练循环,交替进行,而不是串行接力或静态加权求和。

先看模型本身

Pistis 家族包含 27B 和 9B 两档多模态模型,分别构建在 Qwen3.6-27B 和 Qwen3.5-9B 之上。每档又拆成两个变体:Pistis-Thinking 主攻深度多模态推理,Pistis-Agentic 额外吃进智能体轨迹数据,面向长程规划、迭代推理和工具调用。SFT 阶段用了约 320 万条多模态 QA 对,其中智能体轨迹按工具集成推理约 40%、搜索约 20%、通用智能体约 40% 配比。

成绩上,24 个非 grounding 基准里 Pistis-27B-Thinking 与 Qwen3.8-27B 打平(82.3 对 82.4),但 grounding 均分拿到 80.5,高出 Qwen3.8-27B 8.6 分。Agentic 版本的多模态搜索尤其突出:相对 Qwen3.6-27B,BrowseComp-VL、MMSearch、VDR-testmini、LiveVQA 分别提升 8.8、3.3、3.2、9.7 分。

IDRL:不是加权,是轮班

核心思路一句话:RL 让策略向高奖励输出收敛,熵下降;在线蒸馏把学生拉回教师分布,保住熵。两个目标在同一步里直接相加,梯度会打架——论文给出了推导:当学生对某个 token 已经比教师更自信时,两项贡献方向相反,合并更新甚至可能让奖励目标不增反降。IDRL 的做法是按周期轮换,比如每周期 OPD 和 RL 各 5 步,每一步只优化一个目标;等熵进入平台期,再切换到纯 RL 收尾。9B 版本用 IDRL,27B 版本用纯 RL,并且顺手当 9B 的蒸馏教师——27B-Thinking 是 9B-Thinking 的老师,27B-Agentic 教 9B-Agentic。

长程智能体任务还有个专属设计:PAS(步级正优势抑制)。轨迹级奖励只看最终成败,容易让「侥幸成功」的废动作拿到正分。Pistis 把被拒绝的、重复的、答完题还在调工具的无效中间步骤的正优势直接清零,失败轨迹里照样保留惩罚,信用分配干净了不少。

PAH:不改参数,优化 harness

报告还有个系统层彩蛋:PAH(Pistis-Auto-Harnessing)。模型和工具接口冻结,优化的对象是外层 harness——一个 Optimization Agent 在开发集上跑五阶段闭环:归因失败、提出一个可证伪的修改、实现、金丝雀验证、全量评估,开发指标不涨就回滚。最终产物包含 Candidate Ledger(结构化候选账本)、按需加载的 Search Skills、证据驱动的检查点和预算感知收敛,在 VDR-testmini 上验证有效,而且没有增加交互预算。

所以呢

IDRL 的价值不在「蒸馏 + RL」这个组合本身,而在「怎么组合」:交替而非加权,本质是把两个方向相反的梯度目标在时间轴上错开,让熵成为可再生的探索资源。对做后训练的团队,这是一份可复用的调度方案;对围观者,值得记住的信号是:后训练的竞争已经从「用什么数据」前移到「怎么编排训练信号」,harness 本身正在变成优化目标。(arXiv:2609.28554)