视频多模态模型的强化学习后训练,长期卡在一个成本结构上:GRPO 这类方法要在每个 prompt 上采样一组 on-policy 回答、再靠长思维链(CoT)生成撑起样本质量,训练一步的耗时达到 SFT 的 4.9 倍,而大量数据集标注只被用来给 rollout 打分,信息利用率很低。南开大学 HVision-NKU 团队的论文 OraRL 把这块最便宜的资源直接搬进了优化过程:标注本身就是一个"oracle rollout",可以直接作为正向优化目标参与更新(arXiv:2608.20492)。

标注的新角色:从打分器变成优化目标

传统流程里,标注的用途是给模型生成的 rollout 评分,当"裁判"。OraRL 的做法是把序列化后的标注直接追加进同一 prompt 的策略样本组,作为一个高奖励的示范轨迹参与更新,同时策略样本仍然保留 on-policy 基线。

直接塞进去会踩一个论文命名为 advantage inversion(优势反转)的坑:标注奖励很高,把它算进组均值会抬高 baseline,把本来优势为正的 rollout 翻转成负的。OraRL 的解法是解耦优势估计——组基线只用策略样本的奖励来估,标注与策略之间的奖励差单独调制一个方向增益和一个 detach 的标注优势。论文给出的数字是:优势反转比例从 22.4% 降到 1.9%,再经过符号均衡剪枝后只剩 0.3%。

效率账:训练与推理两端一起降

符号均衡剪枝每轮只保留标注 rollout 和每个符号下最强的少量样本,换来训练步时从 92.5 秒降到 62.4 秒(1.48 倍提速),峰值单卡显存从 62.4 GB 降到 50.9 GB。整个更新流程的开销只有 SFT 的 2.2 倍,不到 GRPO+CoT(4.9 倍)的一半。

推理端的收益更直观:不需要 CoT 解码之后,Video-ORA-9B 对十分钟、2fps 视频的答案解码中位时延从 4.78 秒降到 130 毫秒。9B 权重在单张 H20 上以 BF16 加载占 17.6 GiB,4B 版本 8.6 GiB,官方给出 vLLM 0.19.1 的部署命令,一套更新规则覆盖时序定位、空间定位、分割、跟踪、时空定位、视频问答、空间智能七个任务族。

9B 的成绩单

在论文的三基准空间智能宏平均上,Video-ORA-9B 把此前最优从 51.0 提到 56.1;VSI-Bench 上拿到 73.1,对比 GPT-5 的 55.0 和 Gemini-3-Pro 的 55.1。时序定位 mIoU 从 62.5 提到 66.0,目标跟踪 AO 从 73.0 提到 78.2,分割从 64.3 提到 70.4。方法在 0.8B 到 9B 的模型规模和最多 10 万 prompt 的数据规模上都保持了扩展性。

开源程度

代码以 Apache-2.0 许可开源,基于 veRL 构建了统一视频契约的多模态训练管线(vLLM rollout + FSDP 更新);4B 和 9B 两个 checkpoint(骨干为 Qwen3.5)和 OraRL-Data 数据集都放上了 Hugging Face。

所以呢——这篇论文真正值得记的点不是又一张跑分表,而是它把"标注=数据"这个 RL 时代最被浪费的资产重新接回了训练循环,而且是在不加 CoT 的前提下。当行业默认"高质量推理必须先长链思考"时,一条不需要思考链、130 毫秒出答案的路线,对视频理解这种时延敏感的场景,可能才是更接近落地的方向。

参考:arXiv:2608.20492 / github.com/HVision-NKU/OraRL