把视频静音,你能答对几成?反过来,只听声音不看画面呢?对人类这是两道送分题,对当下号称「全模态」的大模型,却是一片测试盲区——多数基准把音频、视觉拆开单独考,音视频必须一起用才能解的题,长期没有专门的评测和训练方法。Qwen 团队 9 月 30 日提交到 arXiv 的 OmniReasoning,就是冲着这块空白去的。
基准:音视频证据缺一不可
论文的第一件事是把「联合」变成硬约束。OmniReasoningBench 收录 1,150 道选择题与开放题,分两大任务:一类是「对视频内推理」,另一类是「超越视频推理」。题目设计的底线是:音频和视觉证据缺一不可,单看任何一边都答不出来。这直接戳破了「分开考再相加」的传统测法的漏洞。
数据引擎:带时间戳的线索链
光有基准不够,还得会造训练数据。团队构建了 OmniQA 数据引擎,自动生成「证据落地」的问答对——每道题都显式依赖音视频联合推理,并附带带时间戳的线索链,用来引导思维过程的标注。引擎产出两套数据:OmniReasoning-SFT-112K(监督微调)和 OmniReasoning-RL-19K(强化学习)。
MFSD:把功劳算到每个模态头上
方法层的核心叫 Modality-Factored Self-Distillation(MFSD),一种在策略自蒸馏:对每个采样回复,分别在「单模态线索上下文」下评估,把单个线索的贡献和跨模态交互拆开,做 token 级的功劳分配。直白说:模型答对了,得说清是听出来的还是看出来的。
42.5%:涨得猛,但仍在深水区
结果摆在一起看:基于 Qwen3-Omni-30B-A3B-Thinking 训练的 OmniReasoning-30B-A3B,在 OmniVideoBench 拿到 50.0%,在 OmniReasoningBench 拿到 42.5%,较基座分别提升 12.8 和 9.3 个百分点,在 Video-MME-v2 等通用长视频基准上也有增益。但换个角度:自家针对性训练后的模型,在自家基准上也只答对不到一半——音视频联合推理不是「多做点数据」就能通关的赛道,线索交织时的功劳分配仍是硬骨头。
这篇论文对普通开发者的启发很直接:做多模态应用时,别急着堆参数,先检查你的评测是不是把模态拆开考了——拆开考的高分,在真实音视频场景里可能一文不值。
参考:arXiv:2609.39490(摘要页);Hugging Face Daily Papers(论文页,10 月 6 日作者自荐上榜,12 个 upvote)。