挂在 HF 论文页 Qwen 徽标下的新论文 OmniVChat 把这条管道直接拆了。视频通话里的 AI 助手,多数还在走间接路线:音频先过一遍语音识别,画面先跑一层字幕或描述,拼成文字再喂给大模型。而这篇论文定义的 OmniVChat 任务是——Omni 模型同时接收用户的音频和视频,直接回文本;问题就藏在音视频本身,没有单独的文字提问,没有外挂字幕,也没有语音识别转写。论文的判断是:直接吃音视频,既减少外部件带来的延迟和计算量,也保住了语调、表情这类原始感知线索(arXiv: https://arxiv.org/abs/2609.21465)。

任务好定义,数据是死穴

原生音视频对话的麻烦不在架构,在素材。论文点破两个现实约束:一是真实素材稀缺,普通人对着自己设备录制的对话数据几乎找不到;二是评分难,一个好的回答往往要结合用户周围环境、面部表情和手边物体,而同一个意思有成千上万种说法,关键词匹配式评分在这里基本失灵。研究团队的应对思路是「为理解而生成」:让生成系统去造对话,拿合成数据做训练和评测。顺带一提,这是篇 18 人合作论文,README 机构脚注列了港中文、阿里 Token Hub、上海交大、上海创新研究院和浙大。

四个 agent 造数据,2800 条对话进基准

造数据的是 OmniVChat-Studio,一个多智能体数据引擎:Director 管文本进出,Renderer 把通过的 prompt 渲染成音画同步的片段,Reviewer 给结果配说明并写质量报告,确定性 Validator 按规则卡脚本。仓库 README 显示,基准 OmniVChat-Bench 共 2800 条对话,其中 2550 条单轮、250 条多轮,覆盖 5 大能力类:对话状态与链路感知(DSLP)900 条、多模态实体对齐(MEA)900 条、模型自我认知(MSA)450 条、反幻觉(AH)400 条、情绪识别(ER)150 条,合计 17 个子类、22 个场景域、13475 条分层评分细则。语言上英文占 63.1%、中文占 36.9%;媒体文件是 3490 个 1080p mp4、约 28 GB,用户的语音就是视频自带音轨(GitHub: https://github.com/HarlandZZC/OmniVChat)。

RL 奖励:同一个量尺,训练和评测共用

训练侧的 OmniVChat-RL 用一个公式同时约束正确性、效率和风格:R(y) = r(y) + λ_fmt·f(y) + λ_eff·e(y) + λ_sty·s(y),其中 r 打正确性,f 管格式,e 管效率,s 管风格;README 给出的模板默认 λ_fmt=0.5、λ_eff=0、λ_sty=0,奖励范围 [0, 1.5]。一个值得注意的工程决策:评测打分器和训练奖励共用同一个量尺——评测代码 eval/score.py 直接从 reward/reward.py 导入 rubric 核心,量尺只有一份定义。但 README 同时强调,训练奖励均值和基准分不在同一量纲上,两个数不能直接对比。

sim-to-real:合成数据练出来的,真人测试也涨

验证环节才是这篇论文的关键证据:用 OmniVChat-RL 在合成对话上训练 Qwen3-Omni-Instruct 后,模型在 OmniVChat-Bench 和真人录制的 OmniVChat-Bench-Human 上都拿到了提升——合成数据训出来的能力能迁移到真实对话的训练与评测,这正是一作在 HF 评论区总结里强调的 sim-to-real 迁移。

所以呢

两件事值得记住。其一,这份基准把「模型知道自己没有身体」(MSA)和「不编造音视频证据之外的内容」(AH)写进了评分体系,这才是音视频助手走进生产环境的门槛——不是答得多漂亮,而是知道自己不知道。其二,当真实数据成为瓶颈,合成数据已经从训练补丁升级成任务定义的一部分:先造数据,再定基准,最后训模型,一条流水线全自己搭。反问留给读者:当评测集本身是造出来的,你对分数的信任要不要也打个折?