全模态大模型的下一站在哪?各家把语音、视觉、文本塞进同一个模型之后,「实时视频助手」成了最受关注的落地形态:模型持续看着你的屏幕或周围环境,通过多轮对话引导你完成具体目标。但一个尴尬的问题是——怎么评测这种能力?静态的视频问答数据集回答不了这件事,因为模型一旦给出建议,用户接下来的动作就会改变,后续视频内容也随之变化,离线数据集根本无法预设这些分支。

8 月 21 日提交到 arXiv 的 OmniAssistBench 给出了一套解法。这项工作由南京大学牵头,联合南开大学与滑铁卢大学完成,论文编号 arXiv:2608.21360(论文地址),代码与数据已在 GitHub 开源。

逆向工程:把互联网视频切成「交互」

研究团队的思路是把现成的互联网视频「逆向工程」成交互数据:先从视频中推导出合理的用户目标,再把视频切成多轮片段来模拟连续交互。为了解决「同一个目标可以有多条完成路径」的发散问题,他们给模型提供从源视频推导的先验知识,要求模型沿着完全相同的路线引导用户。

整个数据集包含 685 组开放式问答,覆盖 7 大任务类型、16 个细粒度任务,视频题材横跨运动、烹饪、讲座、DIY 和脱口秀。标注管线分四个阶段,平均每个样本要花费约 4 小时专家工时,总投入按论文口径超过 1000 个专家小时。评测采用 LLM-as-a-Judge 流程,先打 0-5 分再归一化到 0-100。

值得一提的是题型设计:所有用户问题不以文本形式输入,而是直接嵌进视频里——多数转成 TTS 语音,部分以字幕、手写画面或画中画手势呈现,模型只能看到视频本身。多轮模拟也讲究时序因果:当前轮的视频从上一轮结束处开始,用户提示嵌在片段末尾,尽量还原在线流式交互的因果结构。

榜单:榜首 66.4 分,没有赢家

评测覆盖 11 个模型,结果谈不上乐观。榜首的 Gemini-3-Pro 拿到 66.4/100,第二名 Gemini-2.5-Pro 为 64.6,字节跳动的 Doubao-Seed-2.0-lite 以 57.3 排第三,小米 MiMo-V2-Omni 53.8、Qwen3.5-Omni-Plus 51.6 紧随其后。开源模型中表现最好的 Qwen3-Omni-Instruct(30B-A3B)只有 51.2 分,末端的开源模型 VITA-1.5 仅 24.6。

更有意思的是团队自拍的 3 个真实案例(平均 15 轮交互,涵盖模拟会议、盲人导航辅助、多人手工进度跟踪):Gemini-2.5-Pro 总分第二,Real Cases 却只有 44.8,反而低于 Qwen3-Omni-Instruct 的 53.8;Gemini-3-Pro 在这一项拿到 68.0 保持第一。这说明旧旗舰在总榜上的分数,与真实长交互中的表现可以严重脱节。

三块短板,块块指向下一代设计

论文总结了当前全模态模型的三个关键瓶颈:

  • 视觉提示失灵:模型难以把手势识别为用户指令,手势类提示的跟随普遍失效;
  • 上下文耗尽:视频和音频的 token 消耗极快,缺少长期记忆机制的模型几分钟内就耗尽上下文窗口,随后忘记用户目标、给不出有效引导;
  • 延时响应失败:模型分不清什么时候不该说话,经常输出与用户提示关系不大的视频描述,而不是在视觉证据不足时保持沉默。

按团队的评分口径,40-60 分区间意味着「模型大致知道该干什么,但给不出准确且完整的回答」——榜单大部分模型正落在这个区间。

所以呢

OmniAssistBench 的价值不只是多一个排行榜。它把「视频理解」和「视频协作」划出了明确分界线:前者是被动看片答题,后者要求模型主动对齐视觉状态、用户目标与先验知识,还要拿捏回应时机。Real Cases 的分化尤其值得警惕——离线刷分与真实长交互之间的沟,比总榜数字呈现的更深。对想做 AI 视频助手产品的团队来说,上线前先在这个基准上跑一遍,比看发布会演示实在得多。