先记再答,是流式视频模型最难的一课。帧每一秒都在进来,而细节在问题到来之前就滑出了上下文窗口——等用户终于问起"孩子能去哪儿看书",拍到的阅读角早就不在画面里。沿用离线视频 QA 的老办法只有两条路:要么把全部历史帧留在上下文里,token 和显存随时间线性膨胀;要么只留最近几帧,"过去"直接失忆。OneStreamer 给出第三条路:让模型边看边把值得记的东西写成文字。
一次十一校协作,把记忆做成生成任务
OneStreamer-4B 由南京大学 MCG 团队牵头,联合 PJLAB、京东、上海交大等共 11 家机构完成,通讯作者王利民。模型基于 Qwen3-VL-4B-Instruct 构建,代码以 Apache 2.0 协议开源,4B 权重、OneStreamer-1M 数据集(超 100 万条记录)与推理、评测代码全部放出。
核心是把感知、记忆、响应统一进同一个生成过程:模型一边看,一边用两个控制符写笔记——</Observe> 记局部细节,</Summary> 总结已完成事件。笔记带时间戳留在文本历史里,等源帧滑出视觉窗口后依然可用;回答历史问题时靠这些记录补充最近视觉窗口,不重新访问历史视觉特征。
只监督 27.5% 的状态 token,反而更强
流式交互还有个隐蔽难题:模型大多数时刻应该沉默,重复的等待状态会在监督里占主导。PSTL(Proactive State Transition Learning)保留全部输出锚点,只挑代表性的状态变化与维持 token 监督——只用 27.5% 的标注状态 token 就超过稠密监督:ProactiveVQA、OmniMMI、OVO-Timing 三个基准拿到 48.7、36.6、41.6,全 token 稠密 CE 监督只有 26.1、30.8、1.5。
记忆的价值,有数字为证
官方项目页给出三组实测(单卡 H200):
- 记忆消融:同样只看最近 16 帧,加上 caption 记忆(PHCM)后,OVOBench Backward ASI 从 63.5 升到 71.6——超过全量历史的 67.6,实时感知分还从 80.9 升到 81.4,两项兼顾;
- token 效率:360 秒样本上,上下文 token 从 62094 降到 4308,省 93.1%;显存从 25.18 GB 降到 9.98 GB,首 token 延迟从 4.560 秒降到 0.124 秒;
- 更新速度:360 秒 StreamingBench 片段平均每次更新 0.636 秒,低于 1 秒输入间隔,边看边记不掉队。
在对比的八个基准(OVOBench、StreamingBench、OVBench、ODVBench、ProactiveVideoQA、OmniMMI、OVO-Timing、ViSpeak)上,作者报告 OneStreamer-4B 全部取得最高综合分。
评论:记忆不是缓存,是写作
这份工作最值得琢磨的转向,是把"记什么"从工程问题变成模型自己学的生成问题。文本可读只是副产品,真正的好处是文字天然带时间戳、可复用、便宜——4308 个 token 装下 360 秒视频里全部"值得记的东西",这个压缩比本身就是答案。两点保留:八榜最佳是作者对比集合内的结论,不是跨厂商公论;caption 记忆的上限取决于模型自己的判断力,写错的笔记比没有笔记更难纠正。对做实时视频 Agent 的团队,这条路线至少证明:与其无限扩视觉上下文,不如教会模型做笔记。
参考:arXiv:2610.01762 / mcg-nju.github.io/OneStreamer / github.com/MCG-NJU/OneStreamer