大模型的“记忆”还没过视觉这一关:MEMLENS 把长上下文的短板测出来了

一边是模型厂商不断把上下文窗口推到几十万、上百万 token,另一边是 Agent 产品开始加上独立的 Memory 模块。看起来,长上下文和外置记忆像是两条都能走的路。但只要问题里混进一张图片、一次跨会话的变化,很多系统就会立刻露怯。

最近公开的 MEMLENS,正面测试了这件事。它不是又一个只看文本的长上下文榜单,而是把多模态、多会话、时间变化和拒答能力放在同一套测试里,逼模型回答那些“证据藏在过去某一轮图片里”的问题。

先看它测了什么

MEMLENS 包含 789 道题,覆盖五种记忆能力:信息提取、多会话推理、时间推理、知识更新,以及在证据不足时拒绝回答。测试把上下文长度分为 32K、100K、128K 和 256K token 四档,并采用跨模态的 token 计数方式,避免只按文字长度估算难度。

研究团队评估了 27 个视觉语言模型和 7 个带记忆的 Agent,还做了一组很关键的图像消融实验:在那些证据包含图片的题目里,拿掉图片后,两种前沿视觉语言模型的准确率都跌到 2% 以下,而这类题占到了 80.4%。这说明图片不是装饰,而是答案本身的一部分。

两条路线,各有一块硬伤

直接把全部历史塞进上下文的 LVLM,在短上下文时往往更强。模型能直接看见原始图像,视觉 grounding 也比较完整。但对话一拉长,性能开始下降。原因并不神秘:注意力要在越来越多的图文片段中找证据,模型虽然“看过”,却未必还能准确定位。

记忆增强 Agent 的表现更稳定,随着长度增加不会像长上下文模型那样明显波动。问题在于,记忆写入时通常要做摘要、压缩或结构化存储。压缩保住了“发生过什么”的轮廓,却可能丢掉图片里的细节、空间关系和局部证据。到了回答阶段,Agent 找到了相关记忆,却找不回真正能支撑结论的视觉信息。

更麻烦的是,多会话推理把大多数系统都压在 30% 以下。也就是说,系统可能记得一段话,却难以把不同时间、不同会话里的信息拼成一条完整的因果链。记忆不是“存进去”,而是要能更新、冲突处理,还要知道什么时候应该拒答。

所以,单押一条路线已经不够

MEMLENS 给出的方向很明确:未来的多模态 Agent 需要把长上下文注意力和结构化多模态检索组合起来。长上下文负责保留原始证据,记忆层负责跨会话组织信息;两者之间还要有一套能回指原图、原音频和时间状态的证据链。

这也解释了为什么“把窗口做大”并不等于“模型拥有了记忆”。窗口解决的是能不能装下,记忆解决的是该留下什么、如何更新、如何在需要时找回来。前者更像容量问题,后者更像数据系统和决策问题。

我的判断是,Memory 层真正的竞争点不会是摘要写得多漂亮,而是能不能保住证据的可追溯性。一个系统如果只告诉你“用户以前看过一张图”,却不能指出是哪张图、发生在什么时候、后来有没有被新信息推翻,它就更像一个会说话的缓存,而不是可靠的长期记忆。

当 Agent 开始进入陪伴、客服和机器人场景,错误记忆的代价会比一次答错更高。下一轮模型竞赛,值得盯的可能不是谁的上下文最长,而是谁能让模型在记得更多的同时,胡说得更少。