HiGram 给 Agent 记忆加上“路径定位”:先找证据,再改记忆
你有没有遇到过这种 Agent:明明记住了很多东西,一到信息更新就开始胡说?旧事实还在,新事实也进来了,最后两条互相打架。问题往往不在“记忆容量不够”,而在更新时把整张记忆图当成一锅粥。
8 月 5 日提交到 arXiv 的论文 Hierarchical Graph Memory for LLM Agents with Path-level Localization and Rewrite,提出了一个更细的思路:先定位与当前问题和新更新有关的证据路径,再只改这条路径上的记忆和依赖关系。论文把这套框架命名为 HiGram。原文:arXiv:2608.05095。
Agent 记忆的麻烦,不只是“找不到”
传统的图记忆会把事实、关系和历史信息放进一张图里。图变大以后,检索很容易带进无关上下文,证据筛选也会变贵。另一个麻烦是更新粒度:很多方法一次只改一个 MemoryUnit。可现实里的结论经常由几条互相依赖的事实共同支撑,单改其中一条,旧的下游关系可能还会继续参与回答。
HiGram 的判断很直接:记忆的组织粒度和推理依赖的证据结构没有对齐。 查询只需要一小段相关证据,更新却可能沿着依赖关系传播。要是每次都全图搜索、逐单元重写,记忆越长,维护成本越高。
HiGram 的三步:分层、定位、协同重写
第一步是层级图记忆。论文把图分成上层节点和底层 MemoryUnits。上层节点按照主题、对象类别和上下文做粗粒度组织,MemoryUnits 保存具体事实和显式依赖。这样,系统先从较大的区域缩小范围,再进入细节,不必一开始就遍历全部历史记忆。
第二步是 MicroGraph 路径定位。给定一个查询和一条更新,系统先把更新临时表示成 MemoryUnits,抽取主题和对象类别作为锚点,找到相关的 MicroGraph,再组成支持子图。支持子图仍可能包含多条证据链,所以系统继续枚举候选路径,依据属性匹配、依赖一致性、时间有效性和上下文兼容性,选出真正受影响的证据路径。
第三步是协同重写。系统先更新路径里受影响 MemoryUnit 的内部状态,再检查依赖它们的其他单元。如果下游结论仍有有效证据,就保留;如果支撑关系已经失效,就标记为过时,并从当前证据视图排除。历史记录没有被粗暴抹掉,新的状态和依赖也一起更新。
这套设计的重点不在“把记忆做成更复杂的图”,而在于把更新动作限制在一个有边界的证据区域内。对 Agent 来说,记忆维护从“改一堆相关条目”变成“改一条可解释的证据链”。
论文结果:质量上升,输入也变短
作者在长时对话问答数据集 LoCoMo 和冲突记忆评测 MemConflict 上测试 HiGram。LoCoMo 按 Single Hop、Multi-Hop、Open Domain、Temporal 和 Adversarial 等问题类型评估;MemConflict 则区分动态、静态和条件冲突,并观察回答准确率、更新顺序一致性、冲突识别以及证据是否进入前 3 个结果。
在 LoCoMo 上,论文用 GPT-5.4 和 GPT-4o 生成答案。表格结果显示,HiGram 的平均 F1、BLEU 和 LLM-J 在两种答案模型下都处于表格最高一档。以 GPT-5.4 设置为例,HiGram 的平均分为 50.62、46.16 和 78.83,最终答案生成使用的 token 数为 2031.5;完整对话上下文设置的 token 数是 28345.6。论文还报告,HiGram 只使用完整上下文 token 量的 7.2%。
在 GPT-4o 设置下,HiGram 的平均 F1、BLEU 和 LLM-J 分别为 52.51、49.83 和 83.65,token 数为 2328.9。在 MemConflict 上,HiGram 的 Dynamic AA、UOCS、Static AA、CRS、Conditional AA、Macro-AA、SEH@3 和 SRS 分别为 44.78、49.14、68.75、68.06、90.00、67.84、81.06 和 77.31。这些数字是论文在特定数据集、模型和评测设置下的结果,不等于所有 Agent 产品都会得到同样收益。
论文也给了边界:HiGram 在 Open Domain 问题上的优势没有那么明显,因为所需的外部知识如果不在存储历史里,局部记忆检索本身解决不了这个缺口。路径定位能减少无关证据,却不能凭空创造新知识。
我的判断:Agent 记忆的下一个瓶颈是“更新责任”
过去大家谈 Agent 记忆,常问两个问题:能存多少,能不能检索到。HiGram 把问题往前推了一步:当一条事实变化时,哪些结论必须跟着变化? 这是比“召回相关文本”更接近真实工作的难题。
这也解释了为什么路径级重写值得关注。企业知识库、长期客服和个人助理都会遇到事实冲突;如果系统只会追加新内容,旧依赖就会像幽灵一样继续影响回答。能定位、能更新、还能保留历史状态,才更像可维护的记忆系统。
当然,HiGram 还是一篇预印本,实验规模和数据集边界都写在论文里。真正落地时,路径识别的错误、更新证据的质量、图结构的长期膨胀,都会继续考验系统。
Agent 记忆真正难的地方,不是记住更多,而是知道哪条旧结论已经失去资格。