多方对话里的长期记忆,正在成为 LLM 记忆系统的照妖镜。浙江大学团队的最新论文点出一个尴尬现实:通用 LLM 记忆系统在多方对话基准上经常丢失人物与群体关系,某些场景下甚至跑不过最朴素的 BM25 检索——问题不在"找不到相关内容",而在分不清"谁说了什么"、这句话说的是谁、群体共享了哪些信息,以及状态如何随时间变化。这两个瓶颈,论文分别称为消息归因与状态重建。

双轨记忆:逐字原文与结构化状态互补

SpeakerMem-R1 的核心设计是把记忆拆成两条轨道。System 1 保留全部原始消息的逐字内容,每条都带说话人和时间标签,依赖原始措辞的问题随时能回到原话取证;System 2 由一个写入器把对话提炼成四层结构化状态——个人核心记忆、个人画像、群体交互、群体洞察,每条记录维护归属、来源、层级、时间戳和溯源链接,写入动作只有 ADD、UPDATE、NOOP 三种,更新是非破坏式的。查询时,两条轨道的证据再按实体、事件、时间组合起来交给回答模型。

3B 小写入器,RL 也能练出来

结构化记忆的难点在写入容易出错:归因错人、状态改错。团队没有依赖大模型写入,而是用 SpeakerLevenshtein 奖励加说话人条件化的 GRPO,训练出 Qwen2.5-3B 的 Writer-R1,让记忆写入组件可以整体本地部署。在 305 道留出题的受控评测里,RL 把 SFT 写入器的平均准确率从 57.38% 拉到 68.20%;同一设置下外部 LLM 写入器是 71.48%,小模型加专用奖励已经吃掉大部分差距。训练数据也不大:15 个完整社交网络、73 个写入片段、452 条监督动作。

跑分领先,但离"好用"还有距离

三个多方对话基准上,SpeakerMem-R1 比评测中最强的记忆/检索基线分别高出 3.3、12.4、9.4 个百分点;在 EverMind-AI 公开报告的 EverMemBench 榜单上拿到 62.33%,领先 EverOS(60.08%)与 RippleMem(54.75%),论文称这是该榜已报告的最新框架中的最好成绩。在作为两人对话边界测试的 LoCoMo 全部 1,986 题上,它拿到 70.85%。但底色要看清:GroupMemBench 绝对准确率只有 47.9%,连一半都不到——多方归因对当前所有系统仍是硬骨头。

为什么值得盯

这篇论文的价值不在跑分,而在把"说话人归因"从检索问题升级成记忆结构问题:逐字轨道保真、结构轨道保关系,查询时再做证据组合。对做 Agent 记忆、客服机器人、会议助手的团队,这套双轨设计加"3B 写入器 + RL"的配方是可以直接复用的——代码以 MIT 协议开源,仓库包含推理包、基准运行器和写入器训练配方,论文也拿下 HuggingFace Daily Papers 9 月 24 日日榜第一(76 upvotes)。当所有人都在卷上下文长度时,记住"谁在什么时候对谁说了什么",可能才是长期记忆真正的瓶颈。

论文: https://arxiv.org/abs/2609.26780
代码: https://github.com/2022hpsk/SpeakerMemR1