斯坦福大学 Serena Yeung-Levy 团队在 arXiv 公开 AutoMem 框架(编号 2607.01224),把"记忆管理"从工程技巧变成可独立训练的认知技能。研究人员给 LLM 配上一个真实文件系统当作"外部笔记本",把读、写、搜索、追加、建文件五种操作与游戏动作并列为同级的"记忆动作",让模型自己决定什么时候该记、记什么、查什么。\n\nAutoMem 设计了两层自动化优化循环。第一层用一个强 LLM 充当元审阅者,读取完整的游戏轨迹,迭代改写提示词、文件结构和可用操作,把 NetHack 里因重复追加导致文件暴涨的问题改成坐标键值覆盖,把每步字符增长从 138 砍到 6;第二层从模型自身成功轨迹中筛选好的记忆操作片段,用 LoRA 单独训练一个"记忆专家",让"查了再记"的习惯内化进参数。游戏策略模型的权重则全程不动,记忆能力干净叠加在原能力之上。\n\n在 Crafter、MiniHack、NetHack 三款长程程序生成游戏上,仅优化记忆一项就让基础代理得分提升 2-4 倍,32B 开源模型在所有三款游戏上反超参数量两倍于它的 Qwen2.5-72B-Instruct,并逼近 Claude Opus 4.5 与 Gemini 3.1 Pro Thinking 的水平。低效动作率下降 32-65%,重复写入率下降 68-83%。\n\n这项工作最值得关注的不是又一个 SOTA,而是一个方法论信号:在算力与参数规模竞赛之外,"如何管理记忆"可以被拆出来单独优化,且收益可能比堆参数更具杠杆。当下 Agent 系统的工程瓶颈往往不在模型本身,而在长程任务里的记忆与状态管理,AutoMem 提供了一个可复用的工程范式——把记忆操作当成一等公民,把记忆专家和策略模型解耦微调,把元 AI 引入自动化调优闭环。