[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-15987a0e-bc06-4f21-9608-264da02d0e6c":3},{"id":4,"title":5,"summary":6,"original_url":7,"source_id":8,"tags":9,"published_at":23,"created_at":24,"modified_at":25,"is_published":26,"publish_type":27,"image_url":13,"view_count":28},"15987a0e-bc06-4f21-9608-264da02d0e6c","AutoMem 让 32B 开源模型在长程任务上追平 Claude Opus 4.5","斯坦福大学 Serena Yeung-Levy 团队在 arXiv 公开 AutoMem 框架（编号 2607.01224），把\"记忆管理\"从工程技巧变成可独立训练的认知技能。研究人员给 LLM 配上一个真实文件系统当作\"外部笔记本\"，把读、写、搜索、追加、建文件五种操作与游戏动作并列为同级的\"记忆动作\"，让模型自己决定什么时候该记、记什么、查什么。\\n\\nAutoMem 设计了两层自动化优化循环。第一层用一个强 LLM 充当元审阅者，读取完整的游戏轨迹，迭代改写提示词、文件结构和可用操作，把 NetHack 里因重复追加导致文件暴涨的问题改成坐标键值覆盖，把每步字符增长从 138 砍到 6；第二层从模型自身成功轨迹中筛选好的记忆操作片段，用 LoRA 单独训练一个\"记忆专家\"，让\"查了再记\"的习惯内化进参数。游戏策略模型的权重则全程不动，记忆能力干净叠加在原能力之上。\\n\\n在 Crafter、MiniHack、NetHack 三款长程程序生成游戏上，仅优化记忆一项就让基础代理得分提升 2-4 倍，32B 开源模型在所有三款游戏上反超参数量两倍于它的 Qwen2.5-72B-Instruct，并逼近 Claude Opus 4.5 与 Gemini 3.1 Pro Thinking 的水平。低效动作率下降 32-65%，重复写入率下降 68-83%。\\n\\n这项工作最值得关注的不是又一个 SOTA，而是一个方法论信号：在算力与参数规模竞赛之外，\"如何管理记忆\"可以被拆出来单独优化，且收益可能比堆参数更具杠杆。当下 Agent 系统的工程瓶颈往往不在模型本身，而在长程任务里的记忆与状态管理，AutoMem 提供了一个可复用的工程范式——把记忆操作当成一等公民，把记忆专家和策略模型解耦微调，把元 AI 引入自动化调优闭环。","https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.01224","7437aeb9-930c-4866-a2e9-48003c1a792b",[10,14,17,20],{"id":11,"name":12,"slug":12,"description":13,"color":13},"6ad31a14-c0da-42df-81fd-564281f768db","agentic-ai",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"0ef8513a-0a26-42f0-b6f9-5b6dadded45c","efficiency",{"id":18,"name":19,"slug":19,"description":13,"color":13},"01598627-1ea6-4b27-a5d8-874971571a71","llm",{"id":21,"name":22,"slug":22,"description":13,"color":13},"b9bd9039-fcdb-41a8-b85b-fc1587def2b9","open-source","2026-07-23T12:10:00Z","2026-07-23T12:05:19.727227Z","2026-07-23T12:05:19.727241Z",true,"agent",2]