[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-slug-supersede-fact-staleness-rl":3,"news-related-9b2d398b-582a-4dc1-b2b9-5dd951194f7b":31},{"id":4,"title":5,"summary":6,"content":6,"original_url":7,"source_id":8,"tags":9,"translations":23,"news_slug":24,"published_at":25,"created_at":26,"modified_at":27,"is_published":28,"publish_type":29,"image_url":13,"view_count":30},"9b2d398b-582a-4dc1-b2b9-5dd951194f7b","Supersede 把 LLM Agent 长会话的「事实过期」缺口做成可训练奖励：Qwen2.5-3B 上 GRPO 让准确率近翻倍","Supersede 是 Vedant Patel 在 arXiv 公开的一项针对长会话 LLM Agent 的诊断与训练工作，把事实过期从语言模型难解的现象变成了可在 verifiers\u002Fprime-rl 框架下训练的能力。论文先在 LongMemEval 的知识更新子集上做对照：把 Agent 完整上下文替换为有界自维护记忆后，连 gpt-5.4 这类前沿模型准确率也从 92% 掉到 77%（配对 McNemar p\u003C0.005），且缺口不随模型规模缩小而消失——瓶颈在记忆维护，不是理解本身。继续把会话长度拉到 24 倍，准确率从 68% 进一步跌到 28%；而按比例放大记忆容量（28%→28%）也无效，说明失败的根源是会话长度的累积效应，不是压缩比。这些数据明确把长上下文 LLM Agent 答得准和记得对分成了两个独立的能力维度。基于这一诊断，作者把 Supersede 开源成 verifiers\u002Fprime-rl 上的 RL 环境：答对当前值得分，引用过时值扣分，从而把时间性事实保鲜能力直接变成可训练的奖励信号。在 Qwen2.5-3B 上做 GRPO 微调，held-out 真实会话上的超期更新准确率从 9.0% 提升到 16.7%，检查点曲线单调上升，政策本身在变好而不是 harness 在变好。这是第一个专门针对事实保鲜设计的可训练 RL 环境，也是少数在 Agent 长会话能力上同时给出诊断和训练证据的工作。","https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.27472","7437aeb9-930c-4866-a2e9-48003c1a792b",[10,14,17,20],{"id":11,"name":12,"slug":12,"description":13,"color":13},"6ad31a14-c0da-42df-81fd-564281f768db","agentic-ai",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"5e628969-6d2a-437f-998a-104e4b16cfb1","ai-progress",{"id":18,"name":19,"slug":19,"description":13,"color":13},"40269b40-7942-4650-9672-ed2e6524d37a","ai-technology",{"id":21,"name":22,"slug":22,"description":13,"color":13},"01598627-1ea6-4b27-a5d8-874971571a71","llm",[],"supersede-fact-staleness-rl","2026-06-29T22:01:00Z","2026-06-29T22:23:31.256766Z","2026-08-19T02:08:40.142862Z",true,"agent",115,{"items":32},[33,38,43,48,53,58],{"id":34,"title":35,"news_slug":36,"published_at":37},"777afb24-262f-45cc-961f-d5d49ad42883","AgentOPSD 用递归贝叶斯信念破解多轮 Agent 强化学习的信用分配：清华\u002F浙大\u002F美团让 GRPO 学会看哪个 turn 决定胜负","agentopsd-recursive-belief-credit-assignment","2026-08-07T02:00:00+00:00",{"id":39,"title":40,"news_slug":41,"published_at":42},"1316635c-88e1-41b6-a45c-df8ef217cf3f","PaperPilot 把文献搜索改写成「工作流归纳」：可编辑 DAG 把多轮检索错误率干到 0%","paperpilot-workflow-induction","2026-07-01T08:21:23+00:00",{"id":44,"title":45,"news_slug":46,"published_at":47},"6de305c2-91b2-47fb-b1e4-dfb5f1e711c8","WorldEvolver：把世界模型装进 LLM Agent 的「即时记忆」","worldevolver-llm-agent-world-model","2026-06-30T18:04:00+00:00",{"id":49,"title":50,"news_slug":51,"published_at":52},"5b909019-b85f-4ec2-9d7a-9b8808db49e1","MRAgent：NUS 把 LLM Agent 记忆从「查字典」改成「拼拼图」，单查询 token 直降 27 倍","mragent-nus-memory-jigsaw-27x","2026-06-28T10:09:00+00:00",{"id":54,"title":55,"news_slug":56,"published_at":57},"b88a7d4b-8f6d-4440-b384-4283f88a410c","Tool-Use RL 为什么会突然崩盘？arXiv 2606.26027 戳破 Agent 训练的'概率尖峰'陷阱","tool-use-rl-collapse-probability-spike","2026-06-25T20:25:00+00:00",{"id":59,"title":60,"news_slug":61,"published_at":62},"f96a7b02-7bad-4ef2-98c4-a6b6aedefd0c","Constraint Tax：Tool Calling 遇 JSON Schema 悄悄失灵","constraint-tax-tool-calling-silent-disable","2026-06-25T14:00:00+00:00"]