为什么大模型「知识更新」是个老难题

把一条新事实写进 LLM,传统做法是继续微调或做知识编辑。问题在于:大模型把事实压进了上千亿参数的 Transformer 权重里,你改一处可能牵动十处——编辑成功率上去了,无关能力就开始塌方。这是 model editing 这个子领域十年来没真正解掉的根结。

arXiv 2610.10533 提出的 EngramEdit 把解题思路换了一条:不碰 Transformer 主干,只改「条件记忆」里那一份外挂的 n-gram embedding 表。

什么是条件记忆

条件记忆架构(代表工作:DeepSeek Engram)在 Transformer 之外,挂一张可学习的 n-gram embedding 表。推理时,模型先用输入的 n-gram 去查表,取出向量再和 Transformer 一起算。这相当于给 LLM 加了一个「外挂硬盘」,只增加有限计算,就把模型容量撑了上去。Engram 的早期工作把这条路用来做 scaling,这篇新论文想做的是另一个方向:把那张表变成「可编辑的事实接口」。

两步走的编辑方法

直接改条件记忆的 embedding 也不是简单事。同一条事实在不同表达下会激活不同的 n-gram;而一个 n-gram embedding 又往往被多条事实共用——粗暴更新必然误伤。这套新方法的解法分两步:

第一步,它先用当前模型,反推出「要让模型在新事实的多条表达上都预测正确,目标 memory 向量应该是怎样的」。这一步得到的是一组虚拟的目标 embedding。第二步,它联合更新共享的 n-gram embedding,让它们尽量逼近这些目标,但对「高频共用」的 embedding 加更大的惩罚——高频被多事实依赖,改它会牵动太多无关知识,所以得让它更稳。

这个「按使用频率加权」的思路,本质是把编辑问题当成一个带正则项的最小二乘,而不是一次单点改写。

论文里报的数字

arXiv 2610.10533 给出的实验结果是:事实编辑的编辑成功率接近 100%。被编辑过的知识,在未见过的表达上能用,在多跳推理里也能用——CoT prompting 下,准确率接近最强 baseline 的 3 倍。多次编辑叠加时,无关知识和通用能力基本不掉。

需要注意的是,这些数字来自 DeepSeek Engram 这类带条件记忆模块的架构,不是对通用 Transformer 的 silver bullet——没装 Engram 的标准 LLM 用不上这套机制。

为什么这件事对 LLM 工程重要

把「存储事实」从「通用计算」里剥出来,一直是模型架构想要的方向。这篇工作的价值不在某一个 benchmark 数字,而在它证明了:条件记忆这种外挂结构,既能用来扩容量,也能用来做外科手术式的事实修订。配合 RAG 和工具调用,这种「主模型不动、外挂记忆可改」的范式,可能会成为长寿命 LLM 的标配——明年 Qwen5、Claude 7 这种计划跑很多年的模型,如果要在不重新预训练的前提下吸收 2027 年的新事实,EngramEdit 这种思路就是基础设施级别的拼图。

(本文事实均来自 arXiv 2610.10533 论文摘要与正文,引用见 https://arxiv.org/abs/2610.10533)