给大模型连续灌 100 个任务的知识,等第 100 个学完,前面学的还剩多少?Johns Hopkins 团队给出的基线答案很刺眼:1.2%。这篇 9 月 7 日提交到 arXiv 的论文,以 287 赞登上 Hugging Face 9 月 16 日每日论文榜第一。它研究的是大模型微调的老毛病——灾难性遗忘,而结论相当反直觉:别再纠结选哪种防遗忘机制,把它们组合起来。

先把「忘性」量化

论文定义了一个叫「长程记忆化」(long-horizon memorization)的设定:模型通过持续监督微调连续学习 100 个问答任务,不保留旧的训练数据,推理时也不告知任务编号。在这个刻度下,朴素顺序微调学完 100 个任务后,平均最终留存率只剩 1.2%——几乎所有知识都被后续更新冲掉了。

为避免结论只对某类数据成立,团队构造了三个 100 任务数据集:Symbol-QA 用随机六字符键映射四字符值,测纯符号记忆;LLM-QA 由 LLM 生成虚构事实;Real-QA 则从十个公开 QA 来源过滤重混而成,贴近真实知识。

组合拳怎么打

论文的核心假设:针对遗忘不同来源的机制,组合起来比单打独斗强。组合沿两个设计维度展开:

  • 锚点(anchors)决定「保什么」:数据锚点用生成式回放,函数锚点用对旧模型的自蒸馏,权重锚点用 SI 或 online EWC;
  • 低秩分配规则决定「存哪里」:共享 LoRA、合并 LoRA、O-LoRA,以及 OSRM 的顺序化改造。

设计空间组合爆炸,团队先用任务级 successive halving 做漏斗搜索(90→45→23→10),再用 2^4 全因子实验测量单个机制与交互效应。最终胜出的配方 si_sd_replay_merge——三锚点全开加合并 LoRA——在三个数据集上全部进入前三,把平均最终留存率从 1.2% 拉到 34.9%,论文称之为 28 倍改进。其中数据锚点与合并 LoRA 贡献最大,且在三个数据集上均呈超可加交互。

34.9% 是解药吗

不是,但这可能是第一次有人把这个赛道的方法论摆得如此系统。两点值得注意:其一,34.9% 意味着约三分之二的知识仍会丢,长程记忆远未解决;其二,工程取舍已经清晰——O-LoRA 与 OSRM 的状态随任务数线性增长,而共享/合并 LoRA 的学习器状态保持常数大小,对需要长期滚动更新的生产模型更友好。实验 backbone 为 Qwen3-4B-Base,论文还评估了 100 个任务之后模型在 GSM8K、MATH、MGSM、MMLU-Redux 上的通用能力。代码与三个数据集均已开源(GitHub)。

所以呢

对持续做领域微调的团队,这篇论文的价值不在 34.9% 这个数字,而在「机制可组合、交互可测量」的方法论:与其在单一防遗忘技巧上反复调参,不如把数据、函数、权重三层保护同时上齐。当模型开始像员工一样「入职后持续培训」,记忆留存率就会从学术指标变成成本指标——每忘掉一个任务,都是一次重新训练的真金白银。

论文原文:arXiv:2609.06986