## ARMT 把「记忆」焊进 Transformer:用恒定显存换无限上下文 长上下文是这两年 LLM 工程化最大的「显形成本」。标准 Transformer 注意力是 O(n²) 计算、O(n) 显存——上下文从 8K 推到 128K,推理成本要涨两个数量级。现有解法几乎都集中在 KV Cache 压缩(JLT、MosaicKV)或混合注意力(HydraHead、DeepSeek V4),都在「保留一段连续 KV」假设里打转。 7 月 13 日挂在 arXiv 的 **2607.11614**(Kuzmin 等 11 位作者,MIPT + AIRI + MBZUAI 等机构合作)提出不太一样的角度:**Associative Recurrent Memory Transformer (ARMT)**——把联想式循环记忆直接插入 Transformer 某些层,实现**恒定显存**扩展上下文。 ### 核心贡献 1. **两个领域特定长上下文数据集**,为窄域微调场景设计,比通用 needle-in-haystack 更接近真实工作负载; 2. **完整训练配方**:持续预训练 + 合成长文数据 + 课程学习 + **选择性**把联想记忆接入部分层(不是全量替换); 3. **系统实验**:ARMT 增强后能处理远超原生窗口的输入且不退化,对分布外长度泛化更好,且在原始窗口内**少用 30% FLOPs**。 ### 个人评论 ARMT 不是范式颠覆,更像「**在 Transformer 内部挖一个 LRU 缓存**」。精神上接近 SSM/Mamba,但 ARMT 显式选择「保留原主干 + 局部加记忆」的渐进路线,工程门槛低很多。 **30% FLOPs 降幅**对已上线长上下文应用是直接成本收益;「**选择性插入层**」是关键工程洞察——全量替换会破坏表征局部性,稀疏插入在效率与质量间找到 trade-off;论文强调「窄域微调场景」,说明 ARMT 不是通用 1M 上下文基模,而是**面向垂直长文工作负载**(法律、医疗、代码库)的实用路径。 接下来要看:ARMT 的「联想记忆」是否会和 KV Cache 压缩方法叠加——「**外存 + 内压**」组合可能是长上下文成本下降的下一站。 从 ReContext 到 JLT 再到 ARMT,长上下文已经不是「能不能做」的问题,而是「**用多少成本做**」的问题。每篇都在把单位 token 推理开销往下压一档——这才是 LLM 真正走进生产环境的底层燃料。