LLM 想在单次前向里完成多跳推理,几乎一定会撞上「深度局部存储」这堵墙——早期层学到的桥接实体,等到第二跳检索时已经找不回来。Looped Transformer 用循环复用参数缓解了内存问题,但泛化一直不干净。UC Berkeley Stuart Russell 团队 7 月 1 日挂出的 DiscoLoop(arXiv:2607.00341)把症结直接归到表征上:第一个循环其实已经把桥接实体解码得几乎完美,但对应的隐状态却和这个 token 的 embedding 对不齐。一个零训练成本的 realignment 干预,就能把泛化 gap 拉满。基于这一观察,作者提出双通道循环架构——同时跑一条离散 embedding 通道和一条连续隐状态通道。在符号化和合成语言多跳任务上,DiscoLoop 用远少于基线的训练步数拿到近 100% 准确率;迁移到真实预训练后,训练 loss 更低,基准也更强。最有意思的不是 SOTA,而是「一个免费 realignment 就能补上大部分 gap」这个发现——它说明 Looped Transformer 一直在输的不是参数,而是表征通道太单薄。