循环 Transformer 有一个很诱人的思路:不再不断堆叠新的独立层,而是让同一组 Transformer 层重复运行若干次,用固定参数量换取更深的有效计算。问题在于,循环不等于进步。研究团队指出,现有循环模型会覆盖中间表示,导致早期已经正确的预测在后续迭代中被改坏;不同轮次的隐藏表示还会越来越相似,让新增计算沦为重复劳动。

LoopMTP 的核心,就是给每一轮循环安排一个不同的“前瞻目标”。对于第 t 轮,模型不直接做一次昂贵的全词表预测,而是在隐藏空间里,让当前位置的表示与第 t 个未来 token 的输出嵌入做余弦软对齐。第 1 轮保持无约束,用来学习可供后续轮次读取的丰富表示;从第 2 轮开始,每一轮都被要求朝更远的未来移动。论文称,这种潜空间多 token 预测不需要每轮增加一次完整词表投影,因此额外开销很小。具体方法与实验可在论文原文中追溯。

光有前瞻监督还不够。传统循环结构常常只保留最后一轮输出,前面算出的信息会被覆盖。LoopMTP 改用内容条件门控,把所有轮次的表示加权汇总;同时加入轮次索引、逐轮归一化,以及固定按循环次数缩放的 Loop-LNS,让共享骨干知道自己正处在哪一轮,并控制深层展开时的残差稳定性。换句话说,它不是简单地把同一层多跑几遍,而是同时解决“每轮做什么”和“前面算过什么如何保留”两个问题。

论文报告,主实验结果按 3 个随机种子取平均。LoopMTP 在通用任务上的平均准确率最高达到 50.02%,非循环参数匹配基线为 46.28%,相对提升最高 8.08%;与 LoopFormer 在相同循环次数下比较时,28 组匹配结果中有 27 组更好。更关键的是,困惑度与通用任务准确率会随循环次数增加而持续改善,但问答、数学和代码任务在 7 轮后趋于饱和,并在 9 轮时略有回落。这说明更多循环不是免费午餐,真正有用的是受到区分性监督的循环。

研究者还训练了一个约 2.6 亿参数的数学专用模型,使用约 68 亿个数学语料 token,未做微调或指令微调。在 GSM8K 的 8-shot 设置下,它取得 19.03% 准确率,而参数量匹配的非循环基线为 7.05%。不过,这组专用模型实验只覆盖数学领域,而且每个配置只运行了一个随机种子;论文也明确承认,循环增益会递减甚至出现非单调变化,实用循环深度的上限仍未确定。

我的判断是,LoopMTP 的价值不在于又刷出一个孤立分数,而在于指出了循环模型最容易被忽略的工程事实:参数共享只能省下存储,每轮监督才能让重复计算产生增量。它为小模型和本地部署提供了一条清晰路线——用更多可控计算换取更强推理,同时不扩大参数内存;但在更大规模、更多领域验证完成之前,还不能把小模型结果直接外推到前沿模型。

所以,循环 Transformer 的下一步不是“多想几轮”,而是让每一轮都知道自己为什么要想。