Transformer 有个被长期回避的结构性短板:每个 token 分到的计算深度是固定的,八层就是八层,序列再长也不会多算一步。但状态跟踪任务恰恰要求每来一个输入就更新一次状态。普林斯顿大学的 Yifan Zhang 与宾夕法尼亚大学的两位合作者 10 月 6 日在 arXiv 发布 Recurrent Looped Transformer(RLT),把「并行」和「循环」这对老对手缝合进了同一个架构(arXiv:2610.07591)。
八层拆两半:并行编码器加循环解码器
RLT 的做法直白:把八层拆成并行因果编码器和循环解码器。编码器照常并行处理所有 token,产出表征和全局 KV 记忆;解码器在每个 token 处把编码器输出与上一个 token 的最终解码状态做门控合并,再配上每层的滑动窗口注意力缓存。效果是计算路径随序列长度增长——处理完 t 个 token,循环路径已经穿过 t 乘以解码器深度个解码器块——但每个 token 的计算成本保持固定。GitHub 仓库上线三天已获 918 星,代码以 Apache 2.0 开源。
40 位训练,256 位全种子 100%
长度外推的数字最能说明问题。只在至多 40 位奇偶校验上训练,5+3 和 7+1 两种切分在 256 位测试上所有种子都拿到 100% 准确率,同规模八层 Transformer 停在 50.07%。置换群 S5 追踪任务外推到训练长度八倍(256 次操作)时,4+4 切分达 97.30%,Transformer 只有 0.85%。模算术任务 RLT 最高 93%,Transformer 为 33%。16 层系列同样如此:8+8、9+7、11+5、16+0 四种切分在 256 位全部保持 100%,Transformer 16 是 49.41%。
命门是反馈通路,不是层数
消融把因果链钉死了:RLT-0 直接砍掉反馈通路,奇偶和 S5 全部跌回随机水平(64 位上 50.23%),每个切分都一样——增益完全依赖循环状态本身。作者还给出工程折中方案 RLT-2:每四个 token 才更新一次反馈状态,已知 token 可以在块内并行,CPU 训练步提速 2.27 倍,64 位奇偶保住约 99%;但 S5 追踪从 100% 掉到约 20%,说明置换跟踪必须逐 token 反馈。反馈间隔由此变成可调旋钮:预训练用大块抢并行度,后训练再把间隔收到 1。
训练推理统一,社区已开始复现
仓库给出 prefill、生成、预训练、SFT、RL replay 五种模式的统一执行表,全梯度穿过循环输出、解码器 KV 和编码器记忆。社区开发者已用约 7.9 万参数的独立小实现复现方向性结论:训练长度内全部拟合,但 128 次操作外推衰减到 60.8%,提醒我们这些结论目前限于算法任务、监督训练,强化学习表现未评估。
这篇工作的定位值得划重点:它不是又一篇刷榜论文,而是把「深度换状态」变成了显式的设计轴。做长上下文、agent 记忆维护的人,值得把 108 组对照实验的原文完整读一遍。