先给一个会让人有点不舒服的结论:你每天在用的预训练大模型,可能连 K = apple; B = K; D = B; print(D) 这类几行长的引用链都跟不住。佐治亚理工的 Zehao Jin、Ruixuan Deng 和 Junran Wang 三人组在 9 月 29 日提交到 arXiv 的论文(2609.36585)里给出了测量:十三个 0.6B 到 32B 的基座模型,要求不写思维链、直接作答时,能可靠跟随的引用链平均只有 1.4 到 3.6 行;更扎心的是,给模型预训练额外的循环结构几乎不解决问题。模型的深度摆在那里,但它默认不会用。
一个 LoRA,全模型冻结
论文的修法克制到近乎吝啬:在单个早期层挂一个 rank-8 LoRA,其余全部权重冻结,只训这一个适配器。效果却是数量级式的——Qwen3-8B 在 24 行引用链上的精确准确率从 15.5% 拉到 99%,训练更久的版本能跟住 50 行;1.4B 的 Ouro 在四次循环后到 60 行,八次循环后至少 160 行。团队在 GitHub 仓库(Lunamos/stop-thinking-too-early,代码 Apache 2.0 开源)给出了完整复现脚本,headline 那个 LoRA(Qwen3-8B,第 14 层)在单张 A100 上训练加评估只要约 16 分钟——这个成本,任何做推理优化的团队都掏得起。
接力机制:计算本来就在
为什么一个单层适配器能撬动几十层的冻结网络?论文的分析给出了一个漂亮的答案:LoRA 启动的是一场「接力」。程序行把各自的链身份经由一小段中间层向下传递,冻结的注意力头沿着链条逐级向上读取;一旦移除对父行的注意力,接力立刻中断。这坐实了论文标题的判断——Transformer 不是不会算,是「停止思考得太早」:默认前向传播只用了深度的一小截,计算能力其实潜伏在那里,等人唤醒。团队还展示了一个在冻结模型上的测量方法,能在四个 held-out 模型中的三个里定位「最后一层有用的干预位置」;任务特定的 LoRA 在 MuSiQue 问答任务上也有提升,说明这套机制不只在合成任务上成立。
对行业的三点意味
第一,「模型不会」和「模型没被激活」是两回事。评测算子给出低分时,先别急着换更大的模型——可能是深度利用率问题,一个 16 分钟的 LoRA 就能翻盘。第二,推理成本叙事要修:如果少量参数编辑就能释放冻结网络里的既有计算,那「买更深模型」和「激活现有深度」之间,存在一条便宜的中间路线。第三,可解释性有了工程抓手:接力机制画出了一张清晰的层间分工图,后续做推理加速或结构搜索的人可以直接在上面做文章。
所以呢:下次看到模型答错长链条问题,别急着骂容量不够——它可能只是没被叫醒。论文、代码与在线演示都在下面的链接里,16 分钟一张 A100,值得亲手跑一遍。
参考:arxiv.org/abs/2609.36585 · github.com/Lunamos/stop-thinking-too-early