Transformer 的几何之眼:arXiv 2607.17146 把注意力炼成薛定谔桥,把 SGD 写成伊藤扩散

arXiv 2607.17146 提出一套连续几何框架,把 Transformer 的离散运算压成语义纤维丛上的积分-微分方程。Attention 不再是"加权求和",而是熵最优输运视角下的薛定谔桥;SGD 与 AdamW 也被翻译成违反细致平衡的伊藤扩散,权重更新等同于非平衡稳态下的参数涡流。作者用一条几何公理(token 序列是带正则测度格的离散 1-流形)出发,把 RMSNorm、RoPE、Softmax Attention、FFN、Residual Stream、Weight Decay 全部翻译成微分几何、测度论与随机微积分的统一词汇。在 Qwen3、LLaMA-3.1、Gemma-3、GPT-2、Mistral 五个架构、124M 到 8B 参数的六组实验里,几何预测与经验观测高度吻合:ε^{-1/2} Lipschitz 标定在机器精度下 R² = 1.000,Lie-Trotter 算子分裂扭矩、对称消融下的双律拓扑不稳定性、O(1/√k) 热力学抑制 Poincaré 回归、RoPE 环面上的上下文极限相变都被复现。最具工程价值的两条结论是:上下文窗口的物理上限是一个热力学相变点,可以用 O(1/√k) 律预测;Transformer 的稳定性边界由"双律拓扑稳定性"决定,意味着消融必须成对进行,否则会触发对称性破缺。这不是一篇"又一种哲学框架"的论文——它把 Transformer 从工程黑箱推进到可微、可预测、可调参的几何对象,下一步可能是把"上下文长度"和"训练步数"的统一缩放律写进 pre-training 配方里。原始论文:https://arxiv.org/abs/2607.17146