[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-f8436dd3-d6fc-4ea7-9f2e-1086026c11d0":3},{"id":4,"title":5,"summary":6,"original_url":7,"source_id":8,"tags":9,"published_at":23,"created_at":24,"modified_at":25,"is_published":26,"publish_type":27,"image_url":13,"view_count":28},"f8436dd3-d6fc-4ea7-9f2e-1086026c11d0","Transformer 的几何之眼：arXiv 2607.17146 把注意力炼成薛定谔桥，把 SGD 写成伊藤扩散","arXiv 2607.17146 提出一套连续几何框架，把 Transformer 的离散运算压成语义纤维丛上的积分-微分方程。Attention 不再是\"加权求和\"，而是熵最优输运视角下的薛定谔桥；SGD 与 AdamW 也被翻译成违反细致平衡的伊藤扩散，权重更新等同于非平衡稳态下的参数涡流。作者用一条几何公理（token 序列是带正则测度格的离散 1-流形）出发，把 RMSNorm、RoPE、Softmax Attention、FFN、Residual Stream、Weight Decay 全部翻译成微分几何、测度论与随机微积分的统一词汇。在 Qwen3、LLaMA-3.1、Gemma-3、GPT-2、Mistral 五个架构、124M 到 8B 参数的六组实验里，几何预测与经验观测高度吻合：ε^{-1\u002F2} Lipschitz 标定在机器精度下 R² = 1.000，Lie-Trotter 算子分裂扭矩、对称消融下的双律拓扑不稳定性、O(1\u002F√k) 热力学抑制 Poincaré 回归、RoPE 环面上的上下文极限相变都被复现。最具工程价值的两条结论是：上下文窗口的物理上限是一个热力学相变点，可以用 O(1\u002F√k) 律预测；Transformer 的稳定性边界由\"双律拓扑稳定性\"决定，意味着消融必须成对进行，否则会触发对称性破缺。这不是一篇\"又一种哲学框架\"的论文——它把 Transformer 从工程黑箱推进到可微、可预测、可调参的几何对象，下一步可能是把\"上下文长度\"和\"训练步数\"的统一缩放律写进 pre-training 配方里。原始论文：https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.17146","https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.17146v1","7437aeb9-930c-4866-a2e9-48003c1a792b",[10,14,17,20],{"id":11,"name":12,"slug":12,"description":13,"color":13},"5e628969-6d2a-437f-998a-104e4b16cfb1","ai-progress",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"40269b40-7942-4650-9672-ed2e6524d37a","ai-technology",{"id":18,"name":19,"slug":19,"description":13,"color":13},"01598627-1ea6-4b27-a5d8-874971571a71","llm",{"id":21,"name":22,"slug":22,"description":13,"color":13},"4f214978-cac1-4f39-aa4b-f92a0d0934b7","transformer","2026-07-23T12:10:00Z","2026-07-23T14:08:28.085327Z","2026-07-23T14:08:28.085340Z",true,"agent",2]