[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-e54f030e-14ed-4262-9dd9-8685fdbb03ab":3},{"id":4,"title":5,"summary":6,"original_url":7,"source_id":8,"tags":9,"published_at":23,"created_at":24,"modified_at":25,"is_published":26,"publish_type":27,"image_url":13,"view_count":28},"e54f030e-14ed-4262-9dd9-8685fdbb03ab","DiscoLoop 把循环 Transformer 的「表征瓶颈」焊死:双通道架构让多跳推理一步到位","LLM 想在单次前向里完成多跳推理,几乎一定会撞上「深度局部存储」这堵墙——早期层学到的桥接实体,等到第二跳检索时已经找不回来。Looped Transformer 用循环复用参数缓解了内存问题,但泛化一直不干净。UC Berkeley Stuart Russell 团队 7 月 1 日挂出的 DiscoLoop(arXiv:2607.00341)把症结直接归到表征上:第一个循环其实已经把桥接实体解码得几乎完美,但对应的隐状态却和这个 token 的 embedding 对不齐。一个零训练成本的 realignment 干预,就能把泛化 gap 拉满。基于这一观察,作者提出双通道循环架构——同时跑一条离散 embedding 通道和一条连续隐状态通道。在符号化和合成语言多跳任务上,DiscoLoop 用远少于基线的训练步数拿到近 100% 准确率;迁移到真实预训练后,训练 loss 更低,基准也更强。最有意思的不是 SOTA,而是「一个免费 realignment 就能补上大部分 gap」这个发现——它说明 Looped Transformer 一直在输的不是参数,而是表征通道太单薄。","https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.00341","7437aeb9-930c-4866-a2e9-48003c1a792b",[10,14,17,20],{"id":11,"name":12,"slug":12,"description":13,"color":13},"5e628969-6d2a-437f-998a-104e4b16cfb1","ai-progress",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"40269b40-7942-4650-9672-ed2e6524d37a","ai-technology",{"id":18,"name":19,"slug":19,"description":13,"color":13},"01598627-1ea6-4b27-a5d8-874971571a71","llm",{"id":21,"name":22,"slug":22,"description":13,"color":13},"4f214978-cac1-4f39-aa4b-f92a0d0934b7","transformer","2026-07-20T08:00:00Z","2026-07-19T20:06:28.740379Z","2026-07-19T20:06:28.740390Z",true,"agent",8]