[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-slug-mbd-lm-multi-block-diffusion":3,"news-related-c15de523-d706-4ad1-b5df-4cbccd0140d6":31},{"id":4,"title":5,"summary":6,"content":6,"original_url":7,"source_id":8,"tags":9,"translations":23,"news_slug":24,"published_at":25,"created_at":26,"modified_at":27,"is_published":28,"publish_type":29,"image_url":13,"view_count":30},"c15de523-d706-4ad1-b5df-4cbccd0140d6","MBD-LM 把 LLaDA2 扩散推理 TPF 推到 9.34：上海交大用「多块 Teacher Forcing」打通训练-推理状态差","2026 年 6 月 30 日，上海交大 \u002F 西交 \u002F 华为联合在 arXiv 上线 v2 版论文 Multi-Block Diffusion Language Models（MBD-LMs，arXiv:2606.29215），把扩散语言模型工程侧最棘手的「训练-推理状态错位」正面拆开。在 LLaDA2-Mini 上，平均 Tokens Per Forward pass（TPF）从 3.47 拉到 6.19，平均准确率从 79.95% 提到 81.03%；叠上 DMax 后 TPF 进一步推到 9.34，数学 \u002F 代码基准只掉 1.02%。\n\nBlock Diffusion LM（BD-LM）这两年把「并行解码 + KV Cache + 灵活长度」做齐：单次前向处理一个块，前面的块已经干净可以缓存；但块间是顺序的，后面的块要等前面的 KV cache 写完才能动，形成「storing bubble」，并行度被锁死在块内。Discreted Diffusion Forcing（D2F）让训练时能看到多个噪声块，但推理时一个 running-set 实际只能装约两个块、相邻 slot 噪声比差距大，训练分布和推理分布天然错位。\n\nMBD-LMs 的招法分两步：Multi-block Teacher Forcing（MultiTF）把 Teacher Forcing 和 Diffusion Forcing 在「有界噪声组 + 干净前缀」条件下融合，用随机化噪声调度主动逼近 MultiBD 推理时的 heterogeneous slot-wise noise pattern——本质是把训练状态「故意」训练成推理状态的样子。Block Buffer 解码机制则保留 prefix cache 复用、保持输入 shape 不变，把多块并行度直接转成 wall-clock 加速，也是 TPF 从 3.47 跳到 6.19 的工程杠杆。\n\n这篇论文真正的意义是给 DLM 路线定了一个新坐标：以往 DLM 的瓶颈要么在数据量（iLLaDA 12T、Sumi 1.5T）、要么在解码算法（BlockPilot、FMLM+），MBD-LMs 把「训练分布 ≠ 推理分布」摆到台面，并用 MultiTF 做了 first-principles 的修正。LLaDA2-Mini-DMax 在不显著掉点的前提下把 TPF 推到 9.34，扩散 LM 已具备在常规推理栈里替换部分 AR LM 的吞吐基础。\n\n下一步关键是这套 MultiTF 后训练能否迁移到 10B+ 级别的 BD-LM，以及 Block Buffer 在 vLLM \u002F TensorRT-LLM 等生产推理框架里的实际落地。扩散 LM 离「工业级可用」还差最后一公里，但 MBD-LMs 让这最后一公里的地图变清晰了。","https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.29215","7437aeb9-930c-4866-a2e9-48003c1a792b",[10,14,17,20],{"id":11,"name":12,"slug":12,"description":13,"color":13},"7b67033c-19e6-4052-a626-e681bba64c7a","diffusion",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"0ef8513a-0a26-42f0-b6f9-5b6dadded45c","efficiency",{"id":18,"name":19,"slug":19,"description":13,"color":13},"01598627-1ea6-4b27-a5d8-874971571a71","llm",{"id":21,"name":22,"slug":22,"description":13,"color":13},"7e89b5cc-57db-4f37-bc6d-28919a73931c","model-release",[],"mbd-lm-multi-block-diffusion","2026-07-02T04:00:00Z","2026-07-02T04:09:06.970448Z","2026-08-19T02:08:40.142862Z",true,"agent",101,{"items":32},[33,38,43,48,53,58],{"id":34,"title":35,"news_slug":36,"published_at":37},"5878a668-282c-4b88-b2b8-7eef40b7938c","LFM2.5-2.6B：2.5GB 内存跑本机 Agent 220 tok\u002Fs","lfm2-5-2-6b-on-device-agent","2026-08-11T00:00:00+00:00",{"id":39,"title":40,"news_slug":41,"published_at":42},"06651fbd-69a7-42b7-adac-68fc5db5063e","Soofi S 30B 用 MoE + 混合架构挤进完全开源头名:德国把主权 AI 写进 3.2B 激活参数","soofi-s-30b-sovereign","2026-07-13T20:04:00+00:00",{"id":44,"title":45,"news_slug":46,"published_at":47},"222d6fbf-e9bc-4d63-8481-88ea28fd499c","Sber GigaChat 3.5 Ultra 开源：线性注意力 MoE 把长文本速度拉高 4 倍、模型尺寸砍半","sber-gigachat-3-5-ultra","2026-07-10T18:05:00+00:00",{"id":49,"title":50,"news_slug":51,"published_at":52},"d0d290cd-c169-495c-b0be-b559caa6eaa0","Grok 4.5 公众开放定档 7月9日:Musk 押注的不是参数,而是「Opus 级但更便宜」","grok-4-5-public-launch","2026-07-08T12:30:00+00:00",{"id":54,"title":55,"news_slug":56,"published_at":57},"4b31eff9-8ba6-4fa7-8d2c-787e9d5526b6","ELF 复读陷阱拆穿：连续扩散 LMs 的 Gen-PPL 跑分神话被一维向量按回 27.7","elf-repetition-trap-gen-ppl","2026-07-05T14:01:00+00:00",{"id":59,"title":60,"news_slug":61,"published_at":62},"1fe65909-67b4-4019-89fe-76eb4b226c41","Interfaze 把扩散解码塞进 ASR：diffusion-gemma-asr-small 用 42M 适配器撬开六语种开放语音识别","interfaze-diffusion-gemma-asr","2026-07-04T04:10:00+00:00"]