自回归 LLM 的命门是「逐 token 生成」:下一个词依赖上一个词,解码只能串行,GPU 再强也只能干等。投机解码用小草稿模型先猜再验,但草稿模型本身要训练、要显存,batch 一大加速比就垮。9 月 3 日挂上 arXiv 的论文《Unlocking Lossless Speedups in LLMs via Discrete Diffusion》(arXiv:2609.04010)给出第三条路:不动 AR 模型本体,给它外挂一组轻量 diffusion 权重,让多个 token 并行「抽」出来。作者来自 Institute of Foundation Models(IFM),合作方包括 Cerebras Systems 及多所高校。
两套权重,各司其职
论文提出 diffusion-augmented LLM 这一类新模型,把参数拆成两套:AR 权重照常用 next-token prediction 目标训练,负责质量;轻量 diffusion 权重负责一次并行生成多个 token。后者通过一个 Diffusion Distillation 阶段学出来,作者称对现有 LLM 训练管线的额外开销可以忽略。配套的 Ψ-Spec 采样器族从 AR 分布里并行采样,做到无损加速——输出仍服从原 AR 模型定义的分布,还支持在固定上下文长度下做推理时扩展。与投机解码最大的区别:不需要单独的草稿模型;与 diffusion LLM(d-LLM)的区别:不牺牲底层 AR 模型的质量。项目页对比图还显示,在附加参数量和推理显存上,Uno 都是受测方法里最低的一档。
8B 打 26B,Pareto 压制投机解码
实测结果两条。其一,Uno 在所有受测 batch size 下吞吐都高于主流投机解码方法(论文点名 DFlash 和 Eagle3),相对基础 AR 模型最高 3 倍加速——即便在设备支持的最大 batch 下也成立,项目页称之为对投机解码的 Pareto 支配。其二,论文自报 8B 的 Uno 在 agentic 工具调用、编码、长上下文推理的全部受测基准上,超过 26B 的 DiffusionGemma(论文称之为领先的开源 d-LLM)和闭源的 Mercury 2。这组数字目前是作者自测,尚待社区复现,但方向值得注意:加速不必再拿质量去换。
所以呢
Uno 可以从零训练,也可以直接给现有开源权重的 AR 模型「加装」,代码与 checkpoint 已开源(github.com/ifm-ai/uno)。这篇论文 9 月 8 日登上 HuggingFace Daily Papers 日榜首位。对推理 infra 团队的启示:diffusion 不一定要替换 AR,它可以作为并行解码的外挂件嫁接进现有技术栈——如果你在生产环境跑投机解码,这条免草稿模型的路线值得拉一遍 benchmark 对照。论文原文:arxiv.org/abs/2609.04010。