扩散语言模型(DLM)的经济账一直很难看:不从零训练、直接改造一个现成的自回归(AR)模型,是公认的省钱路线。但 UT Austin 的一个六人团队注意到一个被整个领域绕开的错位——几乎所有 AR-to-DLM 适配研究都从全注意力 Transformer 出发,而现实中新一代开源模型早就不是纯全注意力了。

混合架构才是现实,但它对 DLM 适配不友好

Qwen3.5 的序列处理层里约四分之三是 Gated DeltaNet(GDN)这样的循环层,只有四分之一是注意力层。循环层天生是因果的——状态从左往右流,想让它「双向看」整个序列,结构上就说不通。这正是过去适配研究默认用全注意力 backbone 的原因:注意力层双向化是改个掩码的事,RNN 不是。

团队的解法反直觉地简单:不双向化 RNN。dQwen3.5 的改造只把注意力层改成双向,GDN 层原样保留因果结构,再配合 token shifting——让位置 k 的隐状态仍然预测位置 k+1 的 token,保持与 AR 预训练一致的读出对齐。

他们把 Qwen3.5 的 0.8B/2B/4B/9B 四个尺寸按同一套 recipe 改造,称为 dQwen3.5 家族;另把 Qwen3-1.7B(全注意力)改造成 trunk 参数量对齐的对照组。训练分 50B 和 100B token 两档,batch 512 序列 × 4096 token,bf16 精度。

数字:一半 token,以及 50B 打 580B

两个层面的结果值得记:

  • 效率:对照 trunk 对齐的全注意力对照组,混合 backbone 的 dQwen3.5-2B 达到同样训练损失只需要约一半 token。
  • 效果:dQwen3.5-9B 只用 50B token 改造,在与 Dream-7B(580B token)、Dream-Coder-7B(322B)、LLaDA-8B(2.3T、从零训练)的对比里,7 项基准拿了 4 项最高分;2B 版 50B token 在 7 项里 6 项超过用 200B token 训练的 CoDA。

诚实的另一面

在知识与代码的天平上,改造是有代价的:0.8B 上原版 MMLU 50.31,50B token 适配版 32.62——知识类掉得明显,代码类反而涨(HumanEval 22.56 → 28.05)。「训得越久越好」也不成立:50B 加到 100B,0.8B 上 7 项基准 5 项提升,9B 上只有 1 项。RNN 的因果结构也没有杀死 DLM 的灵魂:any-order 解码与全注意力 DLM 一致(局部 AR-ness 0.58–0.66,落在所有被测 DLM 同一区间),并行解码高加速比下 HumanEval 保持度还优于同规模对照。

开源与工程细节

dQwen3.5 全家族(0.75B/1.88B/4.21B/8.95B 四个 hybrid,加 1.72B 全注意力对照)都在 Hugging Face 的 UT-IFML 组织下开源,代码在 GitHub(AntonXue/dQwen)。使用门槛不低:需要 transformers≥5.13、flash-linear-attention 0.5.1;推理是整 canvas 一次解码、置信度阈值 tau=0.9 时提交位置,或用 block_length=32 做分块左到右解码。写稿时 9B 版月下载 543——当前状态数字,仅供参考。

所以呢

这篇论文的真正贡献不是刷分,而是把 DLM 适配研究从「全注意力惯性」拉回到「现实中真实流行的 hybrid backbone」。当 Jamba、MiniMax、Qwen 这些主流模型都在往 attention+RNN 混合架构迁移时,DLM 社区如果只会在全注意力模型上做适配,路线本身就是脱节的。现在这条断头路接上了,而且带着四个尺寸的开源权重和一套可复现的 recipe——对任何想低成本持有 DLM 的团队,这是目前最现实的起点。

(引用:arXiv:2609.20751 · UT-IFML/dQwen3.5-9B-Base