投机解码已经是大模型推理加速的标配:轻量草稿模型先拟一串 token,目标模型并行验证,接受得越多赚得越多。但草拟器该走哪条路线,社区长期横跳在两派之间——神经草稿(EAGLE3 一类)全场景稳,上下文复制(PLD、CopySpec 一类)在重复密集的场景更快。9 月 17 日提交到 arXiv 的论文《To Copy or Not to Copy》给出第三条路:别在文本表面猜,直接去问模型自己。

复制赚钱,误复制交税

上下文复制的逻辑很朴素:接下来要输出的内容如果上文出现过,直接抄过来让目标模型验证,几乎稳赚。论文图示里,模板化的「正数分解」输出,复制草稿一把接受 20 个 token,神经草稿只接 2 个。反过来,表面 n-gram 撞上了、模型其实没有复制意图时,复制草稿会吃 0 接受,而神经草稿同位置能接 8 个——草拟加验证的算力全白烧。作者测量后发现,在推理密集型任务里,这类假阳性触发占全部复制尝试的 50% 以上。换句话说,复制策略一半以上的开销花在了错误的地方。

在模型内部装一个「抄写意图探测器」

SwitchSD 的核心是一个轻量线性探针,直接读目标模型隐藏层表征里的复制意图。训练标签的构造比较讨巧:先用 Claude Sonnet 生成 1,000 条带多样化重复结构的 prompt,让目标模型补全,凡是「连续至少 5 个 token 与上文逐字重合」的位置就标为复制实例,一次拿到数十万个 token 级标注。探针在所有层上逐层训练,按验证集 F1 贪心选最优层(Llama-3.1-8B 上选出第 14 层),对复制意图的识别 AUC 超过 0.99。解码时每个位置先问探针:要抄吗?要抄就走复制路径,同时要求当前 5-gram 在上文真实出现过;不抄就交回神经草稿(SPS 或 EAGLE3)。

三张表:稳定压过 EAGLE3

在 Llama-3.1-8B-Instruct、Llama-3.3-70B-Instruct、Qwen3-8B 三个模型,Math500、HumanEval、CNN-DailyMail 三类任务上,SwitchSD 全面压过 EAGLE3。以 8B 模型为例:HumanEval 加速比 2.58× 对 2.28×,Math500 2.29× 对 2.05×,CNN/DailyMail 2.01× 对 1.85×。论文口径是对 EAGLE3 这类最强基线最高再提 15% 吞吐;且投机解码本身无损,生成结果与原始模型逐 token 一致。

所以呢

这篇论文最值得记的点不是又一个加速比,而是把「模型内部状态可以当控制信号」用进了解码循环这个工程最前线。作者在结论里把方向说得更直白:同一套探针框架未来可以预测最优投机长度、在多个专用草稿模型之间做路由。冷水也要泼:论文页暂未放出代码仓库,探针跨新模型的迁移成本、真实 serving 环境的端到端收益,都得等复现检验。思路已经立住,工程化才刚起步。

参考:arXiv:2609.20186 https://arxiv.org/abs/2609.20186