并行推理正在成为推理模型的标配:同一道题开多条分支各自解,再投票选答案,准确率确实上去了。但代价也是实打实的——开几条分支,算力就翻几倍,而且大多数方法里所有分支都要跑到底才算数。上海交大团队 8 月 17 日挂在 arXiv 上的 ParaTempo,给这个问题提供了一个相当干净的解法:不训练、不改模型,只靠一个叫「时间置信度」的信号,把并行推理的开销砍下来一大截——平均延迟降 21.8-32.2%,总 token 用量降 18.1-30.3%,精度保持竞争力。
老问题:控制信号要么太迟,要么太噪
先看他们攻击的痛点。管理并行分支的已有方法,大多依赖三类信号:最终答案共识(要等所有分支跑完才知道谁对)、局部 token 置信(单个 token 的概率,和推理真实进展关联弱)、孤立的中间探测(噪声太大,撑不起分支级的动态控制)。这三类信号共同的毛病,论文的概括是:延迟、与推理进展脱节、噪声大。而分支级的调度——什么时候砍掉一条分支、什么时候提前收工——需要的是一个既便宜又能实时跟上推理进度的信号。
时间置信度:一个信号驱动四个动作
ParaTempo 的核心是 temporal confidence(时间置信度),一个分支局部的「答案空间收敛度」度量。做法是:周期性地让每条分支给出一个试探性的答案概率分布,然后量化最近的中间探测有多集中在同一个主导答案上。一条分支反反复复都指向同一个答案,说明它已经收敛;答案还在漂,说明它还没想清楚。
有了这个信号,ParaTempo 的整个控制流程都由它驱动,共四个动作:置信度低的分支直接剪枝;持续锁定同一主导答案的分支提前退役,不再烧 token;腾出来的算力通过 fork 新分支再分配;一旦置信度加权的投票集中,全局停止生成。全程不需要分支之间同步——这是个异步框架,每条分支按自己的节奏收敛。
值得强调的是 training-free 这一点:不动模型权重、不需要额外训练,理论上可以直接套在现成的大推理模型外面当调度器用。论文还顺带验证了信号本身的质量:相比 token 级和瞬时信号,时间置信度的时间稳定性更强,对未来分支收敛的预测力也更好。
效果与边界
在数学和科学推理基准上,ParaTempo 把平均延迟降 21.8-32.2%、总 token 用量降 18.1-30.3%,同时保持有竞争力的准确率。注意论文的措辞是 "maintaining competitive accuracy"——是「有竞争力」,不是「零损失」;对生产环境来说,用三成延迟换一个可接受的精度取舍,这笔账通常算得过来。
边界也直说:这套机制的前提是「答案分布会收敛」。对答案空间本来就发散、或需要长链条多步验证才能收敛的任务,时间置信度这个判据会变弱。另外它是推理时的调度框架,不解决模型本身的能力上限。
代码和数据集已开源(github.com/ScottZhang812/ParaTempo),论文见 arXiv:2608.16425。
所以呢
推理成本战打到今天,注意力大多集中在模型侧:蒸馏、量化、MoE。ParaTempo 代表另一条路——推理调度侧的免费午餐。一个外挂的、免训练的分支调度器,不动模型就能省三成开销;对任何已经在跑并行推理(best-of-N、自一致性投票)的服务来说,这类调度层优化可能是 ROI 最高的一档。「推理效率」的视野,值得从模型内部挪一点到推理编排层。