温度这个参数,在大多数 LLM 部署里只是个推理侧旋钮:调高一点,输出更发散;调低一点,更保守。9 月 27 日提交到 arXiv 的一篇论文把它拽进了训练回路——美团与中国科学院团队提出的 TGRL(温度分组强化学习)用「高低温度对比」直接产出训练信号,论文称同等采样预算下,RLVR 训练达到同等精度最多快 36%,CodeForces 评分提升 196.7 分。论文已被 NeurIPS 2026 接收为 Poster,代码同步开源。

探索,RLVR 最贵的那部分开销

可验证奖励强化学习(RLVR)是当前推理模型训练的主流配方:数学题、代码题有标准答案,奖励信号清晰。但探索效率一直是瓶颈。想让学生模型见到更多样的解法,常规手段是调高采样温度或做 test-time scaling——论文指出,这两条路要么在采样时直接扩大 rollout 预算(训练成本随之上涨),要么让「探索到底有没有用」停留在不可量化的状态。温度调高了,轨迹确实更多样,但优化器并不知道这些多样性里哪些值得奖励、该把功劳记在哪个 token 头上。

方法:先按温度分组,再落到 token 信用

TGRL 的做法分两层。第一层,同一个 prompt 的 rollout 组被划分成低温度子集和高温度子集,两组的奖励对比用来估计这一轮的探索增益——高温组比低温组多赚到的奖励,就是「探索值得做」的直接证据。第二层,这个组级信号被分配成 token 级信用:对同一份 logits 按两种温度缩放出 next-token 分布,计算两者的 Jensen-Shannon 散度,散度大的位置正是温度真正改变决策的地方,信用就落在那里。整条链路没有扩大 rollout 预算——分组复用的本来就是原本要采样的那些 rollout。

数字:11 个基准,同预算快 36%

作者报告的结果覆盖 11 个基准:32B 规模上六个数学基准平均分提升 1.6%,CodeForces 评分提升 196.7 分,LiveCodeBench Pass@16 提升 4.4%,ALFWorld/WebShop 成功率分别提升 6.3% 和 4.9%。机制消融呈现清晰的两段式增益:Qwen3-14B 上,高温 GRPO 基线 67.0 分,加入混合温度分组后 68.2,再加 JS 信用分配(TGRL 完整版)到 69.4;Qwen3-32B 上是 66.2 → 67.8 → 70.2。需要说明,以上数字均为作者在论文与代码仓库中的自报口径,目前还没有第三方独立复现。

工程侧的信号

代码基于开源分布式 RL 框架 verl 构建,仓库依赖清单里同时有 SGLang 相关与 NPU 相关的文件,联系方式给出美团邮箱与中科院自动化所邮箱。作者阵容横跨中国科学院大学、美团与中科院自动化所 MAIS & NLPR,两位共同一作、两位通讯作者,论文署名共 7 人。对一个被 NeurIPS 2026 收为 Poster 的方法来说,开源加上主流框架适配意味着复现门槛不高,接下来值得盯的就是第三方复现结果。

对正在跑 RLVR 训练的团队,这篇论文的启示很直接:采样温度不必只是一个超参,它可以被当成免费的多样性来源,量化之后反哺训练。当整个行业都在为探索付出真金白银的算力时,把「已经花掉的采样」榨出第二份价值,可能是当下最划算的效率故事。

原文:arXiv:2609.33589(https://arxiv.org/abs/2609.33589),代码:github.com/1229095296/TGRL