RL 后训练到底给模型带来了什么?Meta 团队 10 月 1 日挂在 arXiv 上的新论文(arXiv:2610.01509)给了一个不太体面的答案:它可能只是在「锐化」基座模型已有的行为——单次采样更准,解的覆盖面却在缩水。论文把这笔隐性代价命名为「锐化税」(Sharpening Tax),并给出了度量方法与补救方案。

反直觉的发现:base 模型配个轻 harness 就能打

论文的出发点是一个流行假说:RL 后训练只是把基座模型已有的行为磨得更锋利,提升 pass@1 的代价是 pass@K 下降。这个权衡此前在数学和代码任务上被反复观察到,大家默认它也会延续到 agentic 任务——毕竟多轮工具调用看起来更依赖后训练新学的能力。

实测结果正好相反。作者发现,预训练 LLM 配上一个轻量推理 harness,就能当个像样的 agent:虽然 pass@1 低不少,但只要给够测试时预算,base 模型的 pass@K 经常反超对应的后训练版本。换句话说,你花大价钱做的 RL 后训练,在「反复采样总能解出」这个维度上可能是负资产。

税的机制:任务被推向两个极端

为什么会这样?论文的机制分析给出解释:后训练把任务推向「总能解出」和「永远解不出」两个极端,以此换来采样效率和一致性,代价就是解的覆盖面。一边是广撒网总能捞到几条,一边是网眼变密、单网更准但漏掉的鱼更多。

为了量化这笔损失,作者提出 Sharpening Tax 指标,度量后训练之后测试时可扩展性的损失。实验规模不小:14 组 base/post-trained 模型对、4 个模型家族、3 个 agentic 基准,共 42 个案例。结论是这笔税在大多数设置下普遍存在,而且从少量 rollout 就能估出来,与其他指标的相关性也不错。

PTGS:按题调温,少交点税

光诊断不开药不算完整。论文最后给出 posterior-tempered group sampling(PTGS):一个即插即用的贝叶斯采样器,按每条 prompt 的估计难度自适应调整采样温度。在两个 agentic 环境的 RL 训练里,PTGS 比固定温度基线交的税更少——重复采样能解出更多任务,单发准确率也一并提升。

所以呢

这篇论文对三类人各有刺痛感。做评测的:只看 pass@1 会系统性高估后训练的价值,agentic 场景该补上 pass@K 视角。做选型的:如果你的场景能承受多次采样(批处理、离线任务、带验证器的重试回路),base 模型加轻 harness 是个值得认真跑的基线,未必输给官方后训练版。做后训练的:RL 配方里的采样温度不是可有可无的超参,它直接决定你交多少税——PTGS 这类按难度调温的策略,值得进默认配置。

论文地址:https://arxiv.org/abs/2610.01509(HF 论文页:https://huggingface.co/papers/2610.01509)