推理模型有个长期被默认容忍的怪癖:不管题目难易,思考预算几乎一样。9 月 17 日挂上 arXiv 的 When2Think 论文(成均馆大学与微软合作,通讯作者来自微软)给了一个量化注脚:在 MATH-500 最简单的 Level 1 题目上,1.5B 的 R1-Distill 平均要写 1,199 个 token 才肯作答,而这些题几乎不需要推理;到了难题一侧,思考又常常不够用。
一刀切的「效率税」
现有省 token 方案多走两条路:统一长度惩罚,或刚性的 Think/NoThink 路由。论文把它们的共同代价称为「效率税」——简单题省了,难题精度跟着掉。在 AIME24 上,LC-R1 与 AdaptThink 都压低了推理成本,精度却分别下降 10.0 与 1.3 个百分点;AdaptThink 虽然只用了 5,806 token,Pass@3 跌到 44.7%,比基座模型还低。
按题分配:IDAC 奖励塑形
When2Think 把高效推理形式化成「按实例分配算力」:训练前先用参考策略对每道题预计算两个统计量——以参考准确率代理题目难度,以平均轨迹长度充当该题的 token 预算,再由 IDAC 项对超出参考长度的轨迹施加更强的奖励衰减。配合可验证奖励与批内标准化优势(BWS),整套 PPO 式优化不需要学习型 reward model、critic,也不需要在训练中在线查询参考模型。基座是 R1-distill-1.5B——DeepSeek-R1 蒸馏、Qwen2.5-Math-1.5B 的底子。
结果:省得多,还涨分
AIME24 上 Pass@3 从 46.0% 升到 56.0%,提升 10.0 个百分点,平均 token 少 3,959 个、降幅 27.9%;AIME25 拿到 40.0% Pass@3,按论文对比优于压缩类与纯路由类基线。行为层面的证据更细:Level 1 的平均 token 从 1,199 降到 619,精度保持 95.8%;Level 5 在保住精度的同时省下 2,276 个 token;面对 GSM-Plus 的对抗扰动样本,它反而主动多花 462 个 token,换来 6.3 个百分点的精度提升。Think 比例随难度从约 0.2 单调升到 0.7 以上——算力分配确实跟着难度走,而不是学会了新的一刀切。
所以呢
局限写得很直白:依赖可验证奖励,直接适用域是数学推理这类可判定对错的场景;难度估计靠离线参考统计,题目难度本身模糊时会失真;团队也承认更大模型自身推理效率更强,这种自适应控制的价值在 1.5B 尺度最显著。对工程侧的启发或许更实际——按题分配推理预算不需要在线额外查询,一次离线统计就够,推理成本敏感的 API 服务与端侧部署都可以直接抄这条思路。
参考:arXiv:2609.19671 https://arxiv.org/abs/2609.19671 · 论文页 huggingface.co/papers/2609.19671