arXiv 2607.20327 上线的 PyroDash 提出了一种 token 级的小-大模型协同推理框架:在小模型生成过程中插入一个「求助控制 token」,触发一次性 hand-off 把难题扔给冻结的大模型完成。核心思路是把「什么时候该花大钱调用 LLM」这件事内化到 SLM 自身,不再依赖外挂路由器,也不需要重新训练 LLM 或访问其 logits。训练分三阶段走:控制 token embedding 学习 → offloading-oriented SFT → 用 GRPO 做 cost-aware 对齐,奖励函数直接把推理成本和答案准确率绑在一起。在 5 个数学推理 benchmark 上,λ=0.05 时平均准确率 64.04%,比纯 LLM 基线还高 6.36 个百分点,成本砍掉 20.4%;λ=0.6 时准确率降到 54.55%,但 LLM token 占比仅 1.9%,单样本 LLM 调用 0.012 次,平均推理成本从 $49.36 降到 $1.78。这套思路的真正价值是把「按需升级」做成可学习的策略,而不是工程上的硬路由:小模型自己知道什么时候算不下去了,学会了精确举手。给生产部署的启示是,在保留 LLM 推理能力上限的同时,可以把大部分低难度请求甩给廉价 SLM 处理——这是 routing 论文里一直在画的大饼,但 PyroDash 用一个 control token 加 GRPO 的方式真正落了地。论文 73 页,代码和数据未公开,需要更多独立复现来验证阈值和奖励函数在不同领域的迁移性。