[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-beec1ff3-22af-4657-b58a-90cb0797c3b1":3},{"id":4,"title":5,"summary":6,"original_url":7,"source_id":8,"tags":9,"published_at":23,"created_at":24,"modified_at":25,"is_published":26,"publish_type":27,"image_url":13,"view_count":28},"beec1ff3-22af-4657-b58a-90cb0797c3b1","PyroDash 让小模型「借力」大模型推理：把 LLM 调用砍到 1.9%，成本从 $49 降到 $1.78","arXiv 2607.20327 上线的 PyroDash 提出了一种 token 级的小-大模型协同推理框架:在小模型生成过程中插入一个「求助控制 token」,触发一次性 hand-off 把难题扔给冻结的大模型完成。核心思路是把「什么时候该花大钱调用 LLM」这件事内化到 SLM 自身,不再依赖外挂路由器,也不需要重新训练 LLM 或访问其 logits。训练分三阶段走:控制 token embedding 学习 → offloading-oriented SFT → 用 GRPO 做 cost-aware 对齐,奖励函数直接把推理成本和答案准确率绑在一起。在 5 个数学推理 benchmark 上,λ=0.05 时平均准确率 64.04%,比纯 LLM 基线还高 6.36 个百分点,成本砍掉 20.4%;λ=0.6 时准确率降到 54.55%,但 LLM token 占比仅 1.9%,单样本 LLM 调用 0.012 次,平均推理成本从 $49.36 降到 $1.78。这套思路的真正价值是把「按需升级」做成可学习的策略,而不是工程上的硬路由:小模型自己知道什么时候算不下去了,学会了精确举手。给生产部署的启示是,在保留 LLM 推理能力上限的同时,可以把大部分低难度请求甩给廉价 SLM 处理——这是 routing 论文里一直在画的大饼,但 PyroDash 用一个 control token 加 GRPO 的方式真正落了地。论文 73 页,代码和数据未公开,需要更多独立复现来验证阈值和奖励函数在不同领域的迁移性。","https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.20327","7437aeb9-930c-4866-a2e9-48003c1a792b",[10,14,17,20],{"id":11,"name":12,"slug":12,"description":13,"color":13},"7ac06d8e-b074-4147-abfc-ffaa4c6b8744","ai-efficiency",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"fca9258a-9430-455a-b95d-b9fae5e373a8","ai-inference",{"id":18,"name":19,"slug":19,"description":13,"color":13},"0a93ec8e-ea39-4693-81de-563ca8c173f7","inference",{"id":21,"name":22,"slug":22,"description":13,"color":13},"01598627-1ea6-4b27-a5d8-874971571a71","llm","2026-07-24T00:00:00Z","2026-07-23T16:06:26.285299Z","2026-07-23T16:06:26.285322Z",true,"agent",3]