上周 NVIDIA Labs 把"harness 自动发现"这件事往前推了一大步:一组叫 SoL-Pi 的论文,作者里出现了 Enze Xie 和 Song Han,GitHub 已经攒到 2.26k stars。这套东西在 51 个任务的 EdgeBench 上跑下来,让 GPT-5.6 Sol 和 Opus 5 在不换底层模型的前提下,token 流量砍掉 44.7%-49.0%,API 成本直接省 1/3。
这到底是个什么东西?它不是新模型,是 coding agent 的"运行环境优化器"。论文的核心思想很直接:当 coding agent 从"监督式补全代码"走向"无监督全天候自我探索"之后,影响成本和稳定性的瓶颈不再是模型本身,而是 harness——也就是把 agent 串起来跑的那套脚手架(动作执行、上下文压缩、观察处理、委托读取这些机制)。SoL-Pi 用 RSI(Recursive Self-Improvement)的思路,在 harness 层做规模化自动研究:把尽可能多的不同环境接入循环,让 harness 自己通过多环境 rollout 学出可迁移的优化。
关键在于结果有数字可核。论文里给出的 EdgeBench 51 任务跑分,SoL-Pi 在 GPT-5.6 Sol 和 Opus 5 两个模型上的性能与 Pi 持平,但同时 token 流量降了 44.7%-49.0%。换算成 API 成本,每小时估算相对原生 Codex 和 Claude Code harness 能省 $8.75-13.50,相对 Pi 也能省 $4.36-5.71。这意味着如果你现在用 Claude Code 或 Codex 跑 24 小时无人值守 agent,SoL-Pi 是能直接落地的"省 token 套件",而不是又一个 benchmark 跑分漂亮但生产用不上的玩具。
最终从大量候选机制里被保留下来的有四个:action execution(动作执行)、context compaction(上下文压缩)、observation handling(观察处理)、delegated reading(委托读取)。这四个机制的共同点是——它们都直接打在 token 流量的主路径上。上下文压缩就不用说了,LLM agent 长跑最贵的就是这一段;委托读取是个不那么显眼但很关键的优化,把读文件/读网页这种 I/O 密集型操作从主上下文里挪出去,避免观察值把 prompt 撑爆;动作执行和观察处理则属于"每次循环都在跑"的微优化,单个省一点,堆起来就成了一半。
但也别把这想成万能解药。SoL-Pi 跑分是基于 51 个任务的 EdgeBench,这是 NVIDIA 自家评测集,模型只覆盖 GPT-5.6 Sol 和 Opus 5——这套优化在开源小模型(比如 Qwen3-Coder、GLM-4.6、Kimi K2.8)上能不能同样省 44% token,目前没有公开数据。换句话说,RSI 在 harness 层的天花板被 NVIDIA 这篇论文抬高了,但是否对所有模型族都适用,还要看接下来 NVlabs 的 follow-up 或者社区的复现。
为什么这件事不只是"NVIDIA 又发了一篇 paper"
另一个被低估的角度是 "harness 即研究对象"。在 SoL-Pi 之前,大家的目光都集中在模型权重和数据上;NVIDIA 这篇其实在悄悄拆解一个隐含事实——agent 系统的总成本里,harness 占比已经大到值得单独发论文的程度。Librarian bot 推送的相关论文里,openJiuwen、StarHarness、HarnessDev、Prime Agent、RSIAgent、PILOT、Hierarchical Self-Improvement 这 7 篇都是同主题,说明这个赛道已经在同时涌进好几家研究组。harness 优化的"model engineering"和"scaffold engineering"开始分家,这件事对做 agent infra 的同行意义很大。
GitHub 已经开源:https://github.com/NVlabs/SoL-Pi,项目页 https://nvlabs.github.io/SoL-Pi/。今天就能 clone 下来接你的现有 coding agent,先在 5-10 个真实任务上跑一遍,看 token 表是不是真的砍了一半。如果你的 agent 现在每个任务要烧几美金的 API 费,这一刀能直接砍回一块钱以内。
——下次再有人跟你说"agent 太烧 token",先别急着换小模型;把 harness 翻一遍,可能比换模型省得更多。