Agent 圈有个共识正在成型:同一个冻结模型,换一套由提示词、控制流、工具与记忆管理组成的「外壳」(harness),能力能差出一大截。于是越来越多人让 agent 自己改自己的外壳——迭代提出修改、跑分选优,相当于在系统层做递归自改进(RSI)。Google 团队 9 月 21 日放出的论文 RRSI 给这条路线泼了一盆冷水:这么进化出来的外壳,很可能只是在背题。
病根:外壳进化会过拟合
论文先给诊断:围绕冻结模型反复进化 harness 收益明显,但递归演化会过拟合——外壳记住了训练任务,在分布内基准上涨分巨大,一旦换到分布外(OOD)基准,涨幅会缩水甚至消失。这和深度学习里「模型背训练集」是同构的问题,只是对象从权重换成了提示词与控制流。
双端正则化:一边限改,一边剪枝
RRSI 的解法是把正则化原则嵌进进化循环的两端。提案端(proposer)使用随时间退火的预算,限制单个候选能捆绑多少条独立修改;它还以完整修改历史为条件,已被证伪的假设不会被重复提出,进化停滞时会被引导去尝试从未动过的组件。选择端(selector)配备 critic 与 pruner:critic 在评测前筛掉针对特定基准的投机逻辑,pruner 移除改动太小、太贵或已无用的部分。GitHub README 还补充了两条细则:噪声调整的地板会拦住评测方差以内的「涨分」,成本规则要求新增的推理 token 必须由实测收益支付。
数字:OOD 涨 4.7 分,token 省 30%
在覆盖编码、agentic workspace 与工程设计任务的 8 个基准上,RRSI 在进化所用的数据划分上最高涨 14.1 分,在 5 个分布外基准上最高涨 4.7 分,产出的外壳比无正则化进化少用 30% 的 policy token——更通用,还更便宜。同一套循环驱动三个实例:终端 agent(Terminal-Bench 2.1)、文档工作 agent(Harvey LAB)与工程设计 agent(EngDesign)。论文发布当天即登顶 Hugging Face 日榜。代码与项目页均已放出:仓库 google-research/rrsi,项目页 regularized-rsi.com。
所以呢
这篇论文的价值不在涨分本身,而在把一个工程直觉变成可复现的方法论:harness 优化是一场搜索,搜索就需要正则化——从深度学习借来的老思想,在 agent 系统层重新生效。回头看赛道邻居:DeepSeek 开源了可插拔的 Harness 插件栈,NVIDIA SoL-Pi 用外挂 harness 砍 token,HarnessDev 干脆让 LLM 自建外壳来考。大家都默认「外壳值得被系统化优化」,RRSI 补上的一环是:优化过程本身也会过拟合,也得防。对做 agent 工程的团队,这是个直接提醒——如果你的 agent 调优只在一个固定评测集上越调越高,先怀疑它在背题,再怀疑它真的变强了。
参考:论文 arXiv:2609.24972(https://arxiv.org/abs/2609.24972);代码 https://github.com/google-research/rrsi;项目页 https://regularized-rsi.com/