过去两年我们见过太多「AI 发现 AI」的演示视频:AlphaEvolve、FunSearch、Atria Dawn,每一条都把 Coding Agent 推上几千条 rollout 来硬碰硬。但在 arXiv:2609.14858 上,UMD、Google DeepMind、UVA 联合发布的 Dream-RSI,选择了一条完全反过来的路:用一次昂贵的在线探索,换一千次几乎零成本的「离线做梦」,把 RSI(Recursive Self-Improvement)的成本曲线直接压扁。
怎么理解「做梦」
作者把已经跑过的发现过程看成一张「历史树」:每个节点是一次生成-评估尝试,记录 prompt、代码、分数、执行反馈。一旦这张树被存下来,它就是一个经验意义上的「可重放模拟器」——所有节点的 outcome 都已经测过,所谓「做梦」只是在树里换一条路径,选不同的分支、并行度、停止时机,直接读结果,不用重跑 Agent。
这跟 model-based RL 里的 World Model 一脉相承:用经验数据拟合 dynamics,再在梦里评估策略。区别在 Dream-RSI 没训新世界模型,直接把真实历史当成世界。一次昂贵 online rollout,撑起几千次 zero-execution-cost 的策略评估。
三段式闭环
论文把它画成三段式循环:
第一段 Online Explore:当前策略指挥一个固定的 coding agent 在新任务上跑一轮,产出新节点、扩充历史树。第二段 Construct Replay Simulator:把上一轮的历史树整理成可重用的 simulator pool。第三段 Dreaming-based Policy Improvement:在 simulator 里同时跑出上千个候选策略,用 off-policy 反馈筛出最好的那个,回滚部署,继续下一轮。
只有策略代码被改写,底下的 LLM、evaluator、execution interface 都不动。这跟 DeepSeek Harness、OpenAI 的 agentic 拆分一脉相承,差别是 Dream-RSI 把「策略本身」当成了可优化的对象,而其它工作只把 prompt 或 harness 当成可插拔组件。
162× 这个数字怎么来的
Lasso 路径求解是论文里最硬的任务:给定 λ 序列,要在 R^(n×p) 的特征矩阵上解一系列凸优化,与 sklearn 的 coordinate descent 比速度,跟 SimpleTES、ShinkaEvolve、PaceEvolve 等演化框架比 agent call 数。
Dream-RSI 在保持对 sklearn 精度的同时,把 SimpleTES 需要的 agent 调用次数压到 1/162(对固定探索基线也有 1.7× 的节省)。在数学优化任务(sum-difference、autocorrelation、circle packing)上,50000 预算换 1000 代内就匹配或超过强基线,比 SimpleTES 节省 50× 预算。KernelBench 上,1.79× 到 2.43× 少用 generation 数就够追到目标速度,同等预算下 kernel 性能提升最多 2.09×。
关键:162× 不是单一指标上的 trick,而是「在历史里做梦」这个机制给整张成本结构带来的杠杆。底层 agent 调用一次的成本(API 费 + 延迟)越高,这个杠杆被放大得越大。
怎么不重蹈「local optimum」
Dream-RSI 在 prompt 里直接写了三条防呆:必须读完所有历史 proposal 再写新的、失败要分清是 core idea 失败还是 implementation slip、连续同类小改就要主动换个 mechanism。这种「先读、再思、勿重复」的硬约束,等于把 Darwin Gödel Machine、Hyperagents 那批「自我改写智能体」的探索纪律固化进了策略层。对 online 探索阶段本身常见的「越跑越窄」是个直接补救。
它能拿来干什么
最直接的用处是任何「在线试错贵、试错又需要被自己反复评估」的场景:GPU kernel autotuning、组合优化、math olympiad program search、MoE 路由调参。论文里 8 个任务横跨三个域,验证了这条「历史就是模拟器」的路子,跨域可迁移。
它不是让 AI 写 AI,它让 AI 反思 AI 已经写过什么,然后少写 162 次。
这跟 OpenAI 把 RSI 当成资本开支故事不同——Dream-RSI 不需要把推理侧算力继续堆高,而是把单次推理的边际信息量榨干。对正在被 inference 算力压得喘不过气的团队,这条路径比单纯做更长的 rollout 更值得复刻。