先说一个反直觉的数字对比:同一个 Claude Opus 5,在 ARC Prize 官方跑分里大约只能拿到 30% 的成绩;而 NVIDIA 的研究团队把它装进自己的 agent 架构 AVO 之后,这个模型在 ARC-AGI-3 公开集上解完了全部 183 关,RHAE 拿到 100.00。模型一个字没改,变的只是外面那层「壳」。
事件:AVO 刷满 ARC-AGI-3 公开集
8 月 21 日,NVIDIA 在技术博客公布:其长程自主 agent 架构 AVO(Agentic Variation Operators)在 ARC-AGI-3 基准的 25 个环境、183 个关卡全部通过,RHAE 分数 100.00,总共用了 6,624 次环境动作。作为对照,此前用同一模型(Claude Opus 5)完成同样 183 关的 VISTA 系统用了 7,542 次——AVO 少用了约 12% 的动作。
需要强调两点限定:这是公开集(public set)的成绩,不含半私有和私有的竞赛集;NVIDIA 自己也说明,AVO 与 VISTA 的对比不是受控消融实验,两套系统在观测表示、记忆管理、上下文管理等实现细节上都有差异。
ARC-AGI-3 测的是什么
ARC-AGI-3 是一个交互式推理基准:agent 进入完全陌生的游戏化环境,没有说明书、没有规则、没有目标,只能通过交互试探,推断环境动态和目标,并高效规划动作。RHAE 指标同时考核完成度和动作效率(相对首次上手的人类基线)。
有意思的是 AVO 的观测方式:LLM 全程只收文本——每个观测是一个精确的 64×64 文本网格,不发送任何图像或图像 token。而 VISTA 主配置用的是渲染的 512×512 PNG。同一批任务,两种完全不同的感知通道,最后都通了。
更早的战绩:七天自主优化 GPU 内核
AVO 最初是在软件工程任务上验证的。在注意力内核优化实验里,它连续自主运行了 7 天,探索 500 多个优化方向,提交 40 个内核版本,在 NVIDIA DGX B200 系统上,演化出的多头注意力内核比 cuDNN 快最多 3.5%、比 FlashAttention-4 快最多 10.5%。之后它只花了约 30 分钟的额外自主工作,就把内核适配到了 grouped-query attention。
支撑这种长程运行的是两个机制:持久记忆(保留历史实现、评估结果、编译器和 profiler 输出、积累的推理,让 agent 从当前状态续跑而不是反复重建搜索)和监督者(监测整体轨迹是否停滞、是否陷入无产出循环,必要时把主 agent 引向别的策略)。
真正的信息:能力是系统的属性
NVIDIA 的结论写得很直白:评估一个模型不等于评估一个 agent。模型能力当然重要,但决定这份能力能否转化为持续自主推进的,是外层的系统——记忆决定什么能留下来,工具决定哪些动作可行,反馈把进度锚定在现实上,恢复机制让工作能跨过单次模型调用延续下去。
团队还把 AVO 接到了 GPT-5.6 Sol 上做了小规模实验:在部分匹配关卡上,Sol 壁钟时间更快,Opus 动作数更少——不同模型呈现出互补的运行画像,系统性的对比留给了后续工作。
对行业的提示是:接下来一年,「agent 框架层」的工程价值可能被重新定价。大家都在卷模型参数和跑分,但把 30% 变成 100% 的,是记忆、监督、反馈循环这些看起来不起眼的系统设计。论文在 arXiv(2603.24517),原始报道见 NVIDIA 技术博客。
所以下次看到某个模型跑分不高,先别急着下结论——它可能只是还没遇到会用它的 harness。