过去两周 NVIDIA 的 AI 新闻几乎全被 AVO 刷屏:8 月 22 日,这套 Agent 系统在 ARC-AGI-3 上拿到满分 100,清掉全部 183 个关卡,不少人把它当成"模型又变强了"的证据。但同一家公司 7 月 30 日悄悄开源的另一个项目——Python Agent 框架 NOOA(NVIDIA Object-Oriented Agents),被大多数人直接跳过了。这两件事其实指向同一个判断:模型之上的执行层,正在成为能力提升的主战场。
NOOA 是什么:把 Agent 折进一个 Python 类
NOOA 的全称是 NVIDIA-labs Object Oriented Agents,Apache 2.0 许可证,pip install nooa 即装。它的核心设计可以用一句话讲完:Agent 不是一堆配置文件和回调,Agent 就是一个 Python 类。类上的字段是状态,普通方法是确定性的能力,docstring 就是提示词,类型注解就是输入输出契约;而那些函数体只写 ... 的方法,会在运行时交给 LLM 驱动的循环去实现。模型是可插拔的——通过 LiteLLM 支持 Anthropic、OpenAI、Ollama、vLLM 等主流后端,换底座不用改 Agent 代码。
这个设计的直接收益是工程性的:Agent 可以像普通 Python 对象一样被测试、追踪、重构和版本管理。对任何一个维护过 prompt 目录加工具 schema 加回调配置三件套的团队来说,这个减法很有吸引力。
82.2% 的另一面:token 账单砍半
成绩单上最硬的数字是 SWE-bench Verified 82.2%。第三方报道给出的对照更能说明问题:达到这个分数,NOOA 每个任务平均消耗约 110 万 token、调用约 28 次模型,而同类框架普遍在 220 万 token、66 次调用左右——大约是前者一半的量级。marktechpost 与 aiweekly 等多家媒体的报道相互印证了这一组数字。另外据 aitoolsrecap 的评测记录,NOOA 还报告了 CyberGym L1 86.8% 和 ARC-AGI-3 85.1% 的成绩;不过这些是厂商自报数字,且框架尚处 v0.0.8 alpha 研究预览阶段,读的时候留一分保留。
值得强调的是,82.2% 是 NOOA 框架搭配 GPT-5.5 跑出来的。也就是说,同样的模型,换一个组织方式更干净的 harness,分数和成本可以同时改善——这正是 AVO 满分故事的同款逻辑:模型没换,换的是外面包的那一层。
为什么"抽象"值得当新闻看
NOOA 值得关注的点不在跑分,而在它把行业里一个越来越响的共识摆上了台面:Agent 的可靠性瓶颈,很大一部分不在模型,在接口组织方式。现有框架把提示词、工具、回调、工作流拆成四个独立抽象,每多一层胶水就多一分出错面;NOOA 把它们压回 Python 原生的类语义里,让"写 Agent"回归到"写软件"。GitHub 上 1.9k star 的早期热度说明社区对这个方向有真实兴趣。
当然要泼一盆冷水:README 明确警告 NOOA 是研究软件,Agent 会执行 LLM 生成的代码,进程内的 AST 校验和模块黑名单只是防御纵深,真正的隔离边界必须靠容器、VM 这类操作系统级沙箱。想上生产的话,先读安全章节。
给读者的"所以呢"
接下来选型的时侯,与其问"哪个模型最强",不如先问"我的 harness 配不配得上我的模型"。NOOA、AVO 这一轮演示的共同结论是:同一个模型,套上不同质量的执行框架,能差出一条及格线。框架层开源、可审计、可替换,它值得拿到和模型选型同等的注意力——这可能是近期最被低估的一条选型线索。