NVIDIA Molt 把 Agentic RL 训练栈打回 PyTorch 原生:一个异步循环训多模态 MoE,代码小到 LLM 一次读完

NVIDIA 把 Agentic RL 的"训练-部署"接口打回到 PyTorch 原生层,今天和 Hugging Face 一起放出了 Molt 框架。arXiv 2607.21653,7 月 22 日提交,GitHub 仓库 NVIDIA-NeMo/labs-molt 已开放。 传统 Agent RL 框架是 trainer / 分布式后端 / rollout 三层叠加,每改一次算法都得串通整条流水线。Molt 反过来:整个 agent 就是个普通程序,一个异步循环就同时跑多模态与 MoE 策略,token、policy 版本、模型语义三件套在 rollout 与训练之间严格一致——保证模型绝不拿自己没生成过的 token 去更新权重。 实现上,Molt 不绑 Megatron 也不绑 vLLM 任何特定栈,而是"代码够小、够干净",让 AI 编程助手能一次性读完整个仓库。在 matched 异步协议下,Molt 与基于 Megatron 的 SOTA 栈在统计意义上持平,leanness 几乎不付出性能代价。开源协议 + 现成 recipes + 容器一并提供,Agent RL 研究者不必再为分布式胶水代码发愁。 值得注意的两点。第一,这是 NVIDIA 第一次把"agent 本身是一段普通程序"作为一等公民的框架,意味着 agent loop 里的工具调用、外部环境交互、长 horizon 决策可以无缝接进 RL 训练流,而不是外挂一层适配器。第二,async rollout + MoE + 多模态的组合,在 NeMo AutoModel 之后进一步把 NVIDIA 的训练栈推向"全异步、原生 PyTorch"的统一方向,大模型 RLHF/Agent 训练开始摆脱对专用 RL 框架的依赖。 落地价值:Molt 直接戳中"Agent RL 复现难、研究迭代贵"的老毛病。当框架小到能被 LLM 一次性理解,Agent RL 才能从少数大公司的工程壁垒变成普通实验室可重复的实验——这是 2026 下半年 Agent 走向规模化研究的关键基建。