[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-4bb93e6c-a626-4e8e-b5f3-3ea3a15c8604":3},{"id":4,"title":5,"summary":6,"original_url":7,"source_id":8,"tags":9,"published_at":23,"created_at":24,"modified_at":25,"is_published":26,"publish_type":27,"image_url":13,"view_count":28},"4bb93e6c-a626-4e8e-b5f3-3ea3a15c8604","NVIDIA Molt 把 Agentic RL 训练栈打回 PyTorch 原生:一个异步循环训多模态 MoE,代码小到 LLM 一次读完","NVIDIA 把 Agentic RL 的\"训练-部署\"接口打回到 PyTorch 原生层,今天和 Hugging Face 一起放出了 Molt 框架。arXiv 2607.21653,7 月 22 日提交,GitHub 仓库 NVIDIA-NeMo\u002Flabs-molt 已开放。\n\n传统 Agent RL 框架是 trainer \u002F 分布式后端 \u002F rollout 三层叠加,每改一次算法都得串通整条流水线。Molt 反过来:整个 agent 就是个普通程序,一个异步循环就同时跑多模态与 MoE 策略,token、policy 版本、模型语义三件套在 rollout 与训练之间严格一致——保证模型绝不拿自己没生成过的 token 去更新权重。\n\n实现上,Molt 不绑 Megatron 也不绑 vLLM 任何特定栈,而是\"代码够小、够干净\",让 AI 编程助手能一次性读完整个仓库。在 matched 异步协议下,Molt 与基于 Megatron 的 SOTA 栈在统计意义上持平,leanness 几乎不付出性能代价。开源协议 + 现成 recipes + 容器一并提供,Agent RL 研究者不必再为分布式胶水代码发愁。\n\n值得注意的两点。第一,这是 NVIDIA 第一次把\"agent 本身是一段普通程序\"作为一等公民的框架,意味着 agent loop 里的工具调用、外部环境交互、长 horizon 决策可以无缝接进 RL 训练流,而不是外挂一层适配器。第二,async rollout + MoE + 多模态的组合,在 NeMo AutoModel 之后进一步把 NVIDIA 的训练栈推向\"全异步、原生 PyTorch\"的统一方向,大模型 RLHF\u002FAgent 训练开始摆脱对专用 RL 框架的依赖。\n\n落地价值:Molt 直接戳中\"Agent RL 复现难、研究迭代贵\"的老毛病。当框架小到能被 LLM 一次性理解,Agent RL 才能从少数大公司的工程壁垒变成普通实验室可重复的实验——这是 2026 下半年 Agent 走向规模化研究的关键基建。","https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.21653","7437aeb9-930c-4866-a2e9-48003c1a792b",[10,14,17,20],{"id":11,"name":12,"slug":12,"description":13,"color":13},"6ad31a14-c0da-42df-81fd-564281f768db","agentic-ai",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"01598627-1ea6-4b27-a5d8-874971571a71","llm",{"id":18,"name":19,"slug":19,"description":13,"color":13},"8dac812d-3839-4abe-a855-5f56ec9515fd","nvidia",{"id":21,"name":22,"slug":22,"description":13,"color":13},"b9bd9039-fcdb-41a8-b85b-fc1587def2b9","open-source","2026-07-28T03:00:00Z","2026-07-28T00:05:51.166843Z","2026-07-28T00:05:51.166852Z",true,"agent",4]