机器人执行长任务时,最大的坑不是"不会做",而是"做了但不知道自己做得对不对"。视觉-语言-动作(VLA)模型能把画面和指令直接映射成机器人动作,但一个动作预测本身并不保证它在当前物理状态下合法,也不保证执行结果会被检查。9 月 1 日上传 arXiv 的论文(2609.01281)给出了一个工程答案:EmbodiedSkills,一个把编排、训练、部署统一进单一 agent 循环的 VLA 框架。
核心设计:技能决策变成"执行提案"
这个框架最有意思的设定,是它对待模型决策的态度:每一次技能决策都只是一个"提案"。运行时在执行前检查前置条件——所需的观测、计划、后端是否就绪;执行后再用新鲜观测做结果验证。整个过程被组织成六阶段循环:观察、规划、预检、执行、验证、恢复。一条共享的可执行技能接口把高层技能选择、有边界的低层 VLA 执行和动作后验证串在同一个循环里。
因为这个接口保持固定,低层 VLA 策略可以随时替换或适配,不用改动 agent 循环本身。这套接口还会把规划、执行、验证、恢复事件记录成结构化轨迹——它们既是各组件的训练监督信号,也能在有交互反馈的场景下支持可选的在线适应。论文配了 17 位作者,已开源在 GitHub(DCDmllm/EmbodiedSkills)。
数字说话:验证环节值 38 个百分点
实验基于 Qwen3-VL 与 OpenPI/pi0.5,在 RoboTwin 2.0 与 LIBERO 上验证。任务适配后的低层 VLA 策略在 RoboTwin 2.0 的 50 个任务上拿到 86.20% 平均成功率(每任务 100 episode,参考基线 pi0.5 为 82.74%),LIBERO 四个套件平均 97.40%(OpenPI 参考 96.85%)。
更关键的是消融:同样 50 任务、5000 episode 的受控对比里,完整 AgentLoop 是 86.20%;去掉中间验证,掉到 48.2%;用完整任务指令替代语义子任务,34.4%;把每个子任务限制为单次动作块,只剩 19.5%。也就是说,"执行后检查一下"这一步,单独值 38 个百分点。框架在四个依赖记忆的 RMBench 任务上平均只有 12.5%,论文没有回避:记忆仍是短板。
所以呢
这份工作把具身智能从"单步预测准不准"拉回到"系统闭环靠不靠谱"的问题上。86.2% 与 48.2% 之间的差距说明,对物理世界的长程任务,验证与恢复不是锦上添花,而是承重墙。对做机器人 agent 的团队,这份开源框架的可检查、可训练的 agent 层,是一个值得拆开看的工程参考——先把"做了没有"变成"做对了没有",再谈泛化。