2026 年 7 月 22 日,高德宣布 ABot 具身体系全栈升级,一次性发布 N1、M0.5、ER、AgentOS、C0 五款模型,在 17 项基准拿下 SOTA。五款模型对应机器人"脚、手、感官、中枢、运动神经",把"操作系统思维"搬进具身智能。

最值得拆的是 ABot-M0.5(arXiv:2607.00678),提出统一移动-操作世界动作模型(WAM)。论文点 VLA 三大硬伤:反应式、无显式世界建模、长程 rollout 累积误差。解法是"三层对齐":中间潜动作桥接视频潜变量与控制信号;双层 Mixture-of-Transformers 解耦"底座+机械臂"两个异构动作子空间;dream-forcing 训练策略在模型预测视频上渐进式训练逆动力学,把训练-推理分布对齐。M0.5 在长程任务成功率和细粒度控制精度上同时 SOTA。

剩四款按 OS 摆位:N1 脚(导航)、M0.5 手ER 感官C0 运动神经AgentOS 中枢——把前四个串成长程闭环。模块独立可换,谁先升级谁,不用整体重训。

对赛道意义:过去两年大家在拼"端到端 VLA 一锅烩",ABot 解法是承认模块化仍有效,但接口必须由潜动作和世界模型这种"软总线"定义,而不是 SLAM/Semantics/Planning 的硬接口。代码已开源(github.com/amap-cvlab/ABot-Manipulation)。具身的"GPT 时刻"还没到,把 OS 层先搭起来,比堆参数更接近落地。