魔法原子(MagicLab)在第十二届上交会(CSITF)首次把自研 Magic-VLA K02 大模型与 Magic-Mix 世界模型搬到真机做线下实操:MagicBot Gen1 人形机器人当众叠完衣服又叠完盒子,工作人员现场挪物体、改光线,机器人照样闭环跑完。

Magic-VLA K02 在架构上最值得说的是"分层式双系统联合架构"。高层是理解-生成统一模型做宏观规划,把用户抽象目标拆成"含关键结果图像的原子指令",并以动态记忆机制实时修正任务路径;低层把 VLM 主干网络和动态专家模块揉在一起,靠"潜在未来状态预测 + 扩散生成"输出平稳无抖动的连续动作。这套"规划与执行解耦"的设计打破传统 VLA"指令即动作"的线性模式——也让它能稳定拿下柔性物体、长链路精密操作。

训练侧,K02 走"海量第一人称视角预训练 + 少量机器人示范对齐"的四阶段分层路线,配"认知-执行-适配"三阶段推理流程。落地端引入元数据描述体系做跨本体适配,机械臂、人形机器人一模型通吃;分层约束 + 自适应容错把抓取失败、场景突变这类 corner case 兜住。

搭配上场的 Magic-Mix 世界模型把 WAM 环境解析引擎和 Creator 数据生成引擎绑成闭环,号称自主合成百万小时级高质量训练数据,把数据生产效率拉高万倍。当行业还在拼端到端 VLA 谁的指令跟随更强,魔法原子选了"分层 + 闭环数据"作为差异化路线——押的不是单点能力,而是把长序任务每一步都做对。