宇树 UnifoLM-OminiA-0.3:G1 上跑通"感知—行动"端到端大模型

7月20日,宇树科技发布 UnifoLM-OminiA-0.3,把视觉识别、语义理解、精细操作和设备控制四类能力,塞进一个端到端大模型,并在自家的人形机器人 G1 上跑出从感知到行动的完整闭环。 演示视频里,它能把抱枕放上沙发、识别药盒颜色数量并取出指定一盒、调节病床高度并对"停"指令即时响应。横跨"对话—识别—规划—执行"四个层面,过去要靠视觉、语音、决策、控制四套模型协同,现在一次性打通。 技术上,"全模态"终于从 PPT 走到 demo。该模型支持视觉、语音、动作指令联合输入,直接输出机器人运动控制指令,省掉传统 pipeline 的中间表征转换。在康养、家居这种强干扰、跨任务环境里,少一次模态转换就少一次误差累积,抗干扰能力自然水涨船高。 产业上有三层意义:把"物理 AI"从论文拽到硬件做闭环;具身智能终于有了可按 demo 评估的基线;这是国内少见的模型+硬件深度耦合的端到端方案,而不是只发 API 让人去接。当然,目前仍是 demo 级表现,长尾场景与对未知物体的泛化,都还需要大规模部署来检验。但 2026 下半年的具身智能赛道,玩家已从"我能跑"升级到"我能稳",宇树这一步,算是把门槛往上抬了一截。