9 月 14 日,arXiv 上出现了一篇 54 位作者的技术报告:DeepCybo 联合中关村学院、中关村人工智能研究院的团队,发布了具身智能基座模型 PhysBrain 1.5,模型权重(2B 与 8B 两个规格)与评测工具链同步开源在 Hugging Face 与 GitHub 上。论文标题把野心写得很直白——"从视觉语言模型到物理基础模型"。

一个模型,三种能力

具身智能目前的常见做法,是给 VLM 外挂各种专用头:理解用一套模型,动作生成再接一个策略网络,世界模型又是另一个系统。PhysBrain 1.5 的路线恰好相反——理解、动作、预测共享同一个自回归骨架,用统一的 next-token prediction 目标联合优化,不做任务特定的输出头。

具体拆开看三层能力:

  • 具身理解:视觉空间感知、3D 与多视角推理、具身规划、指向与可供性定位、视觉轨迹推理;
  • 动作生成:用 ActionPiece token 预测末端执行器轨迹块,一套动作码本跨控制配置、跨机器人本体复用;
  • 未来状态预测:输出空间对齐的 RGB 图像、深度图与机器人掩码,直接"想象"动作执行后的场景。

这个设计对应论文里强调的"物理交互回路":观察驱动推理与动作,动作改变世界,更新后的观察再喂回下一轮交互。语言、动作、视觉三类 token 被编码为离散序列,在同一个 backbone 里联合训练。

数据与训练:人类交互视频当预训练监督

训练配方分两段。预训练阶段的具身监督完全来自人类交互视频——以任务为中心切片,把语义与空间上下文、恢复出的运动轨迹、后续观察配成对。之后通过监督微调适配,混合了人类演示、真实机器人轨迹与仿真经验三类数据。

底座选择上,PhysBrain 1.5 构建于 Qwen3-VL 之上。从通用 VLM 出发而不是从零训练,也解释了论文强调的另一点:模型在具身能力之外保留了通用多模态能力,没有为了刷具身分数而丢掉底座的基本盘。

跑分:28 项基准均分 72.5

技术报告在 28 项具身理解基准上做了评测,覆盖五大类:基础视觉空间感知、空间与多视角理解、具身认知推理与规划、空间定位与可供性、视觉轨迹推理。

  • PhysBrain 1.5-8B 综合均分 72.5(0-100 分制,28 项无加权平均);
  • 在被评测的开源模型中,14 项基准排名第一、10 项排名第二(含并列);
  • 论文同时给出对比:表现与 GPT-6-Astra、Gemini 3.6 Flash 等领先闭源模型相当

需要说明的是,这些成绩是团队技术报告的自报结果,评测虽配套开源了 PhysBrainEvalKit 工具链,第三方独立复现还有待时间验证;"追平闭源前沿"的对比同样出自官方评测框架内。2B 版本均分 66.6,官方仅作参考、未参与排名。

所以呢

具身基座赛道正处在"谁的 token 体系能统一感知-决策-预测"的竞赛里。PhysBrain 1.5 的答案是把三类输出压进同一套离散 token,用人类视频当免费监督——这条路线如果被独立复现坐实,"给 VLM 外挂专用头"的拼装式架构可能会加速退场。对研究者而言,2B/8B 权重、评测工具链、技术报告全套开放,复现门槛已经压到很低;下一个值得盯的问题,是 ActionPiece 这套跨本体动作码本能不能在更多构型的真实机器人上站住。

参考:arXiv:2609.14973(arxiv.org/abs/2609.14973)· GitHub: DeepCybo-PhysAI/PhysBrain-1.5